ai-powered-markdown-translatorArtikel översatt från franska till svenska med gpt-6.1-sol.
Google Cloud presenterade Gemini-agenten den 8 oktober på Gemini at Work 2026: en enda agent för allt arbete i företaget, som körs kontinuerligt i molnet och orkestrerar både Gemini-modeller och Claude-modeller. HeyGen lanserar samtidigt HeyGen Voice, sin första egenutvecklade röstmodell, som tar förstaplatsen i Artificial Analysis Controlled Voice-rankning, medan Anthropic öppnar workflows i Claude Managed Agents som kan starta upp till 1 000 agenter per körning. På kodsidan lär sig Codex att förutse användarens nästa meddelande och får under Windows en ny sandbox baserad på Microsoft Execution Containers.
Google Cloud lanserar Gemini-agenten, en enda agent för allt arbete
8 oktober — På Gemini at Work 2026 presenterade Google Cloud Gemini-agenten, som företaget beskriver som en enda universell agent för arbete. Från ett enda inmatningsfält och ett enda API svarar den på frågor, utför kunskapsarbete, skapar bilder och medier samt skriver och kör kod. Idén som Thomas Kurian, vd för Google Cloud, för fram: man ger den ett mål snarare än en följd av instruktioner.
Agenten körs kontinuerligt i molnet, med ett enda minne, och finns överallt: webben, iOS, Android, Windows, Mac, kommandoraden, Google Workspace, Microsoft 365 och Slack, eller utan gränssnitt (headless) i tredjepartsapplikationer. En uppgift som tar flera timmar eller dagar fortsätter även när datorn är stängd. För långvariga uppgifter skapar den tillfälliga underagenter med varsin identitet, och den kan bli en agentkollega (coworker agent) med en permanent roll, en egen @agents.company.com-adress och egen lagring. Modellen blir ett separat val: enligt Google orkestrerar agenten redan Gemini-modeller och Anthropics Claude-modeller, och andra privata och öppna modeller ska följa. Branschspecifika varianter kommer som förhandsversioner för finans (över 50 grundläggande skills, som redan används av CME Group och Deutsche Bank) och juridik.
| Presenterad kontrollkomponent | Roll enligt Google |
|---|---|
| Varje agents identitet | Kryptografiskt verifierad identitet, rollbaserade behörigheter, granskningslogg i agentens namn |
| Agent Sandbox | Isolerad körning med en egen nätverksgräns |
| Agent Gateway | Nätverksbrandvägg för AI, som all agentens trafik passerar genom |
| Utgiftstak i realtid | I Cloud Billing pausas projektets agent, återupptas med ett klick |
Google Cloud presenterar också sina siffror: nära 500 kunder har var och en bearbetat över 1 000 miljarder tokens på ett år, och nära 90 % av Fortune 100 använder Gemini Enterprise. Inlägget anger däremot varken ett tillgänglighetsdatum eller ett pris för själva agenten; Google Cloud nämner bara stora kunder som har testat den i förväg, som sportmärket On för dynamiskt modellval.
🔗 Gemini at Work 2026 (Google Clouds blogg)
Gemini Enterprise gör Claude Opus 5.5 och Claude Sonnet 5.5 tillgängliga i Antigravity-verktygen
8 oktober — Samma dag gör versionsinformationen för Gemini Enterprise det möjligt för administratörer att aktivera Claude Opus 5.5 och Claude Sonnet 5.5 i Antigravity 2.0, Antigravity CLI och Antigravity-tilläggen för IDE. Administratören accepterar deras användarvillkor direkt i Google Cloud-konsolen, utan ett separat Anthropic-konto.
| Aktiveringsinställning | Värde enligt Google |
|---|---|
| Standardläge | Tredjepartsmodeller avstängda, aktiveras av administratörer |
| Debiteringsmodell | Förbrukningsbaserad, inom projektets utgiftstak |
| Platser för inferens | global, us och eu |
| Resonemangsnivåer | Low, Medium (standard), High eller Max |
Utvecklaren behåller sin Gemini Enterprise-licens och väljer Claude i modellväljaren. Överskridanden (overages) måste aktiveras innan en tredjepartsmodell öppnas, och dess kostnad räknas in i det gemensamma taket för alla modeller. Samma sida tillkännager att Gemini 3.8 Flash är allmänt tillgänglig i Singapore.
🔗 Versionsinformation för Gemini Enterprise
Röst: HeyGen Voice i toppen av Controlled Voice-rankningen, Mistral publicerar två modeller för arabiska
9 oktober — HeyGen lanserar HeyGen Voice, som Joshua Xu presenterar som företagets första internt utvecklade röstmodell, från ett företag som hittills varit känt för sina avatarer. Modellen är tillgänglig i HeyGen och via API:t, för 30 dollar per miljon tecken; till och med den 31 oktober betalar API-användare 15 dollar, och rabatten tillämpas automatiskt.
Stödet för påståendet kommer från Artificial Analysis, som publicerade sina resultat en och en halv minut före HeyGen. På dess Controlled Voice-rankning, där alla modeller talar med samma 8 klonade röster, på amerikansk och brittisk engelska, tar HeyGen Voice förstaplatsen med ett Elo på 1 201 efter 1 468 deltaganden. Där är modellen etta i kategorierna Assistenter och Kundservice, samt i brittisk engelska.
HeyGen Voice takes the #1 spot on the Artificial Analysis Controlled Voice TTS Arena Leaderboard, ahead of Alibaba’s Qwen-Audio-3.1-TTS-Plus and ElevenLabs’ Eleven v4 Turbo
🇸🇪 HeyGen Voice tar förstaplatsen i Artificial Analysis Controlled Voice TTS Arena-rankning, före Alibabas Qwen-Audio-3.1-TTS-Plus och ElevenLabs Eleven v4 Turbo. — @ArtificialAnlys på X
| Utvärderad modell | Elo Controlled Voice (9 oktober) | API-pris per miljon tecken |
|---|---|---|
| HeyGen Voice | 1 201 | 30 dollar (15 till och med 31 oktober) |
| Qwen-Audio-3.1-TTS-Plus | 1 182 | 19,3 dollar |
| Eleven v4 Turbo | 1 166 | 40 dollar |
| Eleven v4 | 1 162 | 80 dollar |
Den här förstaplatsen har en tydlig avgränsning: den gäller röstkloning. På Provider Voice-rankningen, där varje leverantör använder sina egna röster, låg Eleven v4 Turbo och Eleven v4 fortfarande i topp på kvällen den 9 oktober, och HeyGen Voice fanns inte bland de åtta främsta. För uttalsrobusthet når HeyGen Voice 83,1 %, vilket ger 10:e plats av 29.
I API:t sker kloningen direkt: en enda inspelning, där bara de första tre minuterna används, ger en aktiv röst på några sekunder, utan träning. Syntesen sker i ett stycke (en WAV-fil på 44,1 kHz) eller som en ström, och det var API:ts standardinställningar som Artificial Analysis utvärderade.
🔗 Tillkännagivande från HeyGen
Voxtral Mini 4B Realtime Arabic och LIDstral Arabic: två modeller från Mistral för arabiska
8 oktober — Mistral har utan något tillkännagivande lagt upp två öppna modeller under Apache 2.0-licensen på Hugging Face, båda för arabiska. Voxtral Mini 4B Realtime Arabic transkriberar arabiska dialekter och modern standardarabiska strömmande, även när talarna byter språk mitt under ett samtal (code-switching). Den är finjusterad utifrån Voxtral Mini 4B Realtime och har cirka 4,4 miljarder parametrar. Enligt modellkortet har den utvecklats tillsammans med Marockos ministerium för digital omställning och administrativ reform, inom ramen för det partnerskap mellan Mistral och Marocko som undertecknades i januari 2026 och som även har gett två nya benchmarks, ISMA och Darija in the Wild.
| Publicerad modell | Modellens funktion | Resultat enligt modellkortet |
|---|---|---|
| Voxtral Mini 4B Realtime Arabic | Strömmande transkription av arabiska | Genomsnittlig teckenfelfrekvens på 8,82 % över 7 benchmarks vid 480 ms, mot 7,91 % för Voxtral Transcribe Arabic |
| LIDstral Arabic | Språk- och dialektidentifiering, 51 klasser, på processor | F1 på 88,67 % för marockansk darija, mot 71,28 % för GlotLID v3 |
🔗 Voxtral Mini 4B Realtime Arabic på Hugging Face · LIDstral Arabic på Hugging Face
Claude Managed Agents: dynamiska workflows med upp till 1 000 agenter per körning
9 oktober — Anthropic släpper dynamiska workflows (dynamic workflows) i Claude Managed Agents som en publik beta, en ny typ av multiagentorkestrering. Agenten som leder sessionen skriver själv ett program, som servern kör i bakgrunden genom att starta många agenter i faser och sedan kombinera deras resultat. När typen multiagent_20261001 har aktiverats är det agenten som bestämmer när en körning ska startas.
En körning startar upp till 1 000 agenter, varav 64 samtidigt, har en livslängd på 24 timmar som standard, och en session kan hålla 10 körningar öppna. Dess tokens debiteras på samma sätt som sessionens och räknas in i dess budget; Anthropic varnar för att de kan bli många och hänvisar till ett internt test med 70 bugs som planterats i en kodbas på 116 000 rader.
| Konfiguration i Anthropics test | Hittade bugs under 3 försök |
|---|---|
| Ensam agent | 14, 15 och 27 |
| Dynamiskt workflow | 66 vid varje försök |
🔗 Tillkännagivande från @ClaudeDevs · Dokumentation för workflow-körningar
Kodagenter: meddelandeförutsägelser och MXC-sandbox för Codex, Claude Code 2.1.296, Vibe CLI 2.26.1
Codex får två nyheter samma dag, medan Anthropic och Mistral släpper nya versioner av sina kommandoradsagenter.
Codex förutser användarens nästa meddelande, i beta för Pro-prenumeranter
9 oktober — OpenAI öppnar meddelandeförutsägelser (composer predictions) i beta i Codex skrivbordsapp. När Codex har svarat klart kan ett förslag på nästa meddelande visas i inmatningsfältet, baserat på den aktuella tråden, utan att hämta information från minnen eller anslutna appar. Tab-tangenten infogar det; texten kan fortfarande redigeras och skickas aldrig automatiskt. Förslaget gäller ett helt meddelande, inte en komplettering ord för ord.
| Villkor för betan | Värde enligt OpenAI |
|---|---|
| Abonnemang och ålder | Personligt ChatGPT Pro, 18 år och äldre |
| Trådar och modeller | Lokala trådar och SSH-trådar, med GPT-6 Astra eller GPT-6.1 Sol |
| Standardinställning | Aktiverat, kan stängas av i General > Composer > Show predictions |
| Kostnad under betan | Räknas inte mot Codex användningsgränser, inga krediter förbrukas |
Skickade meddelanden, inklusive accepterade förutsägelser, räknas fortfarande som vanligt. Funktionen finns inte i Chat.
🔗 Tillkännagivande från @OpenAIDevs · Hjälpartikel från OpenAI
Codex på Windows: en sandbox baserad på Microsoft Execution Containers
9 oktober — OpenAI lägger till ett sandbox-läge i Codex på Windows som bygger på Microsoft Execution Containers (MXC), som Microsoft gjorde allmänt tillgängliga den 7 oktober. Det kräver en kompatibel Windows 11-enhet (24H2 build 26100.9278 eller 25H2 build 26200.9278) och utlovar snabbare installation, striktare nätverkskontroll och mer finjusterad filåtkomst.
Enligt dokumentationen blir MXC den rekommenderade implementeringen: det isolerar processer med inbyggda funktioner, utan administratörsgodkänd konfiguration, extra Windows-konton eller lokala brandväggsregler. Lägena elevated och unelevated blir äldre reservlösningar. Skrivbordsappen väljer själv MXC för konsumentkonton; i CLI eller i företag aktiveras det med prefer_mxc = true i config.toml, och en administratör kan blockera det med allow_mxc = false. Två begränsningar dokumenteras: hanterat nätverk kräver allow_local_binding = true, och kvarvarande barnprocesser stoppas när kommandot i förgrunden avslutas.
🔗 Tillkännagivande från @OpenAIDevs · Dokumentation för Windows-sandboxen
Claude Code 2.1.296: compaction för underagenter och en gemensam modell för workflow-agenter
9 oktober — Claude Code 2.1.296 innehåller 79 poster, varav 56 korrigeringar, och åtföljdes inte av någon tweet. Den ger framför allt mer kontroll över underagenter.
| Nyhet i versionen | Vad den ändrar |
|---|---|
autoCompactWindow (underagenter, --agents) | En underagent komprimerar sin kontext tidigare än huvudsamtalet |
CLAUDE_CODE_WORKFLOW_SUBAGENT_MODEL | Alla agenter i ett workflow använder samma modell, övriga underagenter behåller sin |
Alternativet allow_large i Read | Läsning av en stor textfil i ett enda anrop, om kontexten tillåter det |
CLAUDE_CODE_OVERLOADED_RETRY_MAX_DELAY_MS | Längre maximal väntetid mellan två återförsök efter ett 529-fel |
| Beskrivningar av MCP-verktyg skickas direkt | Standardgränsen höjs från 2 048 till 4 096 tecken |
/cost och statusraden räknar nu cacheläsningar för Sonnet 5.5 till 0,10 dollar per miljon tokens. På säkerhetssidan korrigerar versionen hanterade PreToolUse-hooks som avvisade ett anrop utan att avsluta turen, Bash-kontroller som automatiskt godkände vissa kommandon med BASH_ARGV0, molnsessioner som hoppade över kontrollerna i auto-läget för åtgärder i Claude in Chrome, samt ändringar med Edit och NotebookEdit som ersatte alla icke-ASCII-tecken i filer som inte var UTF-8, och som nu avvisas.
🔗 Claude Code 2.1.296 på GitHub
Vibe CLI 2.26.1: den lokala Devstral-modellen tas bort, ett mer komplett icke-interaktivt läge
9 oktober — Tre dagar efter 2.26.0 och utan någon tweet släpper Mistral Vibe CLI 2.26.1. Trots versionsnumret för en korrigeringsversion innehåller den 85 poster (23 tillägg, 24 ändringar, 36 korrigeringar, 2 borttagningar), varav 37 gäller det nya gränssnittet i Rust. Den tar bort den lokala Devstral-modellen som tidigare medföljde: en konfiguration som fortfarande låser sig till den modellen återgår, med en varning, till den hostade standardmodellen. Den erbjuder nu bara två resonemangsnivåer, off och high, och anger ett kontextfönster på 256k, som den automatiska komprimeringen anpassas till.
Det icke-interaktiva läget vibe -p får en tidsgräns, möjlighet att läsa prompten från en fil eller standardindata, en rapport export.json som skrivs vid varje avslut och separata avslutningskoder: 1 för användnings- eller konfigurationsfel, 2 för infrastrukturfel, 3 för en uppnådd gräns eller ett avslag från modellen. CLI:n i Rust lägger till /proxy-setup, en berättarröst som läser upp sammanfattningen av varje omgång, /plugins och /whoami. Nya inställningar förbjuder agenten att använda bakgrundsprocesser eller underagenter, och anslutningen till Document Library förblir avstängd som standard.
🔗 Versionsinformation för Vibe CLI 2.26.1
Bilder, videor och generativa spel: Qwen-Image-2.1-Turbo, Midjourneys Thinking-läge, Syren från Synthesia, Playground från Google
En snabbare och billigare bildmodell, en generator som granskar sitt eget resultat, en agent som redigerar videor och en spelplattform utan kod.
Qwen-Image-2.1-Turbo: 8 steg för brusreducering och 0,016 dollar per bild
9 oktober — Qwen släpper Qwen-Image-2.1-Turbo, en accelererad checkpoint (accelerated checkpoint) av Qwen-Image-2.1 som genererar och redigerar bilder i 8 steg för brusreducering, med samma arkitektur på 7 miljarder parametrar. Enligt Qwen producerar den fortfarande 2K-bilder och accepterar redigeringar i naturligt språk, men inga siffror för kvalitet eller hastighet specifika för denna version har publicerats. Vikterna finns på Hugging Face och ModelScope under Qwens forskningslicens (Qwen Research License). Checkpointen innehåller sitt samplingsschema med 8 steg och körs som standard med CFG på 1.
Samma dag öppnar Qwen officiellt API:erna för Qwen-Image-2.1 Pro och Turbo; QwenCloud tillåter 120 anrop per minut för Turbo.
| Modell som tillhandahålls via API (Model Studio) | Pris per bild | Gratisbilder |
|---|---|---|
| qwen-image-2.1-turbo | 0,016 dollar | 10 |
| qwen-image-2.1-pro | 0,04 dollar | 10 |
| qwen-image-2.0-pro | 0,075 dollar | 100 |
🔗 Qwens tillkännagivande · Modellkort på Hugging Face
Midjourney testar ett Thinking-läge och öppnar delade mappar på sin alphasajt
8 oktober — Midjourneys changelog för alpha-versionen, publicerad på kvällen, presenterar två funktioner i tidig version, som tills vidare bara finns på alpha.midjourney.com. Den första är ett test: för en bild som skapats med V8.2, genom generering eller redigering, ber knappen Rerun (Thinking) modellen att granska resultatet, identifiera var det avviker från prompten (objekt, layout, anatomi, text) och generera på nytt. Midjourney uppger att resultaten förbättras vad gäller följsamhet till prompten, typografi och konsekvens, och överväger att göra detta till ett generellt läge.
Den andra är mappdelning: man bjuder in Medarbetare, som genererar direkt i mappen, eller Läsare, och kan dela via länk eller till och med öppna mappen för alla Midjourney-medlemmar. Midjourney förtydligar att delningen inte ändrar bildernas synlighet: utan stealth-läget kan de fortfarande visas på Explore och i profiler.
🔗 Midjourneys changelog för alpha-versionen · Test av Thinking-läget (Midjourney)
Syren: Synthesia överlåter videoskapandet till en agent, i beta
9 oktober — Synthesia lanserar Syren i beta för alla sina kunder, inklusive gratiskonton. Man beskriver den önskade videon eller tillhandahåller dokument, bilder, videor, PowerPoint-presentationer eller YouTube-länkar, och Syren levererar en färdig video med rörlig grafik (motion graphics), avatarer, berättarröst, musik och inklippsbilder (b-roll), som man sedan korrigerar genom en konversation. Enligt Peter Hill, teknikchef på Synthesia, skriver agenten hela videon som kod, som en egen renderingsmotor, använd för Synthesias animationer sedan juni, spelar upp i realtid.
Videorna är upp till 3 minuter långa, i liggande eller stående format, och renderas i webbläsaren. Debiteringen sker med krediter, utan detaljerade prisuppgifter, och Enterprise-administratörer kan stänga av verktyget. Automatisk inlärning av varumärkesidentiteten från befintliga videor aviseras som en kommande funktion i blogginlägget. Syren kommer fyra dagar efter HyperFrames Studio från HeyGen och dagen efter Claude Motion från Anthropic, två andra verktyg där en agent producerar videon.
🔗 Presentation av Syren (Synthesia)
Playground: Google öppnar en plattform för att skapa spel utan att koda
7 oktober — Google lanserar Playground, en experimentell spelplattform där man skapar, spelar och delar spel genom att beskriva dem med några prompts, utan att skriva kod. I ett konversationsgränssnitt börjar man från ett tomt blad, ett exempel att remixa eller en guidad process, och justerar sedan fysiken, reglerna, karaktärerna eller miljön på begäran.
Spelen körs i webbläsaren, på både telefon och dator, och kan förbli privata, delas via länk eller läggas till i Explore-galleriet, med topplistor och flerspelarläge för vissa genrer; varje publicerat spel genomgår en säkerhetskontroll. Playground är öppet i USA för personer från 18 år, och tillgången till spelskapandet beror på Google AI-abonnemanget. En integration med Unity Spark för mer ambitiösa 3D-spel aviseras inom kort i sluten beta. Google anger inte vilken modell som driver plattformen.
🔗 Presentation av Playground (Googles blogg)
Hälsa: den kliniska studien av AMIE publicerad i The Lancet
8 oktober — Google och Beth Israel Deaconess Medical Center (BIDMC) publicerar en prospektiv genomförbarhetsstudie av AMIE (Articulate Medical Intelligence Explorer), Googles konversationsbaserade AI för diagnostik, i The Lancet; enligt Google är detta dess första publikation i Lancets huvudtidskrift. Patienter samtalade med AMIE upp till fem dagar före ett brådskande läkarbesök, och läkaren fick sedan transkriptionen och en sammanfattning.
| Mått i studien | Publicerat resultat |
|---|---|
| Inkluderade patienter (april till november 2025), därefter uppföljda | 114, därefter 98 |
| Avbrott av säkerhetsskäl | 0 |
| Noterade hallucinationer | 1 |
| AMIE till hjälp inför besöket, enligt läkaren | 33 fall av 44 (75 %) |
| Diagnoser som stämde med den slutliga diagnosen (Google) | 90 % |
Studien genomfördes vid ett enda centrum, utan kontrollgrupp och med finansiering från Alphabet, och innebär varken ett godkännande eller en driftsättning: författarna efterlyser större studier.
🔗 Googles blogginlägg · Artikeln i The Lancet
Forskning på OpenAI: svaret på brevet från tre forskare som företaget har avslutat samarbetet med
9 oktober — I ett meddelande publicerat på @OpenAINewsroom i forskningsledningens namn svarar OpenAI på brevet från tre forskare som företaget uppger att det avslutade samarbetet med veckan innan. Enligt OpenAI kom en intern utredning fram till att de hade brutit mot tydliga regler för hantering av känslig information, med ett förtroendebrott som går utöver vad deras brev beskriver; OpenAI står fast vid sitt beslut. Företaget hävdar att besluten varken beror på att de har lyft säkerhetsfrågor eller på att de har uttalat sig, och att det inte säger upp någon anställd för att denne har uttryckt oro.
Meddelandet tillkännager också:
We are actively finalizing contracts with third-party safety assessors and will announce details in the coming weeks.
🇸🇪 Vi arbetar aktivt med att slutföra avtal med externa säkerhetsutvärderare och kommer att tillkännage detaljerna under de kommande veckorna. — @OpenAINewsroom på X
OpenAI instämmer med brevet på en punkt: att bevara frontier-modellernas övervakningsbarhet (monitorability) kräver ett åtagande från hela branschen, inklusive OpenAI. Den här artikeln återger OpenAI:s version; forskarnas brev har inte lästs.
Bygga öppna modeller: sex modeller för cirka 103 dollar med ML Intern, GPU-schemaläggaren från Ai2
Två erfarenhetsrapporter om att bygga modeller: den ena från agentperspektivet, den andra från beräkningsklustren.
ML Intern: sex öppna modeller för cirka 103 dollar i beräkningskostnad
8 oktober — ML Intern-läget i HuggingChat, som redan presenterats här den 1 och 8 oktober ur andra perspektiv, får en första redovisning i siffror på Hugging Faces blogg: sex projekt genomförda från början till slut, för totalt cirka 103 dollar i beräkningskostnad. Varje projekt börjar med ett meddelande och slutar med en offentlig modell på Hub, inklusive utvärdering. Agenten planerar, ber om tillstånd före varje betald beräkningsuppgift, kör ett kort test och tränar, utvärderar och publicerar sedan på Hugging Faces hårdvara.
| Modell producerad av ML Intern | Publicerat resultat | Beräkningskostnad |
|---|---|---|
| Pocket Rewriter (0.8B) | 99,7 % giltiga utdata, cirka en fjärdedel så många tokens som omskrivningsmodellen på 9B i Qwen-Image 2.1 | Cirka 16 dollar |
| Citrus Doctor (Qwen3.5-2B) | Från 14,9 % till 52,8 % korrekta diagnoser av citrussjukdomar | Cirka 1,90 dollar |
| Två LoRA för Qwen-Image 2.1 | Ändrad betraktningsvinkel, klotter ersatt med det begärda objektet | Cirka 16 och 24,30 dollar |
| Huggy LoRA (FLUX.2 klein) | LoRA för en karaktär | Cirka 7,60 dollar |
| Agate 4 steg | Destillation av en liten bildmodell, från 50 steg (100 genomkörningar med guidning) till 4 | Cirka 37 dollar |
GPU-schemaläggaren från Ai2: medianväntetiden sjunker från 5 minuter till 24 sekunder
9 oktober — Ai2 beskriver den nya schemaläggaren för sina GPU-kluster i ett blogginlägg av Jeremy Tryba. Tusentals NVIDIA H100-, B200- och B300-GPU:er, i kluster med 88 till 1 024 GPU:er, delas där av cirka 150 forskare, med en efterfrågan som är två till tre gånger större än utbudet. Det tidigare prioritetssystemet lät GPU:er hållas «ockuperade» av tomma jobb och fick alla arbetslaster att till slut hamna på högsta prioritet.
Det nya systemet bygger på GPU-tidsbudgetar som fördelas längs forskningsorganisationens hierarki, en hierarkisk rättvis resursdelning (fair-share) beräknad över en rullande sjudagarsperiod och ett «schemaläggningskontrakt»: varje arbetslast anger en skyddad körtid på högst 8 timmar, varefter den kan avbrytas och återföras till kön. Ej tilldelad tid förblir gratis, men kan alltid avbrytas.
| Mått uppmätt av Ai2 | Tidigare schemaläggare | Ny schemaläggare |
|---|---|---|
| Medianväntetid, största H100-klustret | 5 minuter | 24 sekunder |
| Väntetid vid p90 för felsökningsjobb | 2 timmar | 30 sekunder |
| Utlovade GPU-timmar levererade under 30 dagar | — | 98 % |
Reparationer som kräver mänskliga insatser minskar med 74 %. Ai2 medger begränsningar, som att interaktiva sessioner kan avbrytas efter 8 timmar, medan de tidigare kunde pågå i en vecka, och publicerar ingen kod.
Beslutsmodeller: pplx-decider-v1.1-27b toppar Decision Bench och delar förstaplatsen statistiskt med nio andra
9 oktober — Perplexitys beslutsmodell, som redan rapporterats om den 6 och 8 oktober, får ett externt resultat. På Decision Bench, ett open source-benchmark från Atlan Frontier Labs (1 071 slutna frågor, 36 dataset, 15 rankade modeller), uppnår pplx-decider-v1.1-27b det högsta råresultatet, 94,5 %, till den lägsta kostnaden, 0,017 dollar per 1 000 beslut. Sajten ger dock samma placering till modeller vars 95-procentiga konfidensintervall överlappar: tio modeller delar förstaplatsen.
| Modell utvärderad på Decision Bench | Uppmätt träffsäkerhet | Kostnad per 1 000 rader |
|---|---|---|
| pplx-decider-v1.1-27b | 94,5 % | 0,017 dollar |
| DeepSeek V4.1 Flash | 94,2 % | 0,683 dollar |
| Gemini 3.5 Flash | 94,2 % | 3,32 dollar |
| Jev 1.13 | 93,8 % | 0,044 dollar |
Perplexity publicerar också en praktisk guide (cookbook) för en webbläsaragent, där koden, aldrig modellen, avgör vad som ska klickas på, och v1.1 ersätter v1 i API:t.
🔗 Tråd från @perplexitydevs · Rankning på Decision Bench
Grok Bot får en egen e-postadress
9 oktober — Grok Bot, agenten från SpaceXAI, har nu en egen e-postadress. Bot kan använda den för att registrera sig för tjänster, kontakta företag på användarens vägnar eller boka ett möte med någon. Funktionen rullas ut samma dag: det räcker att be Bot om en adress eller nämna @bot på X, och i ett team måste en administratör först aktivera den.
Tillkännagivandet består av en tråd från kontot @bot, vidareförmedlad av @grok, utan något blogginlägg på x.ai. Det anger varken adressernas format eller domän, eller vilka abonnemang som omfattas. Efter den särskilda Slack-identiteten för Team Bots i slutet av september får agenten därmed en egen identitet för att agera externt.
ElevenLabs etablerar sig i Singapore, företagets nav för Sydostasien
8 oktober — ElevenLabs offentliggör sin etablering i Singapore, där företaget öppnar ett kontor som ska fungera som nav för Sydostasien och, mer allmänt, för Asien och Stillahavsområdet. Blogginlägget lyfter fram den infrastruktur som redan finns på plats: sedan juli kan företag lagra sina data i Singapore, med alternativ utan datalagring och minskad latens i regionen.
ElevenLabs lyfter framför allt fram sina regionala kunder: Funding Societies, som kvalificerar sina leads med konversationsbaserad AI på fem marknader, Boost Bank i Malaysia, Salmon Group i Filippinerna, MNC Group i Indonesien eller Rezonate, en hälsoplattform som används av 60 % av Singapores offentliga sjukhus. Inga uppgifter om antalet anställda anges. Etableringen följer efter dem i Bryssel och Amsterdam i slutet av september och början av oktober.
Notiser
- Projects i Claude Code — Anthropic har gett tillgång till alla Pro- och Max-abonnenter som stod på väntelistan. Projects är fortfarande i beta: listan är fortsatt öppen, fler får tillgång efter hand som kapaciteten tillåter, och funktionen erbjuds ännu inte på Team eller Enterprise, enligt dokumentationen. 🔗 källa
- Guide till agentautomatiseringar — En guide på claude.dev beskriver en referensimplementation på Claude Managed Agents som enligt ett schema läser Slack-kanaler och pull requests på GitHub och sedan publicerar en sammanfattning i Slack. Den går igenom de sex komponenterna och deras skydd mot vanliga fel, som att inte tolka en oläsbar källa som en lugn dag eller att sätta utgiftstaket till 3 till 5 gånger kostnaden för en normal körning. 🔗 källa
- Block och Claude Fable — I en intervju publicerad av Anthropic förklarar Block att Claude Fable planerar företagets stora kodmigreringar och leder upp till tiotals Opus- eller Sonnet-modeller, så att upp till tusen pull requests kan slås samman i en och samma migrering; sammanslagningar och produktionssättningar utförs fortfarande enbart av människor, med dubbelt godkännande av driftsättningar. 🔗 källa
- Compliance API i Claude Enterprise — Dess slutpunkter (endpoints) för konversationer returnerar även, i beta och med den befintliga nyckeln, konversationer från den enhetliga Claude-upplevelsen: en konversation som fortsätter i en molnsession returneras som en enda, med Claudes arbete i blocken
tool_useochtool_result. 🔗 källa - Codex CLI 0.162.1 — Denna korrigering av 0.162.0 tar bort en TUI-krasch vid asynkrona frågor över flera rader samt startfel när en redan körande bakgrundsserver hade andra funktionsinställningar än CLI:n. 🔗 källa
- Plugins per roll i ChatGPT Enterprise och Edu — När rollbaserad åtkomstkontroll (RBAC) är aktiverad ställer ägare och administratörer in åtkomsten till plugins för varje roll: Available, Install eller Disabled för arbetsytan, och Default för att en anpassad roll ska ärva den inställningen. 🔗 källa
- Sophos och OpenAI Daybreak — Enligt cybersäkerhetsleverantören minskar dess agenter byggda med Daybreak den genomsnittliga svarstiden för de ärenden de hanterar från ungefär 38 minuter till ungefär 89 sekunder, och 52 % av dess MDR-ärenden löses helt av AI; destruktiva åtgärder står fortfarande under mänsklig tillsyn. 🔗 källa
- Asana och StackAI:s navigeringsagent — Enligt Asana optimerade GPT-6 Astra i Codex denna agent på ungefär en vecka: på GPT-6.1 Sol kostar en testkörning 0,47 dollar och tar ungefär fyra minuter, vilket är 76 gånger billigare och 5 gånger snabbare än den ursprungliga produktionskonfigurationen. 🔗 källa
- LegalOn och Codex — LegalOn Technologies uppger att företaget har minskat sina uppskattade dagliga Codex-kostnader med ungefär 65 % genom att gå från GPT-5.5 i obegränsat snabbläge till att fördela uppgifterna mellan GPT-6 Luna, GPT-6.1 Sol och GPT-6 Astra, med snabbläge vid behov och kostnadstak per avdelning och person. 🔗 källa
- Gemini CLI v0.64.0-preview.1 — Denna förhandsversion undanröjer falska positiva träffar för varningen Untrusted Command Flags Detected vid harmlösa shell-kommandon: alternativ som bara läser undantas, shell-variabler bevaras och loopar tillåts när varje underkommando har sin ALLOW-regel. Ingen nightly släpptes den 9 oktober, och den stabila versionen är fortfarande v0.63.0. 🔗 källa
- Antigravity 2.22.0 — Plugins kan visa sitt eget gränssnitt i sidopanelen (UI Extensions), konversationer kan sorteras genom att dras och släppas mellan sidofältets sektioner, och tidsstämplar visar månadens namn. 🔗 källa
- Gemini 3.7 Flash utfasad — I Gemini API omdirigeras anrop till
gemini-3.7-flashtillgemini-3.8-flash, och den gamla agentendeep-research-pro-preview-12-2025stängs av den 23 oktober till förmån fördeep-research-preview-04-2026ellerdeep-research-max-preview-04-2026. 🔗 källa - VST3- och AU-plugins för Google Flow Music — Nyhet från den 6 oktober: Spaces, dessa instrument och effekter skapade med naturligt språk, kan exporteras som plugins till digitala ljudarbetsstationer (Digital Audio Workstations), som producenten Khris Riddick-Tynes plugin No Chaser. 🔗 källa
- Google Earth AI och folkhälsa — Nyhet från den 6 oktober: under ebolautbrottet i Demokratiska republiken Kongo hjälpte en prototyp av en agent för geospatialt resonemang WHO:s Afrikakontor att på några minuter identifiera 48 utsatta orter och fler än 45 500 personer i riskzonen; PDFM-modellen identifierar också områden med risk för kolera upp till 8 veckor i förväg. 🔗 källa
- Fakturering av Copilot code review — Organisationsägare kan debitera den organisation som äger repot för granskningar som deras licensierade medlemmar begär, i stället för att förbruka medlemmarnas kvot, om betald användning av AI Credits är aktiverad. De kan också begränsa möjligheten att starta granskningar till licenser som tillhandahålls av organisationen eller företaget. 🔗 källa
- Copilot CLI 1.0.95 — Den har blivit stabil och autentiserar på macOS via Microsoft Entras inbyggda broker, med webbläsaren som reserv; förhandsversionen 1.0.96-0 visar i tidslinjen vem som fattade varje behörighetsbeslut: användaren, Assisted Permissions, en policy eller den obevakade reservlösningen. 🔗 källa
- GitHub MCP Server 2.0 — Nyhet från den 6 oktober: GitHubs officiella MCP-server returnerar typade utdata, beskrivna av utdatascheman (output schemas), för agenter i Code Mode eller Programmatic Tool Calling; dessa annonseras endast till klienter som följer MCP-specifikationen 2026-07-28 eller senare. 🔗 källa
- Claude Haiku 5.5 i Genspark — Genspark tar modellen i bruk i AI Chat, Code Agent och Claw och återger Anthropics budskap om att den är ungefär 75 % billigare att köra än Haiku 4.5, utan någon särskild abonnemangsplan eller prissättning. 🔗 källa
- Meta VR-mall för v0 — Meta publicerar tillsammans med Vercel en v0-mall baserad på Immersive Web SDK: man beskriver en upplevelse, v0 kodar och förhandsvisar den, och ett klick driftsätter den på Vercel så att den kan öppnas i Quests webbläsare; blick- och handstyrning på Meta VR Glasses, som väntas våren 2027, stöds redan. 🔗 källa
- v0 for teams — v0 visar i en video hur man kan se sina lagkamraters arbete, ansluta till deras konversationer och bygga tillsammans; tweeten lyfter fram funktioner som har införts stegvis sedan september, utan någon ny prissättning. 🔗 källa
- DeepSeek Harness 0.2.1-alpha.2 — Den 26:e förhandsversionen, fortfarande utan någon stabil version: plugin-katalogen installerar paketen Claude Code och Codex vid behov, två experimentella plugins tillkommer (Git Worktrees, översättning av resonemang), och globala instruktioner kan hämtas från en delad AGENTS.md. 🔗 källa
- OGX 1.5.0 — Det tidigare Llama Stack, som bytte namn i april och lämnade organisationen meta-llama, lägger till inbyggd vidarebefordran av API:t /v1/messages för DeepSeek och Fireworks AI, en Text-Embeddings-Inference-leverantör, webbsökning med Exa och Serply samt MCP-klienten 2.x, med fyra inkompatibla ändringar. 🔗 källa
- GenIA — Meta lägger utan tillkännagivande ut koden för detta arbete tillsammans med Tübingen AI Center under den icke-kommersiella licensen CC BY-NC 4.0: det rekonstruerar 3D-objekt från en bild, några vyer eller en video genom att vid inferens anpassa den frysta priorn från SAM 3D Objects, utan omträning. 🔗 källa
- Etiketten decision-model på Hub — Hugging Face ger beslutsmodeller en egen etikett, med en ikon och ett filter på sidan Models; GGUF-filer för beslutsmodeller märks automatiskt utifrån sina llama.cpp-metadata. 🔗 källa
- Darwin-27B-ZTC-v2 — VIDRAFT meddelar att den nya versionen av dess domarmodell, under Apache-2.0, tar förstaplatsen i System One Mosaic Benchmark (137 testsviter) med en Borda-poäng på 89,58, före OpenJev-27B (87,50) och Jev 1.13 (85,05); en rankning som upphovspersonerna uppger och beskriver som en ögonblicksbild av en offentlig resultattabell. 🔗 källa
- Beslutsmodellernas tillförsikt — Stephen Solka visar i ett community-inlägg att GPT-6 Luna Decisions, tillfrågad via OpenRouter, svarar ”matchar inte” på 600 SHA-256-kontroller, med 50 % träffsäkerhet och 99,8 % genomsnittlig tillförsikt; vid kausalt resonemang avgränsar en tröskel på 99 % en grupp med 47 rätta svar av 49, men täcker bara 8,2 % av fallen. 🔗 källa
- openai-math i miljöer för förstärkningsinlärning — FineEnvs överför 369 av de 405 resultat som formaliserats i Lean i publikationen openai/math till Harbor-miljöer: agenten måste bevisa en sats i en Lean 4-sandlåda, och Comparator ger bara belöning för ett fullständigt bevis av det exakta påståendet; ett experimentellt dataset under Apache-2.0. 🔗 källa
- JOSIE-2 — Gökdeniz Gülmez publicerar den tekniska rapporten för denna familj av 2B-, 4B- och 9B-modeller, eftertränade med Qwen3.5 som utgångspunkt på två Mac M4 och ungefär 3 000 utvalda exempel: i resonemangsläge når JOSIE-2-4B 95,5 på ARC-Challenge (+12,1) och 69,2 på TruthfulQA (+20,3), på endast två testsviter. 🔗 källa
- Gradio 6.30 —
gr.Workflowfår en appvy, och kommandot Run this node återanvänder fortfarande aktuella resultat från tidigare steg i stället för att köra om hela delgrafen;gr.ImageEditorbevarar alfakanalen i inlästa bilder. 🔗 källa - tokenizers 0.23.3 — Denna korrigering, som enbart gäller Python-paketet, stöder
huggingface_hubv2, vilket enligt versionsanteckningarna gör det möjligt att installera Transformers, och återställer en inkompatibel ändring av trunkering från 0.23.1. 🔗 källa - Vetenskaplig granskning med AI — Sakana AI presenterar en artikel som har accepterats av TMLR: en testsvit lägger in motsägelsefulla påståenden i artiklar för att kontrollera om AI-granskare upptäcker dem, och dess system Multi-Layered Review upptäcker fler än de andra testade systemen, enligt Sakana AI:s tillkännagivande, som inte anger några siffror. 🔗 källa
- Suno Studio — Klipp anpassas bättre till det första taktslaget och sträcks för att följa projektets tempo, toningar blir exponentiella eller logaritmiska, och synthesizern, klaviaturen och plugin-vyerna kan frigöras och flyttas även till en andra skärm; Studio ingår i Premier-abonnemanget. 🔗 källa
- World Models’ Last Exam in Physics — På detta fysikprov från Einsia för videomodeller (40 uppgifter, 9 kategorier, åtta modeller) kommer Seedance 2.5 först med 57,76 av 100, före MiniMax H3 (54,89), den bästa öppna modellen enligt MiniMax, och Cosmos 3 Super från NVIDIA (42,46); ett benchmark från tredje part. 🔗 källa
- Omniverse-simuleringar byggda av agenter — NVIDIA:s blogg visar team inom företaget som låter GPT-6 Astra, och i ett fall Claude Fable 5, sätta ihop simuleringar med biblioteken ovphysx, ovstage, ovrtx och ovui, bland annat digitala tvillingar som skapats eller förbättrats på ungefär tre dagar; ingen ny produkt. 🔗 källa
- Hantering av en Shopify-butik — När butiken har anslutits kan Grok Bot kontrollera beställningar, följa lagersaldon och hålla produktinformationen uppdaterad; varken abonnemangsplan eller begränsning anges. 🔗 källa
- Sökning på X — Nyhet från den 7 oktober: Grok Bot kan söka, läsa och bevaka X för alla användare utan att X-anslutningen behöver konfigureras, till exempel för att följa återkoppling om en produkt eller få en veckosammanfattning av sin bransch; i slutet av augusti behövde man fortfarande ansluta sitt konto. 🔗 källa
- Grokipedia v0.3 — Enligt dess officiella konto har uppslagsverket som skrivs av Grok på en vecka publicerat fler än 4 400 artiklar som läsare efterfrågat och gjort fler än 2 200 ändringar per dag, med i genomsnitt 78 källor per ny artikel; en sida visar nu dess ändringar i realtid. 🔗 källa
- CLI mistral 0.8.0 —
mistral apps deploydriftsätter även workers för workflows och alla moduler samtidigt, även i kontinuerlig integration med enbart en API-nyckel, ochmistral apps devstartar en lokal Postgres-databas i Docker; samtidigt läses.envi den aktuella katalogen inte längre. 🔗 källa - Mistrals Python SDK 3.2.0 — Chat- och agentanrop stöder logaritmiska sannolikheter (logprobs), både för svaret och för prompten, samt
top_k, en repetitionspåföljd och ett minsta antal tokens; en automatiskt genererad version utan tillkännagivande. 🔗 källa - Qwen Code v0.25.1-preview.1 — Den andra förhandsversionen av v0.25.1 på tre dagar, med 16 nya funktioner och 27 nya korrigeringar, däribland sessionscentrerat samarbete mellan flera agenter och PreToolUse-hooks som ändrar indata till ett verktyg med fullständig omvalidering; den stabila versionen har ännu inte släppts. 🔗 källa
- Claude Haiku 5.5 i Perplexitys Agent API — Nyhet från den 7 oktober: Agent API stöder
anthropic/claude-haiku-5-5till Anthropics priser, 0,10 dollar per miljon indatatokens och 0,50 för utdata upp till 100 000 indatatokens, därefter 0,50 och 2,50 över den gränsen. 🔗 källa - Delad eller dedikerad inferens — En guide från Cohere för Embed och Rerank slår fast att förfrågningarnas utformning spelar större roll än deras antal och beräknar illustrativa lönsamhetsgränser jämfört med en instans med en dedikerad NVIDIA A10-GPU: ungefär 4 förfrågningar per minut för långa dokument, 20 för en katalog och 29 för omrankning (reranking). 🔗 källa
- Agent eller MCP — Perplexity publicerar en guide som skiljer agenten, som fattar beslut, från MCP, som kopplar den till verktygen, med en tabell för att välja, ett exempel med en nätbutik och fyra risker med tillhörande skyddsåtgärder; enligt guiden kan Claude, ChatGPT eller Cursor tilldela Computer en uppgift via Perplexitys MCP-server. 🔗 källa
Vad det innebär
En agent orkestrerar numera många andra, och var och en får en identitet. Gemini-agenten startar underagenter som var och en har en egen identitet och kan bli en agentkollega med en egen adress; Claude Managed Agents låter en agent skriva ett program som startar upp till 1 000 andra; Grok Bot får en e-postadress för att agera utanför systemet, och Block ger Claude Fable ansvaret för att leda dussintals modeller i en och samma migrering. Den allt viktigare frågan är inte längre om agenten klarar uppgiften, utan hur man håller den under kontroll. Google svarar med Agent Gateway, Agent Sandbox, en granskningslogg i varje agents namn och kostnadstak i realtid; Anthropic med en sessionsbudget som pausar alla körningar när den nås; OpenAI med en sandbox för Windows med striktare begränsningar för nätverk och filer.
Användningen av flera modeller etablerar sig hos själva plattformarna. Google, som utvecklar Gemini, låter sin egen agent orkestrera Claude-modeller, skiljer uttryckligen valet av modell från valet av agent och gör Claude Opus 5.5 och Sonnet 5.5 tillgängliga i Antigravity, där de debiteras inom samma kostnadstak som dess egna modeller. Genspark och Perplexitys Agent API lägger till Claude Haiku 5.5 under dagarna efter lanseringen, LegalOn fördelar sitt kodarbete mellan tre modeller från OpenAI utifrån uppgifternas karaktär, och Block bygger en automatisk modellväljare.
Enhetskostnaden fortsätter att sjunka, och varje tillkännagivande sätter siffror på det: 0,016 dollar per bild för Qwen-Image-2.1-Turbo, 2,5 gånger billigare än Pro-versionen; 15 dollar per miljon tecken för HeyGen Voice till och med den 31 oktober, därefter 30, lägre än för Eleven v4 Turbo; 0,017 dollar per 1 000 beslut för pplx-decider-v1.1-27b; sex modeller publicerade på Hub för en beräkningskostnad på cirka 103 dollar med ML Intern. Förstaplaceringarna kräver däremot en noggrann läsning: HeyGen Voice ligger bara först i rankningen med kontrollerade röster, och pplx-decider delar sin placering med nio andra modeller vars konfidensintervall överlappar.
Inom hälso- och sjukvården behövs fortsatt försiktighet. AMIE-studien som publicerats i The Lancet är en genomförbarhetsstudie, utförd på en enda plats, utan kontrollgrupp och finansierad av Alphabet: 98 patienter, ingen konversation avbruten av säkerhetsskäl, en noterad hallucination. Det är ett steg mot större prövningar, som författarna själva efterlyser, inte ett godkännande eller ett införande i patientvården.
Källor
- Gemini at Work 2026 (Google Cloud-bloggen)
- Versionsinformation för Gemini Enterprise
- Tillkännagivande av HeyGen Voice (@HeyGen)
- Resultat från Artificial Analysis (@ArtificialAnlys)
- Voxtral Mini 4B Realtime Arabic (Hugging Face)
- LIDstral Arabic (Hugging Face)
- Dynamiska workflows i Claude Managed Agents (@ClaudeDevs)
- Dokumentation om workflow-körningar (Claude Platform)
- Förutsägelser i skrivfältet i Codex (@OpenAIDevs)
- Hjälpartikel om förutsägelser i skrivfältet (OpenAI)
- MXC-sandbox för Codex på Windows (@OpenAIDevs)
- Dokumentation om Windows-sandboxen (ChatGPT Learn)
- Claude Code 2.1.296 (GitHub)
- Vibe CLI 2.26.1 (GitHub)
- Qwen-Image-2.1-Turbo (@Alibaba_Qwen)
- Qwen-Image-2.1-Turbo (Hugging Face)
- Changelog för Midjourneys alpha-version
- Test av Thinking-läget (Midjourney)
- Syren (Synthesia)
- Playground (Google-bloggen)
- Klinisk studie av AMIE (Google-bloggen)
- AMIE-studien i The Lancet
- Meddelande från OpenAI:s forskningschefer (@OpenAINewsroom)
- Sex modeller med ML Intern (Hugging Face-bloggen)
- Ai2:s GPU-schemaläggare (Ai2-bloggen)
- pplx-decider-v1.1-27b på Decision Bench (@perplexitydevs)
- Decision Bench-rankningen
- Grok Bots e-postadress (@bot)
- ElevenLabs i Singapore (ElevenLabs-bloggen)
- Projects i Claude Code (@ClaudeDevs)
- Bygga effektiva agentautomatiseringar (claude.dev)
- Block och Claude Fable (claude.com)
- Versionsinformation för Claude Platform
- Codex CLI 0.162.1 (GitHub)
- Versionsinformation för ChatGPT Enterprise och Edu
- Sophos och OpenAI Daybreak (OpenAI)
- Asana och StackAI:s navigeringsagent (OpenAI)
- LegalOn och Codex (OpenAI)
- Gemini CLI v0.64.0-preview.1 (GitHub)
- Changelog för Antigravity
- Versionsinformation för Gemini API
- Plugins för Google Flow Music (Google-bloggen)
- Google Earth AI och folkhälsa (Google-bloggen)
- Debitering för Copilot code review (GitHubs changelog)
- Copilot CLI 1.0.95 (GitHub)
- GitHub MCP Server 2.0.0 (GitHub)
- Claude Haiku 5.5 i Genspark (@genspark_ai)
- Meta VR-modell för v0 (Meta)
- v0 för team (@v0)
- DeepSeek Harness 0.2.1-alpha.2 (GitHub)
- OGX 1.5.0 (GitHub)
- GenIA (GitHub)
- Beslutsmodeller på Hub (Hugging Faces changelog)
- Darwin-27B-ZTC-v2 och System One Mosaic Benchmark (Hugging Face-bloggen)
- Beslutsmodellernas konfidens (Hugging Face-bloggen)
- FineEnvs/openai-math (Hugging Face)
- Teknisk rapport om JOSIE-2 (Hugging Face-bloggen)
- Gradio 6.30.0 (GitHub)
- tokenizers 0.23.3 (GitHub)
- Vetenskaplig granskning med AI (@SakanaAILabs)
- Uppdatering av Suno Studio (@suno)
- Världsmodellernas sista prov i fysik (Einsia)
- Omniverse-simuleringar byggda av agenter (NVIDIA-bloggen)
- Grok Bot och Shopify (@bot)
- Grok Bot och sökning på X (@bot)
- Genomgång av Grokipedia v0.3 (@Grokipedia)
- mistral CLI 0.8.0 (GitHub)
- Mistrals Python SDK 3.2.0 (GitHub)
- Qwen Code v0.25.1-preview.1 (GitHub)
- Modeller i Agent API (Perplexity)
- Delad eller dedikerad inferens för Embed och Rerank (Cohere-bloggen)
- Agent eller MCP (Perplexity-bloggen)