Sök

Google presenterar Gemini 4 Argon, OpenAI uppger sig ha avvärjt en destillationskampanj, Cohere lanserar Embed 5

ai-powered-markdown-translator

Artikel översatt från fr till sv med gemini-3.8-flash-medium.

Visa projekt på GitHub ↗

Onsdagen den 30 september presenterar Google Gemini 4 Argon, en gränsmodell som först rullas ut till betrodda cybersäkerhetsförsvarare inom Fairwind Program, med en utdatagräns utökad till 1 miljon tokens. OpenAI uppger sig ha avvärjt en samordnad kampanj för att extrahera det skyddade resonemanget från sina modeller, vars kärna tillskrivs individer kopplade till Moonshot AI. Cohere lanserar Embed 5 med en egen utvärderingsmetod, Ideogram 4.5 lovar successiva redigeringar utan artefakter och HeyGen släpper en videomodell byggd på MiniMax H3; på utvecklarsidan släpps Claude Code 2.1.286, Zed 1.22.0 och VS Code 1.140 samma dag.


Gemini 4 Argon: Googles nya gränsmodell, först till cybersäkerhetsförsvarare

30 september — Google tillkännager Gemini 4 Argon, sin nya gränsmodell, i ett inlägg undertecknat av Koray Kavukcuoglu, Senior Vice President på Google DeepMind och Googles chefsarkitekt för AI (Chief AI Architect). Argon är utformad för att hantera djupgående resonemang över långa och komplexa arbetsflöden (long-horizon workflows) inom tre områden: mjukvaruutveckling under verkliga förhållanden, kunskapsarbete i företag (juridik, finans) och cyberförsvar.

Modellen är ännu inte öppen för allmänheten. Den rullas först ut till en grupp betrodda cyberförsvarare inom Fairwind Program, som lanserades den 2 september med Gemini 3.8 Flash Cyber, och som liksom Googles interna team får den utan cyberskyddsräcken (cyber guardrails). Utvecklare, företag och allmänheten kommer att följa ”så snart som möjligt”, med start för betalande API-kunder och Google AI Ultra-prenumeranter, utan något tillkännagivet datum. Tills dess stärker Google avvisandet av skadliga förfrågningar inom cyber och CBRN, övervakningen av tankekedjan och modellens åtgärder, samt isolerar sina högriskträningar och utvärderingar i förseglade sandlådor; företaget uppger också att det deltar i den amerikanska regeringens frivilliga process för åtkomst till modeller före lansering.

Introducing Gemini 4 Argon – our new frontier model. It’s built for complex workflows across coding, enterprise knowledge work, and cybersecurity defense – rolling out today to a set of trusted testers through our Fairwind Program.

🇸🇪 Här är Gemini 4 Argon, vår nya gränsmodell. Den är utformad för komplexa arbetsflöden inom programmering, kunskapsarbete för företag och cyberförsvar, och rullas från och med idag ut till en grupp betrodda testare via vårt Fairwind Program. — @GoogleDeepMind på X

Priset är redan fastställt: som lanseringspris 2 dollar per miljon indata-tokens och 10 dollar för utdata, vilket motsvarar priset för GPT-6.1 Sol som lanserades dagen innan, och därefter 4 respektive 20 dollar efter en periods slut vars längd inte anges; cachad indata kostar 95 % mindre än indata. Utdatagränsen höjs till 1 miljon tokens, jämfört med 64K tidigare, vilket enligt Google är branschens högsta: modellen kan generera hundratusentals tokens i en och samma bana för att lösa ett svårt problem.

Pris per miljon tokensLanseringsprisPris efter lanseringsperioden
Indata2 dollar4 dollar
Utdata10 dollar20 dollar

Google DeepMinds sida jämför Argon med GPT-6 Astra, Claude Fable 5.1 och Claude Opus 5.5 över nitton rader. Argon uppnår högsta resultat på 13 av dem, delar förstaplatsen med GPT-6 Astra på CWE-bench v1 (68 %) och blir omkörd på 5. Agentisk kod är det mest omtvistade området: etta på DeepSWE v1.1 (77,9 %) och på Vibe Code Bench, slutar Argon sist av de fyra på FrontierSWE v2 och på Terminal-bench 4.0. Dess försprång är tydligt inom kunskapsarbete, särskilt på Harveys Legal Agent Benchmark (19,6 % mot som bäst 6,7 % för de övriga tre), samt i lång kontext mellan 256K och 1M tokens. Det bästa resultatet på varje rad visas i fetstil.

Utvärderat benchmark (domän)Gemini 4 ArgonGPT-6 AstraClaude Fable 5.1Claude Opus 5.5
Vals Index (kunskapsarbete)68,9 %63,1 %65,8 %67,0 %
AutomationBench (kunskapsarbete)51,3 %41,4 %31,4 %42,5 %
Vals Finance Agent v2 (kunskapsarbete)65,4 %53,5 %58,9 %58,6 %
Harveys Legal Agent Benchmark (kunskapsarbete)19,6 %5,4 %6,7 %3,8 %
DeepSWE v1.1 (agentisk kod)77,9 %74,1 %67,4 %74,2 %
FrontierSWE v2 (agentisk kod)55,0 %65,5 %56,3 %62,3 %
Vibe Code Bench (agentisk kod)91,9 %89,6 %90,3 %90,3 %
Terminal-bench 4.0 (agentisk kod)57,4 %58,2 %57,9 %66,4 %
PostTrainBench (ML-teknik)45,3 %44,3 %40,2 %49,3 %
Terminal-Bench Science 0.1 (vetenskap och matematik)57,6 %68,1 %52,6 %63,3 %
LABBench 2 (vetenskap och matematik)88,8 %85,4 %68,6 %73,1 %
RiemannBench (vetenskap och matematik)76,0 %72,0 %65,6 %69,6 %
GraphWalks BFS upp till 128K (lång kontext, F1)99,7 %98,7 %91,4 %90,6 %
GraphWalks BFS från 256K till 1M (lång kontext, F1)84,2 %71,8 %65,0 %66,8 %
Agent’s Last Exam (datoranvändning)39,5 %34,2 %—38,2 %
OSWorld-2.0, offline-delmängd, delpoäng (datoranvändning)69,2 %72,6 %——
Chartography (multimodal förståelse)71,6 %71,0 %46,2 %66,3 %
LVBench (multimodal förståelse)91,7 %87,5 %79,7 %83,7 %
CWE-bench v1 (cybersäkerhet)68,0 %68,0 %58,0 %67,0 %

På Google använder tusentals anställda den redan. I libgav1, Googles videoavkodare med öppen källkod, har Argon-agenter ersatt 32 000 rader SIMD-kod från en befintlig Rust-portering med säker Rust: den resulterande avkodaren är 2,7 gånger snabbare än denna portering, med identisk videoutdata. Andra agenter har förberett minnesoptimeringar för datacenter som förväntas frigöra mer än 300 TiB när de väl har driftsatts. Inom cybersäkerhet använder Wiz den i sitt initiativ Scan for Good: Argon upptäckte där en kritisk sårbarhet i en vårdprogramvara som används av sjukhus över hela världen, vilken exponerade känsliga personuppgifter och som tidigare gränsmodeller hade missat.

🔗 Gemini 4 Argon: our next era of frontier intelligence (Google-bloggen) 🔗 Google DeepMinds Gemini-sida och benchmarktabell


OpenAI uppger sig ha avvärjt en destillationskampanj och tillskriver kärnan till individer kopplade till Moonshot AI

30 september — I ett inlägg under sin Security-avdelning uppger OpenAI att de upptäckt och därefter neutraliserat en samordnad kampanj i syfte att extrahera det skyddade resonemanget (protected reasoning) från sina modeller, det vill säga det interna spår en modell genererar för att bearbeta en uppgift. Företaget betraktar detta som fientlig destillation (adversarial distillation): systematisk och obehörig användning av en modells utdata eller resonemang för att träna, reproducera eller förbättra en annan modell.

Enligt OpenAI har operatörerna varken knäckt krypteringen, komprometterat någon databas eller fått direkt åtkomst till användarnas lagrade konversationer. De manipulerade interaktionerna så att det skyddade resonemanget återkom i synlig form, till exempel genom att kopiera det krypterade resonemanget från en konversation och be en modell i en annan konversation att dekryptera och transkribera det. Oberoende forskare hade genom ansvarsfullt avslöjande rapporterat liknande sårbarheter, beskrivna i artikeln ”Stealing Reasoning Traces from Proprietary LLM APIs” som laddades upp på arXiv den 10 augusti; OpenAI bekräftar att dessa attackvägar var verkliga.

KampanjstegDatum eller volym noterad av OpenAI
Aktivitetens början, i låg volym1 juli
Aktivitetstoppar24 och 25 juli
Förfrågningar som följer extraktionsmönstret under topparna16 000, från fler än 4 000 användare
Grupp kopplad till detta mönsterfler än 15 000 användare
Fullständig neutralisering av gruppen28 juli

Gällande attribueringen förblir inlägget försiktigt: det är inte fastställt att alla operatörer tillhör samma aktör, och topparnas 16 000 förfrågningar är extraktionsförsök som inte nödvändigtvis lyckades. OpenAI tillskriver dock en kärna av aktiviteten till individer kopplade till Moonshot AI, utvecklaren av Kimi.

… we attribute a core cluster of the activity to individuals associated with Moonshot AI …

🇸🇪 … vi tillskriver en kärna av aktiviteten till individer kopplade till Moonshot AI … — OpenAI, inlägg i Security-avdelningen

Som svar har OpenAI spärrat eller begränsat de bedrägliga kontona, skärpt sina registrerings- och infrastrukturkontroller, utökat övervakningen av kopplade nätverk och förstärkt skyddet för det dolda resonemanget mellan användare, arbetsytor, organisationer och modellfamiljer. Företaget har stängt en väg som gjorde det möjligt att återuppspela en annan användares krypterade resonemang för att återskapa dess innehåll, och lagt till kontroller som upptäcker och håller tillbaka strömmande utdata (streaming) som riskerar att exponera det. Resultaten har delats via Frontier Model Forum och statliga kanaler: enligt OpenAI är tekniken inte unik för dess modeller, och alla system som gör resonemang portabla eller återuppspelningsbara kan utsättas för liknande risker. Företaget framhåller fientlig destillation som en risk för säkerhet och nationell säkerhet, då ett extraherat resonemang kan användas för att träna en annan modell utan originalets skyddsräcken. Ämnet är inte nytt: i februari tillskrev Anthropic destillationskampanjer till DeepSeek, Moonshot AI och MiniMax, och Anthropic debiterar sedan den 24 september blockerade förfrågningar i flera kategorier, däribland resonemangsextraktion.

🔗 Artikeln ”Stealing Reasoning Traces from Proprietary LLM APIs” på arXiv


Embeddings: Cohere lanserar Embed 5 och mätvärdet RCP-nDCG@10, Perplexity släpper pplx-embed-v2-context-9b-preview

30 september — Cohere lanserar Embed 5, en familj av embedding-modeller för företagssökning, i två nivåer som delar samma embedding-rymd: Embed 5 Pro, för maximal kvalitet och offline-indexering, och Embed 5 Fast, för interaktiv sökning, storskalig RAG och agentbaserad sökning. Det går att indexera en korpus med Pro och sedan söka i den med Fast utan att omindexera någonting, förutsatt att samma utdatadimension bibehålls: på 40 utvecklingsdataset behåller detta mönster, som rekommenderas av Cohere, i genomsnitt 98,4 % av kvaliteten hos ett system som helt körs på Pro, jämfört med 96,6 % för ett system som enbart körs på Fast.

Båda modellerna läser upp till 128K tokens, accepterar text, bilder eller båda sammanslagna i samma vektor, täcker fler än 100 språk och producerar vektorer med 256 till 2 048 dimensioner i float, int8 eller binärt format. Cohere rekommenderar 1 024 dimensioner i int8, vilket motsvarar 1 kB per vektor jämfört med 8 kB i float32 vid 2 048 dimensioner. Pro kostar 0,12 dollar per miljon text-tokens och Fast 0,08 dollar, en tredjedel mindre, för en dokumentgenomströmning som i genomsnitt är 2,4 gånger högre; bild debiteras med 0,40 dollar per miljon tokens för båda. Embed 5 är tillgänglig från och med i dag via Coheres API, Model Vault, Microsoft Foundry och Amazon SageMaker, samt i North, och kan driftsättas privat med vLLM.

Benchmark (mätvärde)Embed 5 ProEmbed 5 FastAndra omnämnda modeller
ViDoRe V3, 8 domäner (RCP-nDCG@10)85,884,5Voyage 4 Large 83,7; Gemini Embedding 2 83,2; OpenAI text-embedding-3-large 75,5
FinanceBench (RCP-nDCG@10)80,180,0Pro 21,4 punkter före OpenAI text-embedding-3-large
FinQA (RCP-nDCG@10)90,088,8—
ViDoRe V3 Finance (RCP-nDCG@10)85,083,9—
Analyserade PDF:er, svitgenomsnitt (RCP-nDCG@10)84,883,4Voyage 4 Large 83,6; Gemini Embedding 2 80,8; Embed 4 78,6
Sammanslagen text och bild, 5 set (nDCG@10)82,381,2Gemini Embedding 2 61,3
Sidbild, 5 finansiella set (nDCG@10)77,073,2Embed 4 71,1; Voyage Multimodal 3.5 70,1; Gemini Embedding 2 56,7
5 europeiska språk (nDCG@10 eller RCP-nDCG@10)77—Voyage 4 Large 76; Gemini Embedding 2 73

De flesta av dessa poäng uttrycks i RCP-nDCG@10, den utvärderingsmetod som Cohere publicerar samma dag (se nedan): en not i inlägget klargör att den omordnar en fast uppsättning kandidater och därmed mäter rankningskvalitet snarare än hämtning på första nivån. Den andra flerspråkiga tabellen förtjänar en noggrann genomläsning: Cohere lyfter där fram sina framsteg jämfört med Embed 4, upp till 13 poäng på farsi, men på dessa tio språk ligger Gemini Embedding 2 före Embed 5 Pro på nio av dem, med kinesiska som enda undantag, och Voyage 4 Large ligger före på fem. Cohere kommer att presentera Embed 5 under en session på X den 8 oktober.

🔗 Coheres inlägg om Embed 5 · Tillkännagivande från @cohere på X

RCP-nDCG@10, mätvärdet som Cohere utvärderar Embed 5 med

30 september — Cohere publicerar även RCP-nDCG@10 (Rubric-Calibrated Preferences nDCG@10), sin utvärderingsmetod för informationssökning. Utgångspunkt: nDCG, mätvärdet för MTEB och BEIR, jämför resultaten med en lista över förhandsannoterade dokument, vilken oundvikligen är ofullständig, så att ett relevant dokument som aldrig annoterats inte ger några poäng; i Coheres studie bedöms 28 % av dokumenten som markerats som icke-relevanta ändå som användbara av människor. RCP-nDCG@10 överlåter bedömningen till en kalibrerad AI-domare, som svarar på fem identiska ja/nej-frågor för varje sökfråga och jämför dokument i grupper. Blindvalidering med 46 annoterare över 289 dueller: när de två mätvärdena utser olika vinnare ger människorna rätt till RCP-nDCG i 70 % av fallen. Artikeln, koden och datamängderna har publicerats, och huvudförvaltaren för MTEB tillkännager att det integreras. Cohere uppger att de har optimerat sin femte generation av Embed och Rerank mot detta mätvärde, varav den senare ännu saknar datum, och varnar för att dessa modeller inte alltid kommer att framstå som bäst enligt enbart historisk nDCG.

🔗 Coheres inlägg om RCP-nDCG@10 · Kod och data på GitHub

Perplexity släpper pplx-embed-v2-context-9b-preview och benchmarktestet context-bench

30 september — Perplexity släpper som förhandsversion, under MIT-licens på Hugging Face, pplx-embed-v2-context-9b-preview, en kontextuell embedding-modell: varje fragment av ett dokument kodas med hela dokumentet i sikte, så att ett stycke som säger ”hon” förblir kopplat till rätt entitet. I stället för ett enda ”guldfragment” (gold passage) per sökfråga lär sig modellen från en lärare – Perplexitys kontextkomprimeringsmodell – som poängsätter varje token i dokumentet: den lär sig på så sätt att hitta svaret och de stycken som styrker det. Vid en blind utvärdering på context-bench, ett privat benchmarktest från turbopuffer, som är medförfattare till inlägget (2 099 sökfrågor, 38 894 dokument), placerar den sig före voyage-context-4; på ConTEB uppnår den det bästa genomsnittet utan att vinna samtliga uppgifter. Perplexity varnar för att vikter och gränssnitt fortfarande kan ändras, och förbereder åtkomst via sitt API, utan angivet datum.

Mått publicerat av Perplexitypplx-embed-v2-context-9b-previewSkillnad mot voyage-context-4
Svarsåterkallning på context-bench, vid K = 1045,5 %+14,4 punkter
Bevisåterkallning på context-bench, vid K = 1040,6 %+5,0 punkter
Lagring per vektor (1 024 dimensioner, int8)1 kB8 gånger mindre än voyage-context-4 i float32

🔗 Inlägg från Perplexity Research · Modell på Hugging Face


Ideogram 4.5: en bildredigeringsmodell utformad för successiva redigeringar

30 september — Ideogram lanserar Ideogram 4.5, som man presenterar som ”den mest precisa redigeringsmodellen”. Utgångspunkten: vid varje redigering lägger bildmodeller till artefakter, pixelförskjutningar och färgavvikelser, så att en bild snabbt blir oanvändbar efter flera omgångar. Ideogram 4.5 är utformad för att eliminera denna ackumulering och möjliggöra redigering i flera steg (multi-turn editing).

Introducing Ideogram 4.5, the most precise edit model. With each edit, leading models add artifacts, pixel shifts, and color changes. Ideogram 4.5 eliminates artifact buildup, making multi-turn editing possible. Live in Ideogram, the API, and launch partners. Open weights soon.

🇸🇪 Här är Ideogram 4.5, den mest precisa redigeringsmodellen. Vid varje redigering lägger de ledande modellerna till artefakter, pixelförskjutningar och färgförändringar. Ideogram 4.5 eliminerar ackumuleringen av artefakter, vilket möjliggör redigering i flera steg. Tillgänglig i Ideogram, i API:et och hos lanseringspartner. Öppna vikter kommer snart. — @ideogram_ai på X

För att styrka detta publicerar Ideogram en jämförelse sida vid sida av samma successiva redigeringar med GPT Image 2.5 Sunburst, Nano Banana Pro och Nano Banana 2, vars utdata enligt företaget blir oanvändbara efter ett fåtal redigeringar. Jämförelsen är visuell, utan sifferbetyg. Exemplen omfattar färg och belysning (skuggor, reflektioner och högdagrar följer förändringen utan att kompositionen rubbas), textändringar, produktfotografering, inredningsdesign, restaurering av gamla foton steg för steg, övergång från en skiss eller djupkarta till en bild, samt beskärning.

Modellen introducerar även redigering i valfri upplösning (Zoom editing): ett område i en högupplöst bild, på 24,2 megapixel (4 016 × 6 016 pixlar) i Ideograms exempel, redigeras utan att bilden förminskas, och dess kanter bevaras för att återintegreras utan synliga skarvar. Trots att modellen är utformad för riktad redigering presterar den enligt Ideogram också mycket bra vid allmän redigering.

Del av tillkännagivandetVad vi vet om det
Tillgänglighetfrån och med 30 september i Ideogram och i API:et
LanseringspartnerPika och Luma, som tillkännager det samma dag
Öppna vikterutlovas ”snart”, i likhet med Ideogram 4.0 som släpptes i juni
Prisej publicerat

🔗 Modellsida för Ideogram 4.5


HeyGen Video: en videomodell byggd på MiniMax H3, öppen via API

30 september — HeyGen lanserar HeyGen Video, en videogenereringsmodell riktad till företag som vill ha video av produktionskvalitet utan att betala fullt pris. Modellen bygger på MiniMax H3 och har eftertränats av HeyGen; den skapar video utifrån text eller bild, med ljud genererat i samma anrop, och används via HeyGens API samt på OpenRouter, Runware och ComfyUI.

När det gäller priset förekommer tre olika siffror. Priset startar på 0,01 dollar per sekund fram till slutet av oktober, vilket motsvarar 50 % rabatt på ordinarie pris på 0,02 dollar, enligt katalogsidan. Dess jämförelsetabell anger däremot listpriset i 768p med ljud, före lanseringskampanjer: 0,03 dollar per sekund. Även till det priset är HeyGen Video billigast bland de jämförda modellerna.

Jämförd modellListpris per sekund (768p, ljud)HeyGens interna Elo (HeyGen Video = 1 000)
HeyGen Video0,03 dollar1 000
Seedance 2.00,303 dollar955
H3 Max0,08 dollar952
H3 Max Turbo0,04 dollar920
H3 Max balanced0,08 dollar860
Kling 3.0 Pro0,168 dollar857
Veo 3.10,40 dollar744

Vad gäller kvaliteten lutar sig HeyGen mot en intern utvärdering utförd på förfrågningar från Artificial Analysis Arena (4 800 röster), med Elo normerat till 1 000 för den egna modellen. I blind preferens mot H3 Max går 55,8 % av de 650 rösterna till HeyGen Video, inom ett intervall på 49 till 62 % som inte utesluter oavgjort. För ett 10-sekundersklipp från bild till video sjunker diffusionstransformatorns inferenstid till 3,7 sekunder, jämfört med 4,1 för H3 Max Turbo och 8,3 för H3 Max, exklusive tiden för textning.

MiniMax välkomnade lanseringen och lyfte samma dag fram ytterligare en modell härledd från H3: Boreal-H3 från Creatify, en videomodell optimerad för reklam.

🔗 HeyGen Video-katalog · Tillkännagivande från @HeyGen på X


Allmänna assistenter och agenter: Gemini-skills, Manus Flex och Grok Bot

Gemini-appen lanserar skills, som kommer att ersätta Gems

30 september — Google lanserar skills i Gemini-appen: instruktioner som sparas en gång och anropas genom att skriva ett snedstreck följt av deras namn. Gemini kan även skapa dem utifrån konversationer och starta dem på eget initiativ när en prompt matchar; flera skills kan kombineras, och varje skill kan innehålla referensfiler (ren text, PDF:er, bilder). De finns redan i Gemini Spark och rullas nu ut i Gemini-chatten över hela världen för alla Google AI-prenumerationsnivåer och, för närvarande, för användare som är 18 år och äldre; Workspace-kunder följer under de kommande veckorna. Skills kommer att ersätta Gems, som försvinner från och med november för personliga konton, i mars 2027 för Workspace business, enterprise och nonprofit samt i juni 2027 för utbildningskonton, med en automatisk migrering. Opal, verktyget för att skapa miniapplikationer, kommer också att stängas i november, liksom ”Gems by Google Labs”, vilka inte kommer att migreras.

🔗 Let skills in Gemini tackle your most repetitive tasks (Googles blogg)

Manus Flex: egen API-nyckel i Manus-agenten

29 september — Manus lanserar Manus Flex, som gör det möjligt att driva Manus med en API-nyckel från en inferensleverantör som stöds (bring your own API key). Hittills har Manus självt valt modell och tillhandahållit agentramverket och infrastrukturen; med Flex driver leverantörens nyckel samma projekt, verktyg, körmiljöer och agentarbetsflöden, med valfri huvudmodell och nivå av resonemangsansträngning. Debiteringen delas upp: inferensen faktureras direkt av leverantören, medan de övriga tjänsterna och infrastrukturen som tas i anspråk av en uppgift fortsätter att förbruka Manus-krediter. OpenRouter, Fireworks och Modal är de tre första medlemmarna i partnerprogrammet för inferens (Manus Flex Inference Partner Program). Inlägget, som publicerades dagen efter lanseringen av Manus 2.0, anger varken abonnemang, pris eller modellista.

🔗 Introducing Manus Flex

Grok Bot överlåter kodningen till Cursor och hanterar pull requests

30 september — Två dagar efter Team Bots förstärker SpaceXAI Grok Bot för mjukvaruutveckling. I en tråd från kontot @bot meddelar utvecklaren att deras Bots kan överlåta kodningsuppgifter till Cursor, hantera pull requests via tillägg för GitHub och Origin (det senare beskrivs inte) samt dela videodemonstrationer av vad de bygger. SpaceXAI publicerar även, i form av mallar att installera (templates), Bots från det egna ingenjörsteamet, vardera levererad med sina skills, rutiner och anslutningar. Tråden anger varken abonnemang, pris eller datum, och inget inlägg finns publicerat på x.ai. Kopplingen till Cursor är inte ny: Grok Bot for Enterprise erbjöds gratis under två veckor för kunder med Grok och Cursor Enterprise i början av september; förändringen är att en Bot nu självständigt delegerar kodningsarbetet.

🔗 Tråd från @bot på X


Robotik och världsmodeller: Praxis-1 från Runway, MolmoAct 2 från Ai2 och Physis-Lang från NVIDIA

Runway presenterar Praxis-1, en världsaktionsmodell med öppna vikter

30 september — Runway presenterar Praxis-1, sin första världsaktionsmodell (world action model) med öppna vikter, avsedd att styra verkliga robotar. Den bygger på samma videoförträning som deras världsmodeller, såsom Solaris eller GWM Worlds 2, och syftar till att vara en generell policymodell för robotikutvecklare och -forskare. Runways satsning: robotdemonstrationer är sällsynta, medan video är i det närmaste obegränsat. En och samma policy rör sig från en studio till ett kök utan omträning i deras demonstrationer. Inget går att ladda ner ännu: Praxis-1 testas hos Noble Machines, Standard Bots och Ultra, var och en på sin egen hårdvara, och den publika lanseringen, inklusive vikter, aviseras under de kommande månaderna.

Mått publicerat av RunwayAnnonserat resultat
Korrelation mellan simulering i världsmodellen och verkliga resultat0,95
Slutligt placeringsfel efter finjustering, med webbvideo16,1 cm
Samma fel med video från teleopererad robot16,0 cm

🔗 Praxis-1 på Runway Research

Ai2:s MolmoAct 2 i topp på Reality Check, efter finjustering av benchmarkens arrangör

30 september — Ai2 meddelar att MolmoAct 2, deras helt öppna robotikmodell, hamnar på första plats i övergripande framgång på Reality Check, ett oberoende benchmarktest för manipulering i verkliga miljöer, med en betydande reservation: modellerna finjusteras där av arrangören, Poke & Wiggle, på benchmarkens uppgifter. Reality Check, som lanserades dagen innan av detta företag, omfattar 14 400 körningar på verkliga robotar, på FR3 Duo-stationer installerade på Deutsches Museum i München, i tio miljöer (sortera skruvar, koppla in en DC-kontakt, öppna en verktygslåda med skruvmejsel…). Två spår återstår som ”kommande”: föremål placerade utanför träningsområdet och delvis träning på 100 timmars data från stationerna.

Utvärderad modellÖvergripande framgångFramgång efter cirka 10 demonstrationer per miljöFramgång efter cirka 300 demonstrationer per miljö
MolmoAct 228 %4 %44 %
Pi 0.521 %5 %33 %
DiT-Flow19 %2 %29 %
GR00T N1.712 %4 %19 %

🔗 Tweet från Ai2 · Resultattavla för Reality Check

Physis-Lang: bildtexter som förklarar fysik för världsmodeller

29 september — Forskare från NVIDIA, MIT och Oxfords universitet publicerar Physis-Lang, ett ramverk som tillför fysikaliskt resonemang till videobildtexter för att förbättra världsmodeller. Bildtexterna gör orsakerna, de verkande lagarna och effekterna explicita; en specialiserad granskare upptäcker saknade eller ogrundade påståenden, en agent förfinar bildtextinstruktionerna, och modellens misslyckanden används för att söka efter videor som fyller igen dess kunskapsluckor. Enligt NVIDIA förbättrar tillägget av detta resonemang enbart i prompten, utan omträning, PhyGenBench-poängen för Cosmos 3 med 5,62 poäng. Med träning tar Physis-Lang på Cosmos3-Super och Cosmos3-Nano de två främsta platserna på topplistan Physics-IQ Verified för bild-till-video (48,2 och 43,3, jämfört med 42,7 för det tidigare bästa resultatet). PhyGenBench och VideoPhy-2 bedöms av GPT-5.5, och Veo 3.1 behåller ett knappt övertag på hela VideoPhy-2-mängden.

Benchmark för videofysikCosmos3-NanoVeo 3.1Physis-Lang på Cosmos3-Nano
PhyGenBench61,6765,6371,04
Physics-IQ Verified40,2334,9943,41
VideoPhy-2 Hard48,3158,4362,36
VideoPhy-2, fullständig uppsättning60,4168,8768,02

🔗 Projektsida för Physis-Lang · Tillkännagivande från @NVIDIAAI på X


Öppna modeller: Hunmin-397B-A17B-CUA och JEV-27B-VL

Hunmin-397B-A17B-CUA ympar agentförmågorna från Qwen-CUA på en MoE med 397 miljarder parametrar

30 september — På Hugging Faces community-blogg redogör hojun Lee för Hunmin-397B-A17B-CUA, en modell för datoranvändning (computer use) som publicerats under Apache-2.0 av organisationen mncai, med ett förbehåll från författarna själva: utvärderingarna är hemmagjorda, med en enda körning för agentbenchmarktesterna, och är inte jämförbara med publicerade rankningar (basmodellen får 48,16 på OSWorld här, jämfört med 62,2 som rapporterats på OSWorld-Verified). Modellen bygger på Qwen3.5-397B-A17B, en Mixture of Experts med 17 miljarder aktiva parametrar, och hela projektet rymdes på en enda nod med åtta B200. Teamet beräknade viktskillnaden mellan sin bas och Qwen-CUA, som redan är specialiserad, och ympade bara in en lågrangsversion av den på ett urval av moduler: enbart denna överföring höjer OSWorld-316 från 48,84 till 68,25, utan att ärva Qwen-CUA:s svaghet i visuell förankring. En finjustering följd av förstärkningsinlärning med GRPO lägger till 4,3 poäng.

Testbänk (eget protokoll)Basmodell Qwen3.5-397BHunmin-CUAQwen-CUA (källa)
OSWorld, 360 uppgifter48,1670,4577,12
WindowsAgentArena, 153 uppgifter41,7750,8556,68
ScreenSpot-Pro72,7475,6162,20
KMMLU-Pro (koreanska)77,9176,1271,41

🔗 Inlägg om Hunmin-CUA · Vikter på Hugging Face

AutoTrust AI publicerar JEV-27B-VL, en öppen beslutsmodell som även bedömer bilder

30 september — AutoTrust AI publicerar under Apache-2.0 JEV-27B-VL, versionen med synförmåga av JEV-27B, deras öppna beslutsmodell som presenterades den 27 september. Man visar den bilder och text, ställer en fråga, och den svarar i en enda körning med en kalibrerad sannolikhet för varje alternativ, på runt hundra millisekunder; när frågan kräver det resonerar den steg för steg medan den tittar på bilderna. Dess beslutshuvud har dock inte sett några bilder under träningen. Huvudtest: på MicroLens, en offentlig datamängd för kortvideoappar, rangordnar den 20 videokandidater för 200 användare enbart utifrån miniatyrbilder, och når samma AUC som en samarbetsfiltrering tränad på 59 045 användare, med en högre andel rätt video i topp 5. Författarna påminner om att detta resultat kommer från en enda datamängd med 200 användare.

Rekommendationsmetod på MicroLensAUCRätt video i topp 5
JEV-27B-VL, endast miniatyrbilder, utan interaktionsdata0,72759 %
Samarbetsfiltrering tränad på 59 045 användare0,72849 %
JEV-27B-VL, endast titlar0,64946 %
Slumpmässig ordning0,48921 %

🔗 Inlägg om JEV-27B-VL


Topplistor: Hugging Faces Open TTS Leaderboard och AURORA från LILT

Hugging Face lanserar Open TTS Leaderboard, en öppen topplista för talsyntes

30 september — Hugging Face lanserar Open TTS Leaderboard, en topplista för talsyntes (text-to-speech, TTS) med fokus på öppna och flerspråkiga modeller. Hubben innehåller över 8 000 TTS-modeller, men de tongivande röstningsarenorna hinner inte med i tempot och underrepresenterar öppna modeller: enligt inlägget är endast 16 av de 92 modeller som rankas av Artificial Analysis modeller med öppna vikter. Topplistan ersätter därför rösterna med objektiva mätningar: begriplighet (ord- eller teckenfelfrekvens mellan den begärda texten och dess transkription av Qwen3 ASR), hastighet (batchad inferens och tid till första ljud, på H200 och på CPU) samt precision för en klonad röst (WavLM-likhet). Att utvärdera en modell tar några timmar i stället för några veckors röstning. På engelska leder Kokoro-82M, supertonic-3 och s2-pro från Fish Audio; på flera språk leder OmniVoice, s2-pro och Fun-CosyVoice3-0.5B. Författarna varnar för att varken naturlighet eller uttrycksfullhet mäts, och kommer att publicera sina utvärderingsskript ”snart”.

🔗 Inlägg om Open TTS Leaderboard · Topplistan på Hugging Face

LILT lanserar AURORA, en flerspråkig topplista för agentuppgifter

30 september — LILT lanserar AURORA, en topplista som mäter ledande modeller på icke-engelska agentuppgifter, samtliga utformade och verifierade av experter med språket som modersmål, utan maskinöversättning. Fyra benchmarktester inleder den: en flerspråkig Terminal-Bench med 324 kodningsuppgifter på tio språk, en flerspråkig version av τ³-bench för kundsupport, MultiChallenge för instruktionsföljning i långa kontexter och GAIA-v2-LILT för agentiskt resonerande. Claude Opus 5.5 leder den flerspråkiga Terminal-Bench och hamnar i topp på τ³-bench i vart och ett av de fem språken. På GAIA presterar modellerna i genomsnitt 20,7 poäng högre på den granskade versionen från LILT jämfört med en maskinöversättning: enligt LILT mäter denna skillnad felet som introduceras av översättningen. Samma dialog förbrukar dessutom cirka 1,4 gånger fler token på koreanska eller arabiska än på engelska.

Utvärderad modell (flerspråkig Terminal-Bench, utdrag)Genomsnittlig framgång
Claude Opus 5.5 (effort high)76,4 %
Claude Opus 5 (effort high)73,5 %
Gemini 3.8 Flash67,3 %
GPT-6 Sol64,8 %
Command A+4,3 %

🔗 Inlägg om AURORA från LILT · AURORA-topplistan


Offentlig sektor och näringsliv: Claude for Government, Anthropics inköpsagent och OpenAI tillsammans med America’s SBDC

Claude for Government når allmän tillgänglighet

30 september — Claude for Government lämnar beta: Anthropic tillkännager dess allmänna tillgänglighet för federala myndigheter och delstatsmyndigheter i USA. Plattformen, som har varit i offentlig beta sedan juli, tillhandahåller Claudes kodnings- och agentiska arbetsförmågor i en FedRAMP High-godkänd miljö, med funktioner som är jämförbara med dem för kommersiella kunder; CLI-verktyget Claude Code och Claude for Microsoft 365 lanseras där i tidig åtkomst. Ingen licens per användarplats: myndigheterna betalar för användning i fasta nivåer, med ett fast tak som förhindrar att den bundna budgeten överskrids, och SCIM-gruppmappningar fastställer hastighetsbegränsningar, dollartak och godkända modeller per användarnivå. På kontrollsidan kräver känsliga åtgärder hos Anthropic godkännande av två personer, användningsexporter innehåller endast mätdata och konversationshistoriken stannar på den enhet som hanteras av myndigheten. Anthropic publicerar inga priser.

🔗 Claude for Government är nu allmänt tillgängligt

Hos Anthropic tar en agent byggd på Managed Agents emot inkommande säljförfrågningar

30 september — Anthropic berättar hur deras säljteam har byggt om hanteringen av inkommande förfrågningar – tiotusentals per månad – med en inköpsagent byggd på Claude Managed Agents, i beta. Den finns på sidorna Contact Sales och Pricing, i claude.ai samt via e-post, och ställer några frågor, rekommenderar ett abonnemang och ett antal licenser, leder sedan vidare till köp, lämnar över till en säljare med hela historiken, eller nöjer sig med att svara; kunden kan välja en människa redan från början. Enligt inlägget, författat av Carl Johnson, hanterar agenten tusentals konversationer per dag; de leads som den slussar vidare blir affärsmöjligheter mer än dubbelt så ofta som med det gamla formuläret och slutförs ungefär fem dagar snabbare, och andelen konversationer som kräver en säljare för att avslutas har minskat med ungefär hälften. En enda ingenjör byggde den första versionen på några veckor; agenten vägleder ofta mindre team mot Team-abonnemanget snarare än Enterprise, vilket Anthropic har valt att stå bakom.

🔗 Hur Anthropics säljteam byggde om inkommande förfrågningar med Claude Managed Agents

OpenAI samarbetar med America’s SBDC och publicerar en rapport om småföretag

30 september — OpenAI inleder ett samarbete med America’s SBDC, det nationella nätverket för utvecklingscentra för småföretag i USA, som stöder en miljon entreprenörer varje år. I en första fas, via OpenAI Academys utbildningsprogram för communitytränare (Community Trainer Program) som lanserades som pilotprojekt den 23 september, planerar OpenAI att utbilda cirka 150 rådgivare, som kommer att hålla tre timmar långa workshops inom SBDC-nätverken med målet att nå minst 1 000 småföretag på plats. Samma dag sätter rapporten ”Small Businesses, Bigger Capabilities” siffror på användningen: under veckan den 9 till 15 september använde cirka 4 miljoner anställda i företag med färre än 500 anställda produkter från OpenAI, varav nästan var femte i ett företag med färre än 10 anställda. I augusti utgjorde agentiska utdatatoken, framför allt från ChatGPT Work och Codex, två tredjedelar av småföretagens utdatatoken, jämfört med en tredjedel i april.

🔗 OpenAI:s inlägg om småföretag


Runway Ads: en autonom motor för prestationsbaserad annonsering

30 september — Runway lanserar Runway Ads, som hanterar den kreativa delen av betalda kampanjer från början till slut. Man kopplar ett annonskonto och ett varumärkeskit: verktyget, som bygger på Runway Agent, genererar video- och bildkreativ, publicerar godkända varianter på Meta, Google och TikTok, läser av deras prestanda och producerar nästa våg baserat på vad som lockade till sig utgifterna. Det lokaliserar varje kreation enligt regler som fastställts av teamet, inklusive text på skärmen, anpassar storleken för varje format, utsätter den för en automatisk varumärkeskontroll och respekterar budgetgränser. Mänskligt godkännande är aktiverat som standard; automatisk publicering kan aktiveras per kampanj eller per varianttyp.

Runways interna mätetal, sedan juliResultat publicerat i inlägget
Annonser per veckafrån 77 till cirka 900
Avkastning på annonsutgifterfördubblad
Konverteringcirka +34 %, stabil klickfrekvens
Kostnad per prenumerant−41 %

Runway Ads är för närvarande i pilotfas hos utvalda företagspartner. Tweeten med tillkännagivandet lovar en bred utrullning under de kommande veckorna och hävdar att verktyget även har bidragit till att tillföra 100 miljoner dollar i ARR (årligt återkommande intäkter) sedan juli, en siffra som saknas i inlägget.

🔗 Runway Ads-inlägg · Tweet från @runwayml


ElevenLabs värderas till 22 miljarder dollar efter ett uppköpserbjudande på 300 miljoner

30 september — ElevenLabs har slutfört ett återköpserbjudande av aktier (tender offer) på 300 miljoner dollar riktat till sina anställda, vilket värderar bolaget till 22 miljarder dollar – det dubbla mot dess värdering vid Serie D i februari. Transaktionen leds av Wellington och T. Rowe Price; EQT, Goldman Sachs, GIC, OTPP, Sapphire Ventures och BDT & MSD kliver in som delägare, tillsammans med befintliga investerare som Andreessen Horowitz, Lightspeed och ICONIQ. Företagskunder står för 55 % av omsättningen: ElevenAgents hanterar över 15 miljoner konversationer per vecka, tre gånger fler än i februari, och dess årliga återkommande intäkter har mer än tredubblats under perioden. Enligt en analys av deras kunder löser röstassistenter ärenden 31 % snabbare än chattassistenter. Företaget har över 800 anställda, fyra år efter en första såddrunda till en värdering på 9 miljoner dollar.

🔗 ElevenLabs-inlägg


Vera Rubin NVL72 i produktion hos CoreWeave, Cognition uppmäter upp till 4,8 gånger högre genomströmning

30 september — I samband med CoreWeave Fully Connected i San Francisco redogör NVIDIA för driftsättningen i produktion av Vera Rubin NVL72 hos CoreWeave: plattformen, med nätverket Spectrum-X Ethernet 102.4T, är tillgänglig på CoreWeave Cloud, som tog emot sina första produktionsrack tidigare under månaden. Cognition, skaparen av Devin, är den första kunden som kör produktionslaster där: under inledande tester på uppgifter hämtade från FrontierCode uppmätte de upp till 4,8 gånger högre total token-genomströmning för inferens med SWE-2 jämfört med GB200 NVL72. CoreWeave kommer även att erbjuda Vera-processorn, utformad för agenter: 128 processorer och 11 264 kärnor per rack, tillräckligt för att köra mer än 11 000 samtidiga isolerade miljöer, med agent-sandlådor som startar mer än tre gånger snabbare. Slutligen lanserar CoreWeave CoreWeave Forge, som förenar Weights & Biases, OpenPipe och marimo för att återkoppla från produktion till träning; dess serverlösa förstärkningsinlärning (serverless RL) uppges vara 1,4 gånger snabbare till en 40 % lägre kostnad.

🔗 NVIDIA-inlägg om CoreWeave och Vera Rubin


Kodagenter och utvecklarverktyg: Claude Code 2.1.286, Zed 1.22.0, Gemini CLI, VS Code 1.140, HydraFusion och en MCP-server för gcloud

Claude Code 2.1.286: bokmärken i VS Code, begränsade omförsök och stramare bare-läge

30 september — Claude Code 2.1.286, som släpptes kl. 19:10 UTC, innehåller 88 poster, varav 49 buggfixar. Behörighetsfrågan anger sin position när flera förfrågningar staplas (“2 of 5”), och VS Code-tillägget får bokmärken (bookmarks) för att spara Claudes svar i en sidopanel, en frågerad som visar frågorna Claude ställt och de valda svaren, samt förhandsvisningar av alternativ i frågekorten. Två beteendeförändringar är viktiga: en enda gräns omfattar nu återförsök av ett modellanrop, maximalt 14 förfrågningar med standardinställningar, och --bare ansluter endast de MCP-servrar som anges på kommandoraden, utan systempåminnelser eller bakgrundsaktiviteter. Om en färdighet som heter verify finns uppmanas Claude att köra den precis före varje commit, utom för dokumentation eller tester, och tillägg avvisar npm-källor som är git-repos eller mappar. Slutligen, när API:et avvisar standardmodellen försöker Claude Code en gång med föregående modell på samma nivå i stället för att misslyckas vid varje omgång.

🔗 Versionsanteckningar för Claude Code 2.1.286

Zed 1.22.0: en modell per underagent

30 september — Zed släpper sin stabila version 1.22.0 med fokus på underagenter: verktyget spawn_agent tar emot en valfri parameter model för att köra en underagent på en annan modell än den som konfigurerats eller ärvts från föräldern, och varje underagents kort visar vilken modell som används. Underagenterna komprimerar även sitt sammanhang automatiskt, vilket enligt Zed gör att de klarar längre uppgifter. På modellsidan tillkommer GPT-6.1 Sol via BYOK med en OpenAI-API-nyckel, Grok 4.7 blir stabil som rekommenderad modell hos SuperGrok och xAI, och listan över OpenCode Zen- och Go-modeller hämtas dynamiskt. Versionen åtgärdar en minnesläcka på cirka 2 MB per slutfört kommando i terminalen och ändrar ett kortkommando: stängning av aktiv docka ändras till ctrl-alt-w på alla plattformar. Totalt 18 nyheter och 37 buggfixar.

🔗 Versionsanteckningar för Zed 1.22.0

Gemini CLI: v0.62.0 som stabil, och en förhandsversion som kör planer utan bekräftelse

29 september — Gemini CLI släpper två versioner under kvällen (UTC). v0.62.0 blir stabil kl. 21:17: dess 19 poster omfattar förhandsversionen och de nightlies som presenterades den 16–24 september (strukturerade titlar för MCP-verktygsanrop, bevarande av OAuth-uppdateringstoken (refresh token), Gemini 3.8 Flash och 3.5 Flash Lite). Nyheten finns i förhandsversionen v0.63.0-preview.0, publicerad kl. 20:58: i icke-interaktivt läge skriver och kör agenten nu sin plan utan att vänta på bekräftelse (PR 29539), medan instruktionerna i Plan Mode tidigare fick den att svara med ett enkelt synkroniseringsmeddelande utan något verktygsanrop alls. En maxChars-gräns på 0 eller lägre inaktiverar även trunkering av verktygsutdata (PR 29542). Nightly-versionen från 30 september inleder 0.64.0-serien: i ACP-läge rapporterar CLI äntligen standardanvändning, medan klienter som Zed eller OpenHands överskattade faktureringen med ungefär 3 gånger, enligt PR 29549.

🔗 Gemini CLI v0.63.0-preview.0 · Gemini CLI v0.62.0

VS Code 1.140 antar Copilot-selen

30 september — Visual Studio Code 1.140 släpps som stabil med Copilot-selen (Copilot harness): baserad på Copilot SDK ger den agenten i VS Code samma beteende och funktioner som GitHub Copilot-appen och Copilot CLI, och körs i en dedikerad värdprocess baserad på Agent Host Protocol, så att en och samma session kan anslutas från flera fönster; versionsanteckningarna varnar för att den eventuellt redan är vald som standard för vissa användare. Som experimentell funktion ger sessioner med flera mappar varje chatt en egen mapp eller ett eget worktree, och agenten kan delegera en session till en fjärrvärd, vald baserat på system, minne, antal processorer och modell. Tre kontroller tillkommer för företag: förklaring i chatten av minimiversioner som krävs av administratören, en standardnivå för Auto-läget fastställd genom en hanterad inställning (autoTier), samt tillägg av användaridentitet i Copilots OpenTelemetry-data, ett alternativ som är inaktiverat som standard.

🔗 Versionsanteckningar för VS Code 1.140

HydraFusion kommer till VS Code och GitHub Copilot-appen

30 september — GitHub utökar HydraFusion, multimodellorkestreringen som lanserades den 4 september i Copilot CLI, till VS Code (från version 1.140 eller Insiders) och GitHub Copilot-appen, fortfarande i forskningsförhandsvisning. HydraFusion väljs i väljaren som en modell, men är inte en modell: den behandlar valet av arbetsflöde som ett optimeringsproblem och använder ett av tre mönster. I Single-läge löser en enda modell uppgiften; i Cascade-läge genererar en effektiv modell utkast och en kvalitetskontroll godkänner resultatet eller eskalerar till en starkare modell; i Critique-läge granskar en skrivskyddad granskare från en annan modellfamilj innehållet, varpå skribenten reviderar en gång. Där Auto-läget väljer en modell per förfrågan koordinerar HydraFusion flera modeller inom samma omgång. Den är tillgänglig i Copilot Pro, Pro+, Business och Enterprise, där en administratör måste aktivera förhandsversioner i Business och Enterprise; GitHub publicerar inga nya siffror.

🔗 HydraFusion in VS Code and the GitHub Copilot app

Google Cloud släpper en fjärransluten MCP-server som kör gcloud och bq i förhandsversion

Google Cloud utökar sina hanterade fjärranslutna MCP-servrar med Google Cloud CLI remote MCP server i offentlig förhandsversion. Den samlar hundratals kommandon från kommandoradsverktygen gcloud och bq (BigQuery) bakom två MCP-verktyg: run_gcloud_command och run_bq_command. Google motiverar valet av kommandoraden med två argument: ett kommando kapslar in fleroperationssteg som API:et annars skulle kräva orkestrering för, och modellerna har tränats i stor utsträckning på den offentliga dokumentationen för dessa kommandon. Fjärrservern eliminerar behovet av att installera CLI i agentens miljö, vilket öppnar upp dessa operationer för webbvärdbaserade agentplattformar som Gemini Enterprise. Kommandona körs i en isolerad sandlåda bakom en proxy med begränsad nätverksåtkomst och utan bakgrundsautentiseringsuppgifter (ambient credentials), var och en med anropande identitets IAM-behörigheter, autentiserad via Agent Identity eller OAuth 2.0; Model Armor kan filtrera prompter och svar, och varje anrop kan loggas i granskningsloggarna. Själva servern är kostnadsfri: endast skapade resurser och eventuella dataöverföringar debiteras.

🔗 Empower your agents with the Google Cloud CLI remote MCP server (Google Cloud-bloggen)


Notiser

  • Codex CLI 0.159.2 — Denna version, som släpptes den 29 september klockan 23:57 UTC, innehåller endast en bakåtporterad korrigering: i Windows blinkar konsolfönster inte längre när Codex startar bakgrundsprocesser eller kommandon i sin sandlåda. 🔗 källa
  • Plaid i Amp — Lägena i Amp som använder GPT-6 Astra får Plaid, baserat på OpenAI:s ultrasnabba nivå: förfrågningar upp till 6 gånger snabbare till en tokenkostnad multiplicerad med 6, exklusivt för inferens tillhandahållen av Amp; underagenter stannar på hastigheten fast eller standard, och Amp uppger inga priser. 🔗 källa
  • Warp och Factories as Code — Warp presenterar konfigurationen av sina mjukvarufabriker som ”Terraform för agenter”: ett arkiv beskriver agenter, automatiseringar, åtkomst och mätningar. Formatet factory.yaml härstammar från slutet av augusti; den interaktiva guiden beskriver i detalj federerad åtkomst till AWS eller GCP, webhooks samt integrationer med Slack, Linear eller Jira. 🔗 Warps tråd · 🔗 konfigurationsguide
  • Devin hos Crosby — I en fallstudie från Cognition anförtror den New York-baserade advokatbyrån Crosby, med ett dussin ingenjörer för över 50 advokater, den första incidentresponsen åt Devin: 20 till 40 buggar och larm granskas per dag, på cirka 5 minuter för de flesta, och minst 50 % mindre brus från Sentry. 🔗 källa
  • claude.dev — Anthropic presenterar officiellt claude.dev som hemvisten för utvecklare som bygger med Claude: tekniska djupdykningar, guider för Claude Code och API:er, avsnitten Agents, Engineering, Playbooks och Skills, samt en Terminal-sida som ett dolt påskägg. Inlägg från webbplatsen hade redan delats sedan den 22 september. 🔗 källa
  • Redigerbara ChatGPT-webbplatser — Enligt versionsanteckningarna från den 29 september kan en publicerad Site redigeras med Edit site och schemaläggas från Automations på Plus och Pro; i Enterprise kan privata Sites förlita sig på anslutna applikationer, med inställningen Allow use in Sites per insticksprogram, inaktiverad som standard. 🔗 versionsanteckningar för ChatGPT · 🔗 Enterprise- och Edu-anteckningar
  • Kimi Work 3.2.15 — Versionen från den 30 september möjliggör gemensam redigering mellan människa och AI av Notion- och Feishu-dokument i den inbyggda webbläsaren, fäller ihop agentens förlopp som standard och åtgärdar filkorruption vid samtidig redigering av en PPT. 🔗 källa
  • Cue hanterar ekonomin — Appen för personliga agenter som lanserades med Manus 2.0 spårar nu prenumerationer och utgiftstrender och sätter bankkonton på autopilot via Plaid; varken land, prisplan eller villkor specificeras. 🔗 källa
  • GPT-6.1 Sol i Genspark — Genspark lanserar GPT-6.1 Sol i AI Chat, Code Agent och Claw dagen efter lanseringen och upprepar OpenAI:s säljargument (intelligens nära Astra för en femtedel av API-priset), utan angiven prisplan eller kreditkostnad. 🔗 källa
  • Qwen3.8-27B-pi — Thomas Kim publicerar under Apache-2.0 en finjustering av Qwen3.8-27B för Pi-riggen som återställer ansträngningsnivåerna: på Terminal-Bench 2.1 matchar medium-nivån basmodellen på xhigh (67 uppgifter av 89) med cirka 41 % färre utdatatoken. 🔗 källa
  • Qwen3.8-27B hos Nebius — Qwen vidarebefordrar ankomsten av sin täta modell med 27 miljarder parametrar till Nebius Token Factory, som tillkännagavs den 28 september, för kod, forskning och agentarbetsflöden; varken pris eller dataflöde anges. 🔗 källa
  • Bekko System One v0 — Yuichi Tateno publicerar tre beslutsmodeller på 17M, 68M och 400M parametrar, varav de två minsta körs i en webbläsare, samt testsviten S1MB: 400M-modellen når 50,60 jämfört med 59,59 för Jev 1.13, men 54,48 jämfört med 96,27 i generalisering. 🔗 källa
  • ZooWork Instinct Tuned 4B — SRP publicerar under Apache-2.0 en beslutsmodell med 4 miljarder parametrar, byggd på Qwen3.5-4B, som poängsätter alternativen i en enda omgång utan avkodning: 198 av 231 (85,71 %) på JevBenchs offentliga uppgifter, vilka användes under utvecklingen, preciserar författarna. 🔗 källa
  • Transformers v5.18.0 — Hugging Face lägger till fyra arkitekturer: Nemotron 3 Diarization och NemotronH Omni från NVIDIA, HyperCLOVAX Vision V2 från NAVER samt GTE, och rapporterar sex banbrytande förändringar (breaking changes). 🔗 källa
  • TaskSmith — Adithya S K, som arbetar med miljöer för förstärkningsinlärning hos Hugging Face, släpper en orkestrerare som förvandlar en pull request till en verifierbar RL-miljö: 50 miljöer hämtade från TRL, PEFT, Accelerate, Diffusers och Transformers, levererade som Harbor-uppgifter. 🔗 källa
  • TraceML 0.4.1 — Det öppna källkodsverktyget mäter nu hela gruppen för en optimeraruppdatering; på ResNet-50 och en T4-GPU sjunker dataväntetiden från 23 % av steget till under 2 ms efter justering av inläsningen, för en medianoverhead på 0,35 %. 🔗 källa
  • Slingtransformator — På en leksaksmodell med 54 106 parametrar och 260 verifierbara fall, med en lika stor budget på 80 blockpasseringar, lär sig en slinga de 260 fallen, två slingor 125,3 och åtta 37,0 i genomsnitt: att mångdubbla passeringarna gjorde inte inlärningen mer ekonomisk. 🔗 källa
  • En utvärdering som kan säga nej — Eric Meys handledning visar, på sentimentanalys av filmrecensioner (SST-2), en utvärdering som avvisar en modell som presterar 7 poäng bättre på reserverad data, eftersom ett kritiskt beteende försämras; dess skript körs på under en minut på en processor. 🔗 källa
  • 10 000 syntetiska försäkringstagare — Intelligent Actuaries publicerar under CC-BY-4.0 en syntetisk studie av förfall och återköp inom livförsäkring: 10 000 fiktiva försäkringstagare på tio marknader, motsvarande 27 692 försäkringsårsposter för 2023–2025 i formatet från SOA-LIMRA-undersökningen. 🔗 källa
  • cuObject och SCADA Server SDK — NVIDIA gör cuObject-biblioteken allmänt tillgängliga för åtkomst till objektlagring via RDMA, utan att passera CPU-minnet, och lanserar SCADA Server SDK, som prototypades av IBM med Storage Scale, inom ett Storage-Next-initiativ med fler än 40 aktörer. 🔗 källa
  • NeMo Relay och Hermes Agent — En handledning från NVIDIA författad tillsammans med Teknium från Nous Research spårar en Hermes-agent: över 108 körningar gör verktygskorrigeringar att Qwen3 Coder 30B ökar från 19 till 22 lyckade fall av 27, till priset av 4,9 modellanrop istället för 3,8. 🔗 källa
  • OpenShell för OpenClaw Enterprise — NVIDIA erbjuder sin öppna källkodsmiljö OpenShell för att styra agenter i OpenClaw Enterprise, ett kontrollplan med öppen källkod för persistenta agenter som tillkännagavs dagen innan av stiftelsen OpenClaw tillsammans med Red Hat, NVIDIA och OpenAI. 🔗 källa
  • Testperioder för GitHub Advanced Security — GitHub Team-kunder kan själva starta en testperiod av GitHub Code Security och GitHub Secret Protection från organisationens Overview-sida, faktureringssidan eller en Risk Assessment; varaktigheten anges inte. 🔗 källa
  • GHE.com och X25519 — Från och med den 7 oktober 2026 kommer GitHub Enterprise Cloud med datalokalisering att neka TLS-klienter som endast erbjuder X25519 för nyckelöverenskommelse; P-256 och P-384 stöds fortfarande och SSH påverkas inte. 🔗 källa
  • Två fallstudier hos Runway — Det franska dryckesvarumärket Bonjour producerade över 500 annonsvarianter med Runway och omallokerade över 50 000 euro i produktionskostnader; World Juggling Federation gav en enda person i uppdrag att skapa grafiken för ett timslångt program för ESPN. 🔗 Bonjour · 🔗 World Juggling Federation
  • Ad Variants hos Luma — Luma lyfter fram en funktion som anpassar en färdig annons till flera storlekar och för flera marknader inom samma kampanj, utan pris, prisplan eller lanseringsdatum, och utan något blogginlägg. 🔗 källa
  • Microduck i produktion — Pollen Robotics meddelar att 10 950 enheter av Microduck, dess lilla tvåbenta robot för 399 dollar som tränats i simulering med en öppen källkodsstack för förstärkningsinlärning, kommer att rulla av produktionslinjen mellan den 10 december och den 10 januari i veckovisa partier. 🔗 källa
  • Cognition rekryterar — Devins skapare välkomnar Chris Degnan, tidigare CRO på Snowflake, som intäktschef (CRO), dagen efter att Alex Stamos anslöt som informationssäkerhetschef (CISO). 🔗 Chris Degnan · 🔗 Alex Stamos
  • Claude Founder House — Anthropic anordnar dagar för grundare i San Francisco under SF Tech Week (den 6 till 8 oktober på Terra Gallery) och i Stockholm den 14 oktober, med föreläsningar, workshops och tidsluckor med deras Applied AI-team. 🔗 källa
  • AI Engineer Paris — Mistral summerar evenemanget som hölls föregående vecka på Station F: över 900 deltagare, 60 talare, 57 föreläsningar och 22 partner, utan några produktlanseringar. 🔗 källa
  • Doktorandstipendier från NVIDIA — Ansökan till Graduate Fellowship Program 2027–2028 är öppen fram till den 30 oktober 2026, med upp till 60 000 dollar per doktorand; fler än 220 stipendier har delats ut sedan 2002. 🔗 källa

Vad det innebär

Säkerheten sätter numera tidsplanen för frontmodeller. Gemini 4 Argon förlänger logiken från Fairwind Program: betrodda cybersäkerhetsförsvarare får den först, utan cyberskyddsvallar, och övriga följer ”så snart som möjligt”, utan datum, under tiden som skyddsåtgärderna förstärks. Samma dag visar OpenAI den andra sidan av myntet: det som måste skyddas är inte längre bara modellen, utan även dess resonemang. Oavsett om den härrör från en enskild aktör eller inte, gör kampanjen – vars kärna OpenAI tillskriver individer kopplade till Moonshot AI – resonemangsspåret till en tillgång värd att försvara, med tekniska motåtgärder och informationsdelning mellan laboratorier och regeringar.

En betydande del av dagens siffror kommer från mätningar utformade eller genomförda av dem som gör tillkännagivandena. Cohere utvärderar Embed 5 med det mätvärde man publicerar samma dag, och varnar själva för att deras modeller kan verka sämre med det gamla måttet; HeyGen förlitar sig på en intern Elo-skala, Hunmin på ett eget protokoll med en enda körning för agenttester, och på Reality Check var det arrangören som finjusterade modellerna. Å andra sidan skickar Perplexity sin modell till ett blindtest på en privat testsvit från turbopuffer, och Open TTS Leaderboard liksom AURORA ersätter röstning eller maskinöversättning med verifierbara uppgifter och mätningar. Innan man jämför två poäng måste man granska vem som har tagit fram dem.

Generering av bilder och video bedöms alltmer efter användning och kostnad. Ideogram 4.5 lovar inte en vackrare bild, utan en bild som tål upprepade redigeringar; HeyGen Video säljs per sekund, billigare än alla modeller i dess prislista, och visar att en basmodell som MiniMax H3 kan ge specialiserade varianter, från HeyGen till Creatify. Runway Ads sluter cirkeln hela vägen till annonsutgifterna, och värderingen av ElevenLabs, som har fördubblats sedan februari, vilar på företagens efterfrågan på konversationsagenter.

På utvecklarsidan håller testriggen (harness) på att bli en fullvärdig produkt i sig, skild från modellen. VS Code anammar riggen från Copilot för att anpassa sin agent till appen och CLI:et, HydraFusion samordnar flera modeller i samma omgång, Zed låter agenten välja en modell per underagent och Manus öppnar sin rigg för API-nycklar från tredjepartsleverantörer. Gemini CLI kör nu sina planer utan mänsklig inblandning i icke-interaktivt läge, Claude Code stramar åt --bare för skriptade användningsområden, och Google Cloud exponerar gcloud och bq för agenter i en sandlåda, med anroparens IAM-behörigheter. Efterfrågan märks ända in i infrastrukturen: den första kunden för Vera Rubin NVL72 i produktion hos CoreWeave är Cognition, skaparna av Devin.


Källor