Sök

Cursor lanserar Projects och dess koordinerande agent, GPT-Rosalind lämnar forskningsförhandsversionen, Runway licensierar sina slutna vikter

ai-powered-markdown-translator

Artikel översatt från franska till svenska med gpt-5.6-sol.

Visa projekt på GitHub ↗

Femtiotvå tillkännagivanden, de flesta publicerade den 11 september, och samma idé återkommer hos aktörer som inte talar med varandra. Cursor överlåter ett helt projekt till en koordinerande agent som inte kodar utan delegerar till tusentals underagenter, Cognition låter två modeller arbeta tillsammans på utvecklarens dator och Sakana dirigerar varje uppgift till den lättaste modell som kan lösa den. Samma dag tar OpenAI sin modell för livsvetenskaper ur forskningsförhandsversionen och publicerar en prislista, Runway licensierar vikterna för sina slutna modeller till företag och Anthropic publicerar ett underkommando som äntligen mäter vad ett plugin faktiskt tillför.


Cursor lanserar Projects, projekt som leds av en koordinerande agent

10 september — Cursor har lanserat Projects, en omarbetning av hur arbete tilldelas en agent i editorn. Produkten bryter med den vana som etablerats under de senaste två åren: i stället för att öppna en ny konversation för varje uppgift och sedan stänga den, samtalar användaren med en koordinerande agent i en tråd som varar i månader. Koordinatorn skriver inte en enda rad kod. Den leder andra agenter som skriver den, vilket gör att den alltid är tillgänglig för nya instruktioner medan arbetet fortskrider.

Tre mekanismer gör detta möjligt. Först kommer körning i molnet som standard: ett Project körs på sin egen maskin, det avbryts inte när den bärbara datorn stängs och antalet underagenter som kan arbeta parallellt begränsas inte längre av den lokala hårdvaran. En lokal agent startas när ett test behöver köras på utvecklarens dator. Därefter kommer den delade kontexten: varje Project upprätthåller en uppsättning filer som synkroniseras mellan alla maskiner, där agenterna sparar sin research, sina artefakter och sin förståelse av koden. Om en agent upptäcker hur en tjänst ska testas får alla efterföljande agenter tillgång till proceduren. Den tredje mekanismen är den mest ovanliga. Cursor kallar den prenumerationer (subscriptions): koordinatorn kan övervaka en Slack-kanal, köras enligt ett schema eller följa alla pull requests för att reparera den kontinuerliga integrationen. Agenten agerar när den upptäcker en signal, utan att vänta på att bli tillfrågad.

Uppmätt populationUppmätt effekt på pull requests
Nya användare av Projects30 procent fler sammanslagna
Användare som främst arbetar i ProjectsSex gånger fler sammanslagna
Project för internt design system20 till 100 berörda pull requests per dag, enligt prognos

The coordinator doesn’t write code itself but directs other agents that do. Because it delegates rather than executes, it is never blocked and is always responsive to direction.

🇸🇪 Koordinatorn skriver ingen kod själv, utan leder andra agenter som gör det. Eftersom den delegerar i stället för att utföra arbetet blockeras den aldrig och förblir alltid mottaglig för instruktioner.Cursor, bloggen om Projects

Dessa siffror är interna mätningar och bör läsas med sedvanlig försiktighet. Det tydligaste exemplet är fortfarande trädgårdsarbetet, Cursors benämning på arbete som aldrig tar slut: en ingenjör kör ett Project som ägnas åt design system, granskar varje ny pull request, plockar ut de komponenter som hör hemma i systemet och lägger till en lint-regel så snart samma fel har påträffats två gånger. Projects är i beta och har rullats ut gradvis sedan den 10 september. Tillkännagivandet nämner varken prisvillkor eller abonnemangsbegränsningar.

🔗 Cursors tillkännagivande på X


GPT-Rosalind lämnar forskningsförhandsversionen och får en prislista

11 september — OpenAI Developers meddelar att GPT-Rosalind, företagets resonemangsmodell för livsvetenskaper, lämnar forskningsförhandsversionen (research preview). Modellen presenterades den 16 april 2026 för forskning inom biologi, läkemedelsutveckling och translationell medicin och var då endast tillgänglig för berättigade Enterprise-kunder i USA. Den övergår nu till betrodd åtkomst (trusted access) för berättigade organisationer i hela världen via API, Codex och ChatGPT Enterprise, och åtkomsten kommer att omfatta kommande modeller i serien allt eftersom de lanseras.

API:ets changelog ger i en post daterad den 8 september de detaljer som inte nämns i X-tråden. Modellen heter gpt-rosalind-research, och dess allmänna tillgänglighet är fortfarande beroende av programmet för betrodd åtkomst, som är förbehållet intern forskning inom livsvetenskaper som godkänts av OpenAI.

Pris- eller åtkomstpostAngivet värde
Modellidentifieraregpt-rosalind-research
Input-tokens5 dollar per miljon
Cachade input-tokens0,50 dollar per miljon
Output-tokens25 dollar per miljon
Faktureringen börjar5 oktober 2026
ÅtkomstytorAPI, Codex, ChatGPT Enterprise
ÅtkomstvillkorProgram för betrodd åtkomst, berättigade organisationer

Faktureringen börjar först den 5 oktober: under forskningsförhandsversionen förbrukade användningen varken krediter eller tokens. När det gäller verktyg utgör Codex plugin-paket Life Sciences modellens orkestreringslager, från genomik till proteinstruktur och translationell forskning, från insamling av biologisk evidens till generering av kvalitetskontrollrapporter och interaktiva notebooks. Paketet publicerades kostnadsfritt på GitHub i april och ger tillgång till fler än 50 offentliga multiomics-databaser, litteraturkällor och biologiverktyg. Det fungerar med generella modeller för alla, men endast berättigade Enterprise-användare kan kombinera det med GPT-Rosalind.

De påstådda resultaten är fortfarande desamma som vid lanseringen: det högsta publicerade resultatet på BixBench, ett övertag över GPT-5.4 i 6 av 11 uppgifter i LABBench2 med störst skillnad på CloningQA samt, i en uppgift om sambandet mellan RNA-sekvens och funktion som utformats tillsammans med Dyno Therapeutics, ett bättre bidrag än den 95:e percentilen bland 57 mänskliga experters prediktioner. Den konkreta informationen är dubbel: en specialiserad modell lämnar experimentstadiet med offentlig prissättning och åtkomsten utökas geografiskt. Hindret är fortfarande behörighetskravet, som inte är öppet för självbetjäning.

🔗 Tråd från OpenAI Developers på X


Runway Model Licensing levererar vikterna för slutna modeller till företag

11 september — Runway har öppnat ett licensprogram för sina modeller (Model Licensing) riktat till företag. Principen skiljer sig från åtkomst via API: kunden får de fullständiga vikterna för en Runway-modell av senaste generationen, finjusterar den med sina egna data, kör den i sin egen infrastruktur och kommersialiserar det som skapas med den. Data och genererat material lämnar aldrig kundens miljö, vilket uttryckligen riktar sig till studior, varumärken och myndigheter.

Levererad delInnehåll
ModellvikterFullständiga vikter som utgångspunkt
CheckpointsFlera versioner av modellen att validera
TräningsskriptKod för att lägga till egna data och köra finjusteringar
LeveransPaketerad i kundens kodbas och driftad där kunden önskar
Utplacerade forskarePraktisk hjälp med konfigurering, vikter och leverans

Driften kan ske i kundens moln, i kundens datacenter eller helt lokalt, även i en nätverksfrånkopplad miljö (air-gapped) för myndigheter. Sex sektorer nämns: mjukvaruplattformar, film och studior, varumärken och marknadsföring, robotik och fysisk AI med World Action Model som ryggrad för styrning (policy backbone), datorspel och 3D med fotorealistisk förbättring av enklare renderingar samt myndigheter.

Ekonomiskt skiljer Runway mellan två vägar: Runway Dev, ett användningsbaserat API utan infrastruktur att hantera, och årslicensen, med förutsägbara kostnader och fullständig kontroll över versioner, beteende och resultat. FAQ:n bemöter invändningen om föråldring: framtida modeller kommer inte att få tillgång till kundens proprietära data, årlig förnyelse planeras och krediter ges för efterföljande generationer. Där uppskattas kostnaden för en intern rekonstruktion till flera års lärande och hundratals miljoner dollar. Företaget beskriver sig som ett av mycket få i världen som licensierar slutna vikter av den här kvaliteten och ställer sitt erbjudande i direkt kontrast till öppna vikter, som enligt företaget levererar en svagare modell tillsammans med en uppgiftslista. Inga priser publiceras och åtkomst söks via ett kontaktformulär för företag. Tillkännagivandet kommer nio dagar efter Runway Dev MCP och en vecka efter Team-abonnemanget: Runway täcker nu hela spektrumet, från enskilda kreatörer till licensiering av slutna vikter.

🔗 Sidan Model Licensing


Cognition tar ned Fusion till Devin Desktop och Devin CLI

11 september — Cognition har gjort Fusion tillgängligt i Devin Desktop och Devin CLI. Arkitekturen hade körts på Devin Cloud i flera månader och flyttar nu ned till utvecklarens dator. Tillkännagivandet kommer dagen efter SWE-2, företagets egen kodmodell, och de båda hänger samman eftersom SWE-2 är systemets rekommenderade sidekick.

Principen är enkel att beskriva. När Fusion väljs väljer man inte en modell, utan två. En toppmodell agerar ledare (lead) och behåller kontrollen över sessionen: den äger planen, avgör tvetydigheter och granskar det utförda arbetet. En billigare modell agerar sidekick (sidekick): den utforskar koden, skriver ändringarna, kör testerna och rapporterar tillbaka. De båda körs parallellt, var och en med sin egen beständiga kontext. Det tekniska argumentet riktas mot model routing, den lösning som spontant framstår som ett sätt att sänka kostnaden: en inledande prompt räcker inte för att bedöma en uppgifts svårighetsgrad, och ett modellbyte under arbetets gång förstör prompt-cachen. Fusion kringgår problemet genom att aldrig överföra hela konversationer mellan de två modellerna, som endast utbyter sammanfattade instruktioner, resultat och återkoppling.

Kostnad per uppgift, i dollarEndast Fable 5.1Fusion Fable 5.1 och SWE-2Endast AstraFusion Astra och SWE-2
DeepSWE 1.114,637,887,884,69
Terminal-Bench 417,4613,3710,086,06
SWE-Atlas QnA7,575,005,723,59
Vals Code Migration70,9742,0044,3635,51
Utökad FrontierCode 1.12,681,672,622,34

One of our key findings is that using more expensive models can make the entire system cheaper.

🇸🇪 En av våra viktigaste upptäckter är att användning av dyrare modeller kan göra hela systemet billigare.Cognition, bloggen om lokal Fusion

Detta demonstreras på båda sidor av duon. På ledarsidan minskade den genomsnittliga sessionskostnaden med 9 procent när Opus 4.8 ersattes med Fable 5, som nominellt kostar dubbelt så mycket per token, med samma sidekick och samtidigt ett bättre resultat på FrontierCode: Fable delegerade tidigare och skrev bättre sammanfattade instruktioner, medan Opus detaljstyrde sin sidekick. På sidekick-sidan sänks uppgiftens totalkostnad med 2 procent samtidigt som resultatet ökar med 1,4 poäng när GPT-5.6 Luna byts ut mot SWE-2, trots att den senare kostar 275 procent mer per miljon tokens. I Artificial Analysis Coding Agent Index v1.5 får Fusion med Fable 5.1 och SWE-2 resultatet 61,7 till en 36 procent lägre kostnad än Claude Code med Fable 5.1, som stannar på 62,2. Cognition drar därav en regel för 2026: utvärdera modeller, och kombinationer av modell och harness, efter pris per uppgift i stället för pris per token. Det är en bekväm ståndpunkt för en leverantör som säljer ett harness, men siffrorna har tagits fram tillsammans med Artificial Analysis och Vals AI på fem separata benchmarks. Installation med ett enda kommando.

🔗 Cognitions tillkännagivande på X


Sakana AI lanserar Fugu Max och Fugu Ultra v2, två vidareutvecklingar av sin multi-agentorkestrator

11 september — Sakana AI lanserar Fugu Max och Fugu Ultra v2, två nya versioner av Sakana Fugu, företagets system för multi-agentorkestrering (multi-agent orchestration system) som tillhandahålls bakom ett enda OpenAI-kompatibelt API. Den röda tråden är Paretofronten: Sakana anser att branschen fortfarande resonerar som om kapacitet vore den enda dimensionen, trots att en verklig uppgift bedöms utifrån två, kapacitet och kostnad.

Fugu är inte en enskild modell utan ett tränat orkestreringslager som dirigerar varje uppgift till en pool av specialiserade modeller med öppna vikter. Fugu Max utökar denna pool, enligt företaget den största hittills, genom att integrera NVIDIA Nemotron-familjen och skickar varje uppgift till den lättaste modell som kan lösa den. Den får bäst totalpoäng på sex benchmarks och flyttar kostnads- och prestandafronten på sju av tio, till 2 dollar per miljon tokens för input och 6 för output, ett outputpris som Sakana uppger ligger 40–60 procent under priserna för Sonnet 5, GPT 5.6 Terra och Kimi K3.

Tillkännagivet måttPoängJämförelse enligt Sakana
Fugu Ultra v2, Chartography48,3Opus 5 på 27,3; Fable 5 på 29,5
Fugu Ultra v2, DeepSWE74,3Före modeller som är 3–5 gånger dyrare per token
Fugu Ultra v2, placering1:a eller delad 1:a på 5 av 8 benchmarksTopp 2 på 7 av 8
Fugu Max, total placeringBäst poäng på 6 benchmarksParetofronten utökad på 7 av 10

Den punkt som Sakana betonar mest är värd att uppmärksamma: Fable 5, Fable 5.1 och GPT-6-Astra ingår inte i agentpoolen för Fugu Ultra v2, vars träningsstopp är den 28 augusti 2026. Argumentet handlar om leveransresiliens: en utbytbar pool skyddar mot leverantörsinlåsning, återkallade API-åtkomster och tjänsteavbrott. Båda modellerna är tillgängliga omedelbart, och en Fugu-användare växlar till Max eller Ultra v2 genom att ändra en enda parameter. Fugu Max finns även på OpenRouter, med multimodal input, webbsökning, konfigurerbart resonemang och strukturerad output. En reservation är på sin plats: Sakana har själv valt benchmarks och jämförelsemodeller, SWEFish är ett internt test, och de påstådda skillnaderna beror på de jämförda modellernas priser vid publiceringstillfället.

🔗 Vi presenterar Fugu Max och Fugu Ultra v2


ElevenLabs lanserar Music v2.5, med förlustfria nedladdningar i alla abonnemang

11 september — ElevenLabs har lanserat Music v2.5 och gjort den till standard i ElevenMusic, både för generering från prompt och från ljudreferens. Modellen utlovar instrument som låter som en liveinspelning, djupare arrangemang, längre kompositioner, genreövergångar mitt i låten, rap och röster som låter naturliga på textens språk. Det presenterade måttet är ett blindtest med 47 885 par, en tagning per modell för samma prompt: Music v2.5 föredrogs i de flesta fallen, med den tydligaste skillnaden inom röst- och akustikdrivna genrer som R&B, soul, hiphop, rock, metal, orkestermusik och filmmusik. Den exakta andelen preferenser har inte publicerats.

Den andra delen innebär en större förändring för användarna. Varje låt som skapas i ElevenMusic tillhör upphovspersonen i samtliga abonnemang, inklusive gratisabonnemanget. Gratisabonnemanget ger fem förlustfria (lossless) nedladdningar per dag med kommersiell användning under förutsättning att ElevenMusic anges, medan Pro-abonnemanget ger 400 per månad. De rättigheter som gäller när låten skapas förblir knutna till den: att säga upp eller nedgradera abonnemanget påverkar inte redan producerade låtar, och en framtida villkorsändring skulle endast gälla nya. Det enda undantaget är en låt som bygger på en annan artists låt, vars nedladdning blockeras.

Uppmätt eller tillkännagiven uppgiftVärde
Par utvärderade i blindtest47 885
Förlustfria nedladdningar, Free-abonnemang5 per dag, kommersiell användning med angivande
Förlustfria nedladdningar, Pro-abonnemang400 per månad
API-identifieraremusic_v2_5
Standardmodell i ElevenMusicMusic v2.5, Music v2 behålls

Modellen finns även i ElevenCreative, som Music-nod i Flows och i API:et under identifieraren music_v2_5. ElevenLabs klargör att det fleråriga avtalet med Universal Music Group som tillkännagavs dagen innan är fristående från denna lansering. För läsaren spelar ordningsföljden roll: avtalet med det stora skivbolaget tillkännages först, och modellen samt de utökade användningsrättigheterna lanseras dagen därpå.

🔗 ElevenLabs tillkännagivande på X


Claude Code mäter vad ett plugin faktiskt tillför, med och utan det

11 september — Claude Developers-teamet tillkännager claude plugin eval, ett underkommando i Claude Code som kör ett plugin eller en skill mot en uppsättning testfall, betygsätter varje körning och sedan kör om varje fall utan pluginet för att mäta vad det tillför. Idén är enkel och en smula obekväm: ett högt resultat bevisar inte att ett plugin hjälper, eftersom Claude ibland lyckas lika bra utan det. Kommandot returnerar därför två resultat och skillnaden mellan dem. Om ett fall får 1,0 i båda grupperna har pluginet inte bidragit till resultatet.

Startpunkten är claude plugin eval init, som körs i pluginets rotkatalog. En interaktiv session öppnas: Claude läser pluginet, frågar hur ett bra resultat ser ut, föreslår prompts som ska respektive inte ska aktivera det, utformar verifierarna (graders), provkör dem en gång, skriver en katalog per fall och anger den uppskattade kostnaden för en fullständig körning. Därefter körs varje fall tre gånger med pluginet och tre gånger utan, alltså sex körningar, eftersom en enstaka körning av en icke-deterministisk agent inte säger särskilt mycket. Terminalen visar en tabell med och utan plugin, en fristående HTML-rapport skrivs till disk och rapporten publiceras som en privat artefakt när kontot tillåter det.

Typ av verifierareKostnad i modellanropVillkor för godkänt resultat
regexingenMönster hittat i det senaste svaret, spårningen eller en fil
tool_usedingenAntal anrop till ett verktyg mellan ett minimum och ett maximum
tool_orderingenEtt anrop föregår ett annat
file_existsingenEn fil som skapats under körningen matchar mönstret
llmen modell bedömerGynnsamt utslag i minst 2 av 3 röster
baselineen modell bedömerKörningen är minst lika bra som en referenstranskription

En subtil detalj behöver förstås innan man tolkar en skillnad: en verifierare som kräver att skillen anropas kan aldrig godkännas utan pluginet. Den utesluts därför från resultatet i båda grupperna och rapporteras endast som indikator, eftersom skillnaden annars skulle bli artificiellt uppblåst. Isoleringen är strikt. Varje körning är en kortlivad barnprocess utan användarinställningar, hook, CLAUDE.md, MCP-server, installerat plugin eller minne. Körningarna ställer aldrig frågor om behörighet, och känsliga verktyg tas bort från sessionen om de inte uttryckligen har godkänts. Om Bash eller PowerShell tillåts på en dator utan sandbox-backend vägrar Claude Code att genomföra körningen i stället för att köra den utan isolering. Ett plugin som kommunicerar med MCP-verktyg kan utvärderas utan den verkliga tjänsten genom att en Markdown-fil per verktyg tillhandahåller svaret, med ett block som avbryter körningen om pluginet skickar något annat än det förväntade.

Evals call the model, so they use tokens and results vary. […] Your plugin’s hooks and MCP servers run as you, so only evaluate plugins you trust.

🇸🇪 Utvärderingarna anropar modellen, så de förbrukar tokens och resultaten varierar. […] Ditt plugins hooks och MCP-servrar körs med dina behörigheter, så utvärdera endast betrodda plugins.@ClaudeDevs på X

Kostnaden är påtaglig: varje körning och varje bedömande verifierare är ett modellanrop som dras från abonnemanget eller fakturan. Exemplet i dokumentationen anger 74 sekunder och 0,41 dollar för ett fall med sex körningar. Därav teamets instruktion: provkör först med --runs 1 innan en fullständig körning startas. För kontinuerlig integration är slutkoderna dokumenterade, däribland 0 när allt godkänns och 2 för en partiell körning när kostnadstaket nås. Det första typiska fyndet är enligt dokumentationen en skillnad nära noll samtidigt som skill-verifieraren misslyckas: Claude väljer inte skillen vid en naturlig formulering, och det är dess beskrivning som behöver omarbetas.

🔗 Dokumentation för pluginutvärderingar

Resten av version 2.1.269

Underkommandot kommer i version 2.1.269, som publicerades den 11 september klockan 21.17, Paristid. De övriga tilläggen är mer lågmälda men användbara i vardagen. Kommandot /output-style listar och byter outputstil, även via Remote Control och i cloud- eller headless-sessioner. När verktyget Bash används för att ändra filer innehåller resultatet nu en diff över de ändrade filerna, vilket ger Claude samma insyn som vid vanlig redigering. För observerbarhet märker en miljövariabel OpenTelemetry-mätvärden och -händelser per repository, medan två andra reglerar tiden för att upptäcka modeller bakom en gateway och gränsen för samtidiga agenter i verktyget Workflow, upp till 256.

Korrigeringarna berör tre känsliga områden: partiell invalidering av promptcachen efter att ett svar avbrutits och sedan återupptagits, behörighetsregler som börjar med en negation och nu endast gäller för den inställningskälla som skrev dem samt kontrollen av skrivsökvägen, som nu även omfattar filen som skrivs av ett tee-kommando. Det git status som meddelas efter en compaction är nu det aktuella och inte det från sessionens början. I VS Code öppnar en bricka en karta över underagenterna med informationskort, stoppknapp och skrivskyddade transkriptioner, och två dialogrutor gör det möjligt att hantera hooks och behörighetsregler i användar-, projekt- och lokala inställningar.

🔗 Versionsinformation för 2.1.269


Antigravity, fyra versioner på en vecka och en uppdatering om Teamwork

Google har i snabb följd släppt två versioner av sitt kommandoradsverktyg och en ny version av sin applikation, utöver två tidigare versioner som aldrig har behandlats här. Ändringsloggen är värd att läsa som en helhet, eftersom veckans leveranser berättar samma historia: agenten lämnar den interaktiva terminalen och blir en tjänst.

🔗 Ändringslogg för Antigravity

Antigravity CLI 1.2.0: CLI:n blir en bakgrundsdemon som styrs med Remote Control

10 september — Version 1.2.0 av Antigravity CLI är den första höjningen av minorversionen sedan juli. Tre underkommandon, remote-control start, status och stop, registrerar kommandoradsverktyget hos systemets tjänstehanterare som en bakgrundsdemon som överlever utloggningar och omstarter, med ett alternativ för instansnamn och ett annat för att begränsa tjänsten till den aktiva inloggningssessionen. Hittills har en terminal behövt hållas öppen. Halvsidesrullning utökas till alla vyer med två nya standardgenvägar. Bland de åtta korrigeringarna är följande mest användbar för att förstå oväntat beteende: en prompt eller ett svar som blockeras av säkerhetsfilter för innehåll visar nu det uttryckliga stoppvillkoret, där användaren tidigare såg ett generiskt fel eller en tom tur. MCP-servrar som är inbäddade i globala plugins initieras nu korrekt vid start.

Antigravity CLI 1.1.28: utökade återförsök vid fel, snabbare headless-läge och godkännande krävs för URL-läsning

9 september — Dagen innan samlade version 1.1.28 nio förbättringar av resiliens och headless-läget, det som anropas från ett skript. Tillfälliga fel i modellens API prövas på nytt med utökad exponentiell backoff, starten utlöser inte längre någon nätverksförfrågan för att läsa användarens identitet och upp till 200 millisekunders inaktiv väntetid tas bort vid varje tur. Två beteendeförändringar förtjänar särskild uppmärksamhet från dem som automatiserar.

BeteendeförändringFöre version 1.1.28Från och med version 1.1.28
Tidsgränsen löper ut i skriptlägeTimeoutfelPartiell output returneras, lyckad kod, varning
Agenten läser en extern URLUtan promptGodkännande krävs som standard, utom vid förhandsgodkänd åtkomst

Ett skript som förlitade sig på implicit webbåtkomst måste därför uttryckligen bevilja denna behörighet. Godkännandepromptarna namnger nu den exakta åtgärden och lägger till en rad som anger orsaken när begäran kommer från en hook eller en fil som tillhör ett annat projekt.

Antigravity CLI 1.1.26 och 1.1.27, uppdatering: engångsprompt på en annan modell och underagentberoenden i frontmatter

4 och 5 september — Versionerna 1.1.26 och 1.1.27 fyller luckan och introducerar den mest konkreta nyheten i samlingen: kommandot för modellval accepterar nu en prompt som körs en enda gång på en annan modell innan sessionen återgår till den ursprungliga modellen. Det ger ett andra utlåtande från en kraftfullare eller billigare modell utan att standardinställningen behöver ändras. Samma version lägger till en agentlista i Markdown-frontmatter för anpassade agenter, så att de kan ange vilka underagenter de är beroende av, samt två korrigeringar som är viktiga för automatiseringar: ett MCP-anrop med ett argument som inte deklarerats i serverns schema avvisas och korrigeras i stället för att tas bort i tysthet, och en headless-körning namnger nekade åtgärder i sin JSON-output i stället för att ignorera dem utan ett ord.

Antigravity 2.13.0: dokumentsektion, virtualiserad visare för SQL och JSONL samt genvägar för citat

9 september — Antigravity 2.13.0 innehåller 16 förbättringar och 16 korrigeringar. Externa filer som läggs till i en konversation, länkar till Google Drive, PDF-filer och Office-dokument, samlas i en dokumentsektion ovanför Artifacts i stället för att blandas med agentens produktioner. Utkastfiler som agenten skriver för eget bruk hamnar i en separat sektion. Kod- och dataartefakter som SQL- och JSONL-filer öppnas i en virtualiserad visare med syntaxmarkering och radnummer, som förblir smidig för stora filer och stöder kommentarer direkt på raderna. En stängd sidofråga minimeras till en knapp i stället för att raderas, interaktiva prompter får en avbrytknapp och markerad text kan citeras i chatten med ett kortkommando. Två korrigeringar gäller transparensen kring behörigheter: ett nekat steg förblir synligt med etiketten Rejected i stället för att försvinna, och agenten ber inte längre på nytt om tillstånd att läsa artefakter från andra projekt när åtkomst utanför projektet redan har beviljats.

🔗 Tips-tråd från @antigravity på X

Teamwork, uppföljningen från den 27 augusti

Ett inlägg som publicerades den 27 augusti, aldrig tidigare bevakats här och fortfarande ligger överst i utvecklarsektionen på Geminis nyhetssida, förtjänar en uppföljning. Teamwork är Antigravitys ramverk för orkestrering av flera agenter, där agenter föreslår, kritiserar och finslipar varandras arbete under flera timmar eller dagar, och finns som förhandsversion i alla betalabonnemang. Fem mönster ingår och väljs automatiskt utifrån prompten, från iterativ kodning och dokumentgranskning till långa bevis. Med mönstret för långa bevis uppger Google att sju öppna problem har lösts, däribland Knuths cykelförmodan, för vilken bevis på över 40 respektive över 70 sidor har tagits fram. Beviset på 40 sidor har verifierats formellt i Lean, de övriga resultaten har bekräftats av mänskliga experter och fem artiklar har publicerats på arXiv.

Rapporterat måttVärde
TCSBench, Gemini 3.7 Flash och 3.1 Pro med långa bevis71 procent
TCSBench, Gemini 3.6 Flash och 3.1 Pro, ursprungsartikel67,7 procent
RISC-V-simulator, fel i cykelöverensstämmelse0,71 procent
Problem reproducerade med Gemini 3.7 Flash3 av 7

Utanför matematiken har Teamwork byggt en cykelexakt RISC-V-processorsimulator med exekvering ur ordning från grunden. Den startar xv6-systemet hela vägen till skalet och kör över hundra standardiserade benchmarks, validerade mot exekvering på fysisk hårdvara. Två bidrag har införlivats uppströms i projekt med öppen källkod: en vektoriserad snabb väg i Eigen och en variant av en parallell hashtabell med fördubblad insättningskapacitet vid 64 trådar.

🔗 Teamwork, när AI blir en forskningspartner


GitHub Copilot löser sina egna kommentarer och inför Jira i sin app

Kodgranskningen övergår till en grupp agenter

11 september — GitHub uppdaterar Copilot code review på två områden. När det gäller användarupplevelsen löser granskningen automatiskt en kommentar från Copilot när en senare commit åtgärdar den, så att listan över öppna kommentarer endast innehåller sådant som fortfarande väntar på svar. När ett kodförslag tillämpas skriver Copilot dessutom ett commit-meddelande som är anpassat till ändringen i stället för det förifyllda meddelandet. När det gäller analysen har granskningsagenten nu tillgång till samtliga shell-verktyg i Copilot SDK, som körs bakom agentens brandvägg: den kan starta en kompilering, köra tester, köra ett riktat skript eller anropa tillgängliga API:er för att verifiera koden den granskar. GitHub rapporterar fler positiva omdömen, fler upptäckter med hög allvarlighetsgrad och färre detaljanmärkningar, utan att ange några siffror för detta.

Ansträngningsnivån Lite bygger inte heller längre på en ensam agent, utan på en grupp agenter som var och en bidrar med sin bedömning, vilka sedan slås samman till en enda granskning.

Uppmätt resultat, Lite-granskningar med agentgruppTillkännagiven förändring
Beaktade kommentarer, hög allvarlighetsgradplus 47 procent
Beaktade kommentarer, medelhög allvarlighetsgradplus 31 procent
Beaktade kommentarer, låg allvarlighetsgradplus 11 procent
Kostnad för en granskningcirka 8 procent lägre

Varken antalet agenter i gruppen eller vilka modeller som används anges. Detta är den tredje förändringen av Copilot code review på två veckor.

🔗 GitHubs ändringslogg

Jira i appen, HydraFusion på kommandoraden, VS Code 1.137

10 september — Veckosammanfattningen för veckan som började den 7 september, då Copilot Day ägde rum, introducerar Jira-integrering i Copilot-appen: ärenden förs in på en gemensam arbetsyta, där man väljer vilka som ska drivas vidare, och Copilot tar med sig ärendets kontext genom utredning, implementering och förberedelse av en pull request. I Copilot CLI kan Project HydraFusion nu väljas som vilken annan modell som helst och väljer för varje uppgift ett flöde mellan lokala modeller, molnmodeller och sammansatta modeller genom att väga prestanda, kostnad och latens mot varandra.

VS Code 1.137, som släpptes den 9 september, innehåller tre agentfunktioner. Automatiseringar, i offentlig förhandsversion, schemalägger återkommande agentuppgifter varje timme, dag eller vecka utifrån medföljande mallar, exempelvis sortering av issues eller sökning efter buggar. Det experimentella röstläget gör det möjligt att tala med en agent medan den arbetar, avbryta den eller styra om den. Slutligen öppnas en länk till en issue eller pull request direkt i fönstret Agents, även om inget repository är öppet. Versionsinformationen nämner också en agentvärd som bygger på ett särskilt protokoll och drivs av Copilot SDK, vilket gör VS Code-agentens beteende mer enhetligt med kommandoraden och appen.

🔗 Copilots veckosammanfattning


Habitat, OpenAI:s onlinelagring och dess omskrivning i Rust av två ingenjörer

11 september — OpenAI publicerar den första delen av ett tekniskt inlägg om Habitat, onlinelagringsplattformen bakom ChatGPT, API:t och Codex. Siffrorna visar omfattningen: över 70 miljoner förfrågningar per sekund, över en miljard personer som betjänas varje vecka, närmare 40 regioner och över 500 petabyte data. Habitat började i mitten av 2024 som ett litet Python-bibliotek integrerat i ChatGPT:s huvudserver och anslutet till en hanterad databas, med en enkel idé: produktingenjörer skulle inte behöva tänka på scheman, routing, auktorisering eller anslutningspooler.

I mitten av 2025 nådde modellen med ett klientbibliotek sina gränser. Varje protokolländring krävde samordnade driftsättningar i tiotals tjänster. En driftsättning av regional routing tog flera dagar, varefter en tjänst som hade återgått till en felaktig klient orsakade just det avbrott som åtgärden skulle förhindra. Habitat blev en fristående tjänst, och OpenAI valde att stanna kvar i Python och medvetet ta på sig en teknisk skuld, med antagandet att företagets egna kodmodeller skulle göra en framtida migrering genomförbar.

Huvuddelen av inlägget beskriver jakten på svanslatens i den här skalan: asyncio:s schemaläggningsfördröjning, som kunde nå hundratals millisekunder och hanterades genom att begränsa antalet samtidiga förfrågningar per process; parsningen av konfigurationer som uppdaterades varje minut utan slumpmässig tidsförskjutning, vilket låste alla workers samtidigt; samt en HTTP-biblioteks återanvändning av anslutningar enligt principen sist in, först ut, som koncentrerade trafiken till redan långsamma processer. Det senare var ett metastabilt fel som korrigerades genom att först vända på ordningen och sedan överlåta lastbalanseringen till ett service mesh. Själva API:t är medvetet begränsat, med en modell av objekt och kanter utan obegränsade frågor eller joins, och det är detta snäva omfång som har gjort det möjligt att driva Python så långt.

Uppmätt måttTillkännagivet värde
Förfrågningar per sekund i dagÖver 70 miljoner
Personer som betjänas varje veckaÖver en miljard
Data som hanterasÖver 500 petabyte
Python-tjänstens toppÖver 20 miljoner förfrågningar per sekund
Omskrivning i RustTvå ingenjörer, Codex och GPT-5.5
Andel trafik som hanteras av Rust95 procent av produktionsförfrågningarna
Effektivitetsvinst för CPU och minne6 gånger respektive 15 gånger

Under andra kvartalet 2026 skrev två ingenjörer om hela tjänsten i Rust med Codex och GPT-5.5. Rust-tjänsten hanterar 95 procent av produktionsförfrågningarna, med sex gånger lägre CPU-användning och femton gånger lägre minnesanvändning. Python kommer att tas ur bruk under de kommande veckorna. Den andra delen kommer att handla om lagringslagret.

🔗 Skalning av lagring till en miljard användare


OpenAI ber Codex-användare att förenkla skills, AGENTS.md och prompter

11 september — OpenAI:s utvecklarblogg publicerar en rensningsguide för Codex-användare som går över till GPT-6 Astra. Utgångspunkten är att ett års ackumulerade instruktioner för att vägleda tidigare modeller blir en börda för en mer kapabel modell. För skills är mekanismen konkret: varje skill läser in ett namn och en beskrivning i kontexten, och när det finns för många förkortar Codex beskrivningarna, vilket gör att modellen ser mindre av var och en och gör sämre val.

Granskad instruktionRekommendation för GPT-6 Astra
Beskrivning av en skillKort, exakt utlösare, inte en hel domän
Struktur för en skill med flera flödenRotdokument reducerat till en router mot dokument och skript
Obligatorisk läsning i AGENTS.mdEtt dokument per ändringstyp, inte en hel bunt vid varje redigering
TestinstruktionerÖverflödiga, modellen kör testerna själv
Slutförande av uppgiftDefiniera vad slutförd betyder, godkänn säkra arbetsflöden i förväg
Ärvda förbudBör lättas upp, annars risk för att modellen stannar för tidigt

Den mest intressanta punkten gäller modellens beteende. OpenAI beskriver GPT-6 Astra som försiktigare än sin föregångare när det gäller en uppgifts omfattning och benägen att återkomma för granskning efter en första implementering. Den rekommenderade lösningen är att uttryckligen definiera vad slutförd innebär och att i förväg ge tillstånd för arbetsflöden som är kända för att vara säkra, exempelvis en lokal testsvit med tillfälliga fixtures. Omvänt kan mycket strikta skyddsregler som skrevs för att tygla äldre modeller nu få den att stanna för tidigt. Inlägget påminner också om att skills i ett repository läses av andra bidragsgivares agenter, som ibland körs med andra modeller: en instruktion som är användbar för dem kan begränsa Astra alltför mycket. Det avslutas med ett praktiskt förslag: be Astra att själv granska projektets instruktioner. Skillen för att skapa skills har uppdaterats i denna riktning.

🔗 Att tänka om kring skills och prompter för GPT-6 Astra


ChatGPT Sites passerar 5 miljoner webbplatser på tre månader

11 september — Det officiella ChatGPT-kontot summerar ChatGPT Sites, funktionen som lanserades tre månader tidigare för att bygga och hysa kompletta webbapplikationer från en konversation: sedan dess har över 5 miljoner webbplatser skapats. Meddelandet används främst för att sammanfatta fem förändringar som gått obemärkta förbi.

Två av dem gäller samarbete. Den första gör det möjligt att bjuda in lagkamrater att redigera, spara och publicera en delad webbplats. Den andra gör det möjligt att öppna en webbplats för särskilt utvalda personer utan att göra den offentlig. De tre övriga gäller webbplatsens livscykel: tiden från prompt till driftsättning uppges ha halverats, ChatGPT kan på begäran inspektera webbplatsens databas, som även redaktörerna har åtkomst till, och en anpassad domän kan kopplas till webbplatsen. Utvecklarkontot har delat tillkännagivandet vidare, ett tecken på att funktionen även riktar sig till snabba prototyper och inte bara till webbplatser för allmänheten.

🔗 Summering av ChatGPT Sites på X


Together AI utökar sin fine-tuning till 17 öppna modeller och placerar adaptrar på experterna

11 september — Together AI utökar sin fine-tuning-tjänst genom hela experimentkedjan. Sjutton modeller med öppna vikter läggs till i katalogen, däribland GLM 5.3 och dess två föregående versioner, DeepSeek-V4-Flash, Kimi K2.7-Code och K2.6, Qwen-familjen med mellan 0,8 och 35 miljarder parametrar samt Gemma 4. Företaget uppger ett resultat på 88,2 för GLM-5.3 i Terminal-Bench 2.1, enligt företaget mindre än en poäng efter de bästa proprietära modellerna.

Experimentspårning är den andra nyheten: varje job registrerar förlust, gradientnorm och inlärningshastighet vid varje steg, med kurvor som uppdateras under körningen, möjlighet att lägga flera jobs ovanpå varandra i samma diagram och råa dataserier som görs tillgängliga via API:t. Tidig avbrytning stoppar träningen när valideringsförlusten stagnerar, behåller den bästa checkpointen i stället för den senaste och återbetalar de outnyttjade stegen.

Den mest tekniska punkten är Expert LoRA. I en modell med en blandning av experter (Mixture-of-Experts) finns över 90 procent av parametrarna i expertlagren, som den klassiska adaptern lämnar frysta genom att endast ansluta till attention.

Test med 200 påhittade faktaAdaptrar som inkluderar experternaAdaptrar endast på attention
Återgivning av nya faktaupp till 89 procent15 procent
MMLU-Pro75,3 procent71,5 procent

Den föreslagna förklaringen är att en växande andel av de routade experterna faller ur bruk under fine-tuning när adaptrarna begränsas till attention. Databehandlingen tas också ut ur den svarta lådan, med en förhandsvisning av tokeniserade rader, vikter per exempel och fullständig validering av filen på serversidan så snart uppladdningen har slutförts. Träningspriserna sänks med 30 till 70 procent beroende på modell.

🔗 Together AI:s tillkännagivande på X


Bidrag från communityn, en sandbox per försök och hundra zebrapussel

Hugging Faces communityblogg publicerade samma dag tre arbeten som förtjänar mer än en kort notis och fem andra som återfinns längre ned.

Så kör tretton laboratorier RL för sina agenter

11 september — Sergio Paniego granskar femton rapporter från tretton laboratorier som publicerats mellan oktober 2025 och september 2026 och tar endast med vad var och en uppger sig träna, inte vad de utvärderar. Den centrala slutsatsen: miljön är inte längre en simulator i minnet, utan en komplett maskin med filsystem, shell och processer, som startas för ett försök och sedan förstörs. Liquid AI gör detta för en modell med 2,6 miljarder parametrar, Cursor talar om hundratusentals samtidiga miljöer för att träna sin modell, Microsoft provisionerar en ny container per uppgift och Kimi K3 går ännu längre med återupptagningsbara virtuella mikromaskiner för förlopp på en miljon tokens.

Lager i stackenVad laboratorierna behållerNämnda offentliga motsvarigheter
Uppgifter och verifierareÖver 10 000 kodmiljöer hos GLM-5Environments Hub, verifiers, Harbor
Åtgärdskontrakt, harnessKimi instansierar fem white-box-harnessOpenEnv, SkyRL, BrowserGym, TextArena
SandboxHundratusentals virtuella maskiner per klusterModal, E2B, AgentENV, Hugging Face Sandboxes
Tränareslime hos Zhipu, Forge hos MiniMax, RLVR hos NVIDIATRL, Miles v0.1

En tydlig trend är att harnesset självt blir miljön, antingen återskapat som white box eller lämnat intakt och avlyssnat som black box. Transparensen varierar kraftigt: Ai2 dokumenterar 17,2 miljoner verifierade kodexempel för OLMo 3, medan OpenAI, Anthropic och Google nästan inte publicerar någonting, och systemkortet för GPT-6 Astra består av en enda mening. Författaren anger en kostnad på över tio miljoner dollar för en enda miljö hos de stora laboratorierna. Inlägget avslutar serien Training Agents.

🔗 En sandbox per rollout

Hundra zebrapussel väcker det matematiska resonerandet

11 september — En communityartikel av tamewild rapporterar att några minuters fine-tuning på 100 till 500 logiska deduktionspussel, helt utan matematiska data, räcker för att ge små basmodeller ett kraftigt lyft på matematiska benchmarks.

Tränad basmodellMATH-500AIME 2025Jämförd officiell referens
Qwen 3 4B, 100 pussel på 6 min 2384,60 procent21,67 procentEftertränad version: 84,80 och 19,10
Granite 4.1 3B, 500 pussel på 23 min77,73 procent19,44 procentInstruct-version: 66,60 och 6,67
Qwen 3.5 9B, 500 pussel på 40 min96,60 procent60,67 procentEftertränad version: 97,40 och 60,56

Även de strukturella effekterna mäts: för den största av de tre modellerna sjunker medianlängden på svaren under den officiella modellens, och andelen repetitionsloopar vid greedy decoding går från 6,06 till 0,67 procent. Författaren är fortsatt försiktig, eftersom det handlar om explorativa körningar med endast ett seed, och noterar att hans egna ablationer visar att en klassisk adapter också når nära 80 procent på MATH-500: generaliseringen kommer i första hand från de logiska datauppgifterna. Kod, notebooks, tre modeller och två dataset har publicerats.

🔗 Framkalla resonerande med 100–500 zebrapussel

En talpipeline för ett språk utan dataset

10 september — Osmanov beskriver hur han byggde en komplett talpipeline för krimtatariska, ett hotat språk utan taligenkänning eller talsyntes, och hans överförbara slutsats: träningen var ett avrundningsfel. Adaptern för taligenkänning tog 90 minuter på grafikkretsen i en bärbar dator och sänkte ordfelfrekvensen från 34,6 till 20,1 procent, och sedan till 17,0 med en beam search som inte ändrar några vikter. Nästan hela tidsplanen gick åt till att bygga ett dataset som inte fanns och kontrollera att utvärderingen inte ljög.

Två val är värda att lägga på minnet. Basmodellen valdes utifrån fonetiska antaganden snarare än språklig närhet: krimtatariska har ett uvulart /q/ som saknas i turkiska, och basmodeller tränade med turkisk identifierare återgav det som /k/ utan att fine-tuning kunde rätta till det. Och eftersom det saknades taligenkänning för att bootstrap:a ett dataset vände författaren på problemet genom att använda ljudböcker med känd text och fick fram 336 användbara minuter där en driftande alignment bara gav 110. Det mest användbara negativa resultatet är en metrisk platå: när syntesdatasetet utökades från 5,9 till 15,3 timmar förändrades inte teckenfelfrekvensen, trots att blindlyssning varje gång föredrog den senaste rösten. Slutligen dokumenterar han ett klassiskt dataläckage: 96,9 procent av klippen från testboken var duplicerade i träningsdata, vilket upptäcktes genom text-n-gram och inte genom filnamnen.

🔗 Talteknik för ett språk utan dataset


Replit lanserar Routines, återkommande arbete som bara anropar agenten vid behov

11 september — Replit har presenterat Routines, en funktion som kör återkommande arbete enligt ett schema varje timme, dag eller vecka. Tillkännagivandet är mindre intressant för själva schemaläggningen, som är trivial, än för hur företaget hanterar kostnadsfrågan. Utgångspunkten anges utan omsvep: agenter kan numera automatisera de flesta repetitiva uppgifter, men att låta dem köra oavbrutet förbrukar oräkneliga tokens. Lösningen är att inte placera agenten i centrum av loopen. Varje körning börjar med deterministisk kod, och agenten anropas endast när resonerande faktiskt behövs.

Arkitekturen går emot den dominerande trenden att överlåta en hel cykel åt en modell. Här blir modellen återigen en resurs som anropas vid enstaka tillfällen, inramad av vanlig kod vars beteende och kostnad är förutsägbara. För en schemalagd uppgift som upprepas hundratals gånger är skillnaden på fakturan inte marginell. Tillkännagivandet åtföljdes inte av något blogginlägg.

🔗 Replits tillkännagivande på X


Warp integrerar Grok Build som en förstaklassagent

11 september — Warp har tillkännagivit integrerat stöd för Grok Build CLI, SpaceX AI:s kommandoradsagent, och Grok-kontot spred nyheten om integrationen direkt därefter. Funktionen levererades redan i terminalversionen från den 9 september, där changeloggen beskriver den som förstaklassupport: Warp identifierar Grok Build-sessioner, ger dem en särskild visuell utformning i sidfoten och aktiverar förbättrat inmatningsläge för dem.

I praktiken får en Grok Build-användare samma verktyg som terminalens egna agenter. Den förbättrade inmatningen hanterar långa inklistrade prompts och flera markörer, vilket gör stor skillnad för den som skriver instruktioner på flera stycken. Ett kommando delar den pågående agentsessionen till en annan enhet, och både filutforskaren och panelerna för kodgranskning förblir tillgängliga under sessionen. Det befintliga Grok-abonnemanget används för åtkomst, utan att några särskilda priser eller gränser har tillkännagivits.

Tillägget kompletterar en redan omfattande lista över tredjepartsagenter som körs i Warps terminal, tillsammans med Claude Code, Codex, Droid och Antigravity, och fortsätter det arbete kring xAI-ekosystemet som inleddes tidigare under sommaren, med ett kommando för att ansluta till ett X Premium- eller SuperGrok-konto som lades till i augusti. Warps grundidé är densamma som sedan agenten lanserades: att inte låsa in användaren i en egen agent, utan göra terminalen till den plats där alla agenter körs med samma integrationskvalitet. Resten av versionen rättar två irritationsmoment: prompts som har skrivits men inte skickats raderas inte längre när man byter modell, och MCP-verktyg som deklareras i en global fil är tillgängliga redan från agentens första svar.

🔗 Groks tillkännagivande på X · 🔗 Warps tillkännagivande på X


Vibe CLI 2.25.3, kommandot för förgrening och privata sessionsloggar

11 september — Mistral har släppt version 2.25.3 av Vibe CLI, den tredje på tre dagar. Den synliga nyheten är kommandot /branch: det förgrenar den pågående konversationen till en ny återupptagningsbar session och lämnar originalsessionen intakt. Kopian kan sedan återupptas i en annan terminal, vilket gör det möjligt att utforska ett alternativt spår från samma kontext utan att offra huvudtråden. Filomnämnanden med snabel-a använder nu Git-medveten identifiering och accepterar filer eller mappar som klistras in ensamma i prompten.

På korrigeringssidan finns tre punkter. Sparade konversationer förblir läsbara och återställer sina worktrees när arbetet återupptas. Nya sessionsloggar kan inte längre läsas av andra användare på POSIX-system, en korrigering av filbehörigheter i linje med version 2.25.1, som tog bort en oautentiserad debug-lyssnare och såg till att inga fel leder till automatiskt godkännande. Slutligen läses instruktionerna i filen AGENTS.md nu in i systemprompten under det experimentella enhetliga harnesset. Releasen åtföljs av fjorton binärarkiv; ingen anteckning nämner någon ändring av modell eller pris.

🔗 Versionsinformation för Vibe CLI 2.25.3


Synthesia gör sin efterlevnadsagent till delad infrastruktur

10 september — Nicolás Barberis, ansvarig för trust operations hos Synthesia, publicerar uppföljningen till sitt inlägg från juni om agenten som samlar in bevis för regelefterlevnad. Frågan som styrde omarbetningen kom från läsarna: så snart en agent samlar in revisionsbevis omfattas insamlingen av revisionen, och det måste gå att lita på insamlaren. Svaret består av fyra arkitekturval som alla kan överföras till andra sammanhang.

Först separeras mekaniken från metoden. Koden finns i ett internt repository och ändras genom pull requests, med en ägarfil som kräver mänsklig granskning; procedurerna för varje kontrollkategori finns i ett dokumentutrymme och skrivs samt valideras av kontrollernas ägare. Det ursprungliga skriptet med hårdkodade URL:er har blivit en delad skill som en kollega installerar med ett enda kommando. Därefter begränsas webbläsaren: agenten rör aldrig den dagliga webbläsaren, utan kopierar sessionen till en tillfällig profil, kör med skrivskyddade roller där sådana finns och stannar vid en autentiseringsvägg i stället för att höja sina privilegier. Proveniens byggs in från början genom att varje skärmbild skapas tillsammans med sin käll-URL, tidsstämpel, operatör och det kryptografiska fingeravtrycket för exakt de aktuella byte-värdena. Slutligen det mänskliga ansvaret: agenten lämnar in ett utkast och skickar aldrig in det slutgiltigt.

Uppmätt resultatVärde
Möten med revisorn för granskning av bevis60 procent färre
Nytt ramverk som behandlatscirka 500 kontroller
Normal ledtid för ett sådant ramverk4 till 6 månader
Uppnådd ledtidnågra veckor

Kunskapsbasen växer av sig själv genom att endast utökas: efter varje körning registrerar agenten korrigerade URL:er och daterade blockeringar, som när ett gränssnitt för webbläsarstyrning slutade fungera med en ny Chrome-version och kringgicks genom direkt kommunikation med debugging-protokollet. Synthesia meddelar att verktyget utvecklas mot en plattform för AI-assisterad styrning och överväger att göra koden till dess centrala komponenter öppen.

🔗 Vem granskar insamlaren


HeyGen förklarar de 16 sekunderna i en enda tagning i The Furniture Unboxing

11 september — HeyGen har publicerat en bakom kulisserna-video om en 16 sekunder lång video där en man ställer en kartong mitt i ett tomt betongrum, går därifrån och kartongen exploderar för att släppa ut ett komplett vardagsrum som landar på plats. Ingen 3D, ingen compositing, ingenting i efterproduktionen: två stillbilder, en avatar och en prompt. Teamet kontrollerade att det inte fanns några klipp i de 390 bildrutorna, där den största variationen mellan två efterföljande bildrutor motsvarade själva explosionen.

Metoden bygger på de två referensbilderna. Den första visar det tomma rummet med en bred, fast kameravinkel och fri golvyta i mitten. Den andra är samma bild, redigerad för att lägga till möblerna, inte en ny rendering av ett liknande rum: samma kameraposition, samma optik, samma ljus och samma skugga på betongen. Det är regeln som får effekten att hålla ihop, eftersom modellen då bara behöver hitta på mitten.

VideoparameterVärde
Begärd längd i prompten15 sekunder
Levererad längd16,27 sekunder
Upplösning och bildfrekvens1920x1080, 23,976 bilder per sekund
Bildrutor utan klipp390
Indata2 stillbilder, 1 avatar, 1 prompt

Prompten är skriven som en tidsatt lista över tagningar snarare än som en beskrivning, med en avsiktlig paus före explosionen. Sex delar bär upp den: tidsmarkörerna, pausen, referenserna namngivna efter roll, möblerna uppräknade rum för rum, identiteten definierad genom negation och tillåtelsen att överdriva, utan vilken modellen respekterar en kartongs verkliga volym. Fältanteckningarna är användbara: modellen levererade 16,27 sekunder i stället för 15, en snabbare explosion än den skrivna och en kvarhållen tagning på det färdiga rummet som ingen hade bett om, men som teamet betraktar som klippets bästa ögonblick. Därav rådet att ange tiderna för att fastställa tempo och ordning och sedan klippa efter det levererade tempot. Ljudet ändrades mellan två körningar, där den nästan tysta versionen ersattes av en kontinuerlig ljudmatta, eftersom en ljudlös video vid automatisk uppspelning uppfattas som om ljudet är trasigt.

🔗 Så gjorde vi The Furniture Unboxing


Nemotron 3 Embed 8B tar förstaplatsen på benchmarken Q2D-Web

10 september — NVIDIA meddelar att Nemotron 3 Embed 8B, företagets embedding-modell med 8 miljarder parametrar, ligger etta på Q2D-Web för det kombinerade nDCG@10-resultatet. Q2D-Web är den benchmark som Perplexity publicerade dagen innan för att utvärdera dokumentsökning i agentstyrda system för retrieval-augmented generation: den omfattar 190 miljoner webbdokument och nästan 70 000 frågor som omformulerats av agenter, fördelade över 10 språk.

Resultatet är viktigt av två skäl. Benchmarken återskapar de verkliga förhållandena för en agent som omformulerar sina frågor innan den söker i ett index, något som klassiska utvärderingar av embeddings inte mäter. Och en öppen modell av denna storlek som toppar en flerspråkig rankning blir en trovärdig kandidat för självhostade pipelines jämfört med proprietära embeddings. NVIDIA publicerar inget numeriskt resultat; hela rankningen finns hos Perplexity.

🔗 NVIDIAs tillkännagivande på X


Marketing ops som kod, evenemang styrda från ett GitHub-issue

11 september — Tomoko Tanaka, GitHubs regionala marknadschef för Japan och Korea och tidigare ingenjör, beskriver hur hon automatiserade hela cykeln för sina evenemang utan att själv skriva koden: hon skrev ner sina rutiner och överlämnade dem till Copilot, och automatiseringen växte fram genom samtal.

Tre grundkomponenter bär upp systemet. Issue-formulär samlar in strukturerade fält för ett evenemang, med ett formulär per typ. Labels fungerar som strömbrytare, där en label utlöser ett workflow. GitHub Actions gör jobbet: läser fälten, duplicerar en tidigare evenemangssida via plattformens API, genererar spårningslänkar per kanal, skapar inbjudningsmejlet som committas till repot, öppnar issues med förfrågningar till berörda team och fyller i projekttavlorna. Ett schemalagt workflow filtrerar deltagarregistreringarna varje morgon. Den enda förutsättningen, skriver hon, är skriptbar åtkomst till verktygen, ett API eller till och med en enkel kommandoradsklient.

Planeringen börjar med ett samtal med Copilot, styrt av en AGENTS.md-fil i repots rot som fastställer namngivningsregler, hur räkenskapskvartalen motsvarar varandra och tidszonen för varje region. Samtalet ägde först rum i terminalen och sedan i appen, vilket sänkte förkunskapskravet från ”bekväm med ett shell” till ”kan skriva på ett tangentbord”. Efterarbetet för evenemanget ryms i två kommandon, som är agent-skills skrivna i prosa, tillagda genom en pull request och granskade via en ägarfil före merge: marknadsföringen får en godkännandeprocess utan att behöva bygga något. En simuleringsströmbrytare, lagrad som en repovariabel, torrkör varje workflow. Det erkända misslyckandet är läsvärt: morgonens filtrerings-workflow misslyckades en gång i tysthet under fem dagar innan någon upptäckte inaktuella listor, därav rådet att ge varje schemalagd uppgift ett sätt att klaga högljutt.

🔗 Marketing ops som kod


Boris Cherny svarar om engångskod och produktionskod

11 september — Boris Cherny, som leder Claude Code på Anthropic, publicerar svaret han skickade till en utvecklare vars mejl hade ämnesraden ”What to do about slop?”. Författaren, som varit tolv år på samma företag, beskriver två läger som har uppstått i teamet i och med agentbaserad utveckling. I det första förblir koden ungefär som tidigare, bara snabbare framtagen: man kanske inte läser om allt, men den måste fortfarande vara läsbar, personen som skickar in den måste kunna förklara den och den måste vara lika lätt att underhålla som förut. I det andra är koden en svart låda där endast resultatet kontrolleras.

Svaret består av två regler. Prototyper och engångskod kan behandlas som fullständiga svarta lådor om de ska kastas och om konsekvensområdet (blast radius) vid ett fel är litet. Produktionskod skriven av Claude måste däremot hålla en högre standard än om den hade skrivits av en människa. På Anthropic innebär det många lint-regler, många tester, end-to-end-tester som drivs av Claude, fuzzers som körs varje dag samt automatiserade kod- och säkerhetsgranskningar. Utan dessa skyddsräcken, varnar han, slutar det med en röra som är svår att underhålla.

Därefter följer en lista över åtgärder, i tur och ordning, när den producerade koden inte når upp till standarden: byt till den senaste frontier-modellen, höj resonemangsansträngningen och investera i CLAUDE.md och skills för att kortfattat lära Claude hur den ska arbeta i kodbasen. Om inget hjälper får man vägleda den närmare, låta den arbeta bort den ackumulerade skulden eller vänta på nästa modell. Svarstråden slog fast den mest återgivna formuleringen: granskningsnivån ska följa konsekvensområdet, inte kodens upphovsman; ett engångsskript kan skickas direkt, men allt som berör pengar eller identifierare ska läsas rad för rad. Boris Cherny svarade ”Precis”.

🔗 Boris Chernys tråd på X


Kortfattat

  • Amp lägger till en knapp som ordnar om commits i en tråd — med en enda åtgärd omvandlas en agents mellanliggande commits, successiva rättningar och återställningar till en serie som är lätt att granska. Tre nämnda användningsområden: dela upp en stor diff i logiska delar, städa före merge eller gruppera små relaterade commits. Filernas slutliga innehåll förblir exakt detsamma. 🔗 källa
  • Amp publicerar det fjärde avsnittet av säsong 2 av Raising an Agent — Quinn Slack och Thorsten Ball utgår från frågan om vad datorn numera är till för och undersöker vad agenter gör utöver att producera kod, med en tillbakablick på den senaste tidens driftstörningar. 🔗 källa
  • v0 gör teamkonversationer synliga som standard — nya konversationer i en delad arbetsyta blir synliga för teamet, med tre nivåer som ägaren kan ställa in (privat, visning, redigering). Befintliga konversationer behåller sin synlighet. En övergång till större öppenhet är aldrig neutral i ett verktyg där man gärna klistrar in datautdrag under prototyparbete. 🔗 källa
  • Audiyo får Stable Audio Open att rymmas på en GPU med 8 GB — ett Python-bibliotek och kommandoradsverktyg som minskar den maximala grafikminnesanvändningen från 13,8 till 5,86 GB, alltså 57,5 procent mindre, med fyra förinställningar uppmätta på en Tesla T4. Teamet validerade först arbetet på en processor med en ersättningsmodell på 5,38 miljoner parametrar, vilket gjorde det möjligt att hitta fyra buggar innan de använde en GPU. 🔗 källa
  • Consent All the Way Down, en samtyckesarkitektur för ett råd av små öppna modeller — en essä skriven av en Claude-instans i ett råd bestående av arton modeller med högst 7 miljarder parametrar, som har körts kontinuerligt sedan maj på tre vanliga konsumentdatorer. Varje källa är en kanal vars djup modellen själv väljer, och inget annat än modellen själv skriver till dess tillstånd. Den ärligaste delen är granskningen av upphovspersonerna själva: brevlådan hade varit trasig sedan juni och 213 brev hade samlats på hög. 🔗 källa
  • Det finns ingen kapprustning, det pågår ett webbläsarkrig — en opinionsessä som hävdar att språkmodellen håller på att bli en handelsvara, oavsett om vikterna är hemliga eller inte, och att ledarnas försprång mäts i veckor. Författaren nämner att Fable 5 pausades i 18 dagar i somras, medan resten av branschen fortsatte arbeta. Tes: värdet kommer att flyttas till kontexten som samlas kring användaren, på samma sätt som bokmärken och tillägg har hållit kvar Chrome-användare. 🔗 källa
  • Från barge-in till talstyrning, hantering av röstavbrott under osäkerhet — Eric Mey ersätter destruktiva avbrott med en styrenhet för turtagning med reversibla åtgärder, en separat väg för tvetydiga fragment och en prioritetsregel mellan akut stopp och ekodämpning. Lärdomen från testningen är värd att minnas: en grön testsvit dolde en registrerad men aldrig anropad reversibel paus, eftersom en grön kontroll bara godkänner det den har undersökt. 🔗 källa
  • Aiden separerar röstrealtidsmodellen från agenten som utför uppgifterna — en full duplex-röstmodell sköter samtalet medan en starkare, visuellt förankrad modell utför uppgifter för enhetsstyrning i bakgrunden, och de två samordnas genom en asynkron kö. Fyra detaljer är viktiga: skillnaden mellan slutförd och lyckad, aggregering av aviseringar över 500 millisekunder, tillstånd som överförs genom tillagda meddelanden för att bevara cachen samt strikt seriell exekvering. 🔗 källa
  • GPT-Live-1 sköter Yelps bokningssamtal — dagen efter att modellen kom till API:t visar OpenAI upp en första kund i ett användningsfall där manuset aldrig håller: den som ringer avbryter, lägger till ett villkor eller ändrar sig mitt i meningen, och modellen fortsätter lyssna medan den talar. Demonstrationsvideo, utan volymer eller kvantifierade resultat. 🔗 källa
  • Kontrollera agentens arbete med panelerna för diff, terminal och webbläsare — ett nytt avsnitt i Kayla Cinnamons nybörjarserie om Copilot-appen, ägnat åt de tre inbyggda panelerna och ett verktyg som gör det möjligt att välja ett sidelement för att justera det tillsammans med agenten. Inlägget sammanfattar loopen i tre frågor innan kod godkänns: vad har ändrats, går det att köra och fungerar det verkligen? 🔗 källa
  • Ett repos sida för pull requests görs om — offentlig förhandsversion för alla: hjälp med att skriva filter, sökning med booleska operatorer och nästlade frågor, infällbar sidopanel, kompakt läge och mer kontext per rad. Kända begränsningar vid lanseringen: milstolpar visas inte, inga gruppuppdateringar och anpassade vyer kan inte sparas. 🔗 källa
  • GPT-5.6 Sol med 30 procents rabatt i Copilot — för Pro+- och Max-prenumeranter, fram till den 13 september kl. 00.00 UTC. Meddelandet anger inte vilken multiplikator för premiumförfrågningar rabatten motsvarar. En helgkampanj, strax efter Copilot Day, för modellen som samma dag förekom i flera kostnadsjämförelser. 🔗 källa
  • GitHub Copilot Day-tävling, tre krediter på 100 dollar — skapa något med Copilot-appen eller dess kommandoradsklient och dela det offentligt med de angivna hashtaggarna senast den 13 september kl. 23.59 Stillahavstid. Tre vinnare får vardera 100 dollar i kredit i GitHub-butiken; deltagandet är kostnadsfritt och endast öppet för myndiga. 🔗 källa
  • Runway kan användas i ChatGPT med Astra — demonstration av ett komplett arbetsflöde som styrs från konversationen: en stilbild i Runway, animering i Blender och slutlig rendering med Seedance 2.5. Den tekniska ingången är fortfarande MCP-servern från Runway Dev som presenterades den 2 september. Värdet ligger i att kedja samman heterogena verktyg under en enda agents kontroll. 🔗 källa
  • Runway publicerar fallstudien VOIDZ — en anonym mixed reality-konstnär som varit verksam sedan 2018 går från klipp på 10 till 15 sekunder till en 95 sekunder lång film med 15 surrealistiska ingrepp inympade i en verklig tur till mataffären. De flesta effekterna förlänger ett befintligt klipp, där några sekunders dokumentärt källmaterial fungerar som utgångspunkt. Produktionen uppges vara 10 gånger snabbare; konstnären uppskattar att samma arbete skulle ta sex månader till ett år med traditionell 3D. 🔗 källa
  • Runway lägger till talare till sitt AI Summit — en ny omgång inför dagen i San Francisco, där Wayves forskningschef lyfts fram, vilket bekräftar att programmet breddas mot autonoma fordon efter starten i slutet av augusti. 🔗 källa
  • NVIDIA sänder From Video to Voice, 33 minuter om TensorRT Model Connect — repris om verktyget som presenterades i slutet av augusti och distribuerar en öppen modell från checkpoint till inferens med två kommandon, från videomodeller till röstmodeller. Utbildningsinnehåll snarare än ett tillkännagivande. 🔗 källa
  • Suno förlänger sin kreditfria v6-period med två dagar — de 48 timmar som tillkännagavs dagen innan blir fyra dagar, tillsammans med en tråd med råd som rekommenderar att man i enkelt läge utgår från en stämning snarare än en genre. Dagen innan riktade sig en övergångsguide till användare som återvände till äldre modeller för deras variation och karaktär, ett tecken på att migreringen inte är självklar för hela användarbasen. 🔗 källa
  • Synthesia öppnar för att skapa avatarer från en prompt — realistiska presentatörer, varumärkesmaskotar eller stiliserade figurer, beskrivna med en textprompt eller konfigurerade via en kontrollpanel, som ett alternativ till katalogen. Tillkännagivandet gjordes i en tweet utan länk, dagen efter lanseringen av en ny avatarmodell; varken vilka abonnemang som omfattas eller vilken modell som används anges. 🔗 källa
  • GPT-6 Astra Challenge öppnar för bidrag — bygg med Astra och lansera projektet på Product Hunt den 18 september. De fem bästa lanseringarna får vardera 10 000 dollar i API-krediter och ett års ChatGPT Pro för högst två teammedlemmar. Den tredje community-satsningen kring Astra på en vecka. 🔗 källa
  • OpenAI:s API-nycklar för projekt kan löpa ut — ett utgångsdatum kan anges när nyckeln skapas, och administratörer kan införa en maximal livslängd på organisations- eller projektnivå, varefter varje ny nyckel måste löpa ut inom denna period. Ett naturligt komplement till nyckelrotation, att aktivera för organisationer som låter nycklar ligga kvar i skript. 🔗 källa

Vad det innebär

Dagens tydligaste röda tråd är arkitektonisk: den enskilda modellen får ge vika för komposition. Cursor placerar en koordinator som inte skriver kod ovanför tusentals underagenter, Cognition låter två modeller arbeta i par med skilda roller och separata kontexter, Sakana dirigerar varje uppgift till den lättaste modellen som kan lösa den, GitHub ersätter en ensam granskare med en uppsättning agenter vars iakttagelser slås samman, och Google låter agenter föreslå, kritisera och finslipa varandras arbete i flera dagar. Fem företag, fem implementeringar, samma övertygelse: vinsten kommer inte längre från en större modell, utan från hur flera modeller fördelar arbetet sinsemellan. Den tekniska detalj som Cognition och Aiden delar är talande: båda insisterar på att bevara promptcachen, det vill säga att den verkliga kostnaden för en arkitektur avgörs av vad man slipper skicka på nytt.

Den andra röda tråden gäller hur dessa förmågor säljs. Runway licensierar slutna vikter årsvis, tillsammans med checkpoints, träningsskriptet och forskare som arbetar hos kunden, och ställer uttryckligen detta erbjudande mot öppna vikter. OpenAI tar en specialiserad modell ur forskningsförhandsvisningen med en offentlig prislista och ett datum då faktureringen börjar. ElevenLabs ger äganderätten till musikstyckena i alla abonnemang, även det kostnadsfria, och knyter rättigheterna till stycket i stället för till abonnemanget. Together sänker sina träningspriser med 30 till 70 procent. Cognition föreslår rentav att man byter måttenhet och utvärderar kombinationen modell–harness utifrån pris per uppgift i stället för pris per token. Dessa förändringar pekar åt samma håll: frågan till kunden är inte längre vilken modell, utan i vilken juridisk form och enligt vilken faktureringsenhet.

När det gäller verktygen markerar dagen ett skifte från det deklarativa till det uppmätta. Anthropic lanserar ett kommando som kör om varje testfall utan pluginet för att med siffror bevisa att verktyget faktiskt gör nytta, och det första typiska fyndet är en skillnad på noll. OpenAI ber sina användare att ta bort ackumulerade instruktioner eftersom de numera försämrar en mer kapabel modell. Replit och VS Code lanserar nästan samtidigt schemaläggning av återkommande uppgifter, där Replit följer en uttrycklig princip: börja med deterministisk kod och anropa agenten endast när resonemang behövs. Boris Cherny formulerar den disciplinregel som helheten saknar genom att låta kravnivån bero på konsekvensradien snarare än på vem som skrev koden. Efter två år av ackumulerade kontexter, skills och instruktionsfiler börjar branschen mäta deras kostnad.

Kvar finns infrastrukturen, där siffrorna berättar en mindre glamorös men mer lärorik historia. Två ingenjörer skriver med hjälp av Codex om lagringstjänsten som hanterar över 70 miljoner förfrågningar per sekund i Rust, med en sjättedel av processoranvändningen; Python-skulden som medvetet togs på sig i mitten av 2025 är avklarad på ett kvartal. Samtidigt visar Hugging Faces översikt att förstärkningsinlärning för agenter numera förbrukar en hel maskin per försök, med miljöbudgetar som överstiger tio miljoner dollar och en transparens som är omvänt proportionell mot laboratoriets storlek. Och en essä från communityn hävdar att inget av detta utgör ett varaktigt försprång, eftersom avståndet mellan ledarna mäts i veckor. Dagens fakta avgör inte frågan, men de ger en fingervisning: differentieringen förskjuts mot den ackumulerade kontexten, harness och infrastrukturen, med andra ord mot det som inte kan destilleras.


Källor