ai-powered-markdown-translatorArtikel översatt från franska till svenska med gpt-5.6-sol.
Fyrtionio tillkännagivanden under 2 september, den tredje högsta volymen sedan denna bevakning inleddes. Tre ledande modeller släpptes samma dag — Gemini 3.8 Flash från Google, Muse Spark 1.3 från Meta Superintelligence Labs och Qwen3.8-Max-0902 från Alibaba — och ingen av dem lyfte fram jakten på råa poäng.
Fyra strömningar löper genom denna utgåva. Först priset, som har blivit det centrala argumentet i samtliga tre lanseringar. Därefter lokal inferens, där videogenerering flyttar ner till en skrivbordsdator och koden till en inferensmotor för Apple Silicon öppnas samma kväll. Modellstyrning i företag, där GitHub kräver datalagring för en modell och låter användarna välja standardalternativ för alla andra. Och cybersäkerhet, med en specialiserad modell som endast är tillgänglig för utvalda försvarare och en allians som ansluter sig till Linux Foundation.
Gemini 3.8 Flash och 3.8 Flash Cyber, en modell som arbetar hårdare till samma pris
2 september — Google presenterade två modeller signerade av Tulsee Doshi (Senior Director, Product Management) och Raluca Ada Popa (Gemini Security Lead, Google DeepMind): Gemini 3.8 Flash och Gemini 3.8 Flash Cyber. Det är den tredje Flash-versionen på sex veckor, och 3.7 Flash hade bara funnits i tre veckor.
De två varianterna delar samma grundläggande intelligens, och Google tillskriver uttryckligen en del av framstegen inom kodning och resonemang till omfattande träning inom cybersäkerhetsområdet: arbetet med den defensiva modellen har även lyft den generella modellen. Introduktionspriset är oförändrat jämfört med 3.7 Flash.
| Egenskap hos Gemini 3.8 Flash | Uppmätt värde |
|---|---|
| Pris för indata | 0,75 dollar per miljon tokens |
| Pris för utdata | 3,75 dollar per miljon tokens |
| HLE-Verified | 54,9 % |
En punkt förtjänar utvecklarnas uppmärksamhet, eftersom Google uttrycker det utan omsvep: modellen förbrukar mer. Den förbättrade tillförlitligheten kommer från ett designval — vid komplexa uppgifter utför 3.8 Flash ytterligare resonemangssteg och anropar verktyg iterativt. Vid höga ansträngningsnivåer stiger därför kostnaden i tokens, och Google rekommenderar att man sänker ansträngningsnivån eller håller sig till 3.7 Flash för arbetslaster där beräkningseffektivitet väger tyngst. Den föregående versionen stöds fortfarande fullt ut.
Cyber-varianten är den mest ovanliga. Den är förbehållen betrodda försvarare genom programmet Fairwind, som lanserades samma dag, och är inriktad på autonom upptäckt av sårbarheter och framför allt automatisk korrigering av dem.
| Cybersäkerhetstest | Gemini 3.8 Flash Cyber | Jämförelsepunkter |
|---|---|---|
| CyberGym Pass@1 (upptäckt av C/C++-brister) | 86,2 % | GPT-5.5-Cyber 85,6 % · Mythos 5 83,8 % · GPT-5.6 Sol 83,6 % · 3.5 Flash Cyber 77,5 % |
| Internt benchmark för 20 språk | över 70 % | Bredare omfattning än enbart C/C++ |
| CWE-Bench pass@1 (korrigering, Collinear) | 47,2 % | Ledande frontier-modell på 47,8 %, men till en betydligt högre kostnad |
Siffrorna från den interna driftsättningen stärker positioneringen kring kostnad och prestanda snarare än ren dominans: Chrome Security-teamet får 2,6 gånger fler giltiga korrigeringar än med de bästa och betydligt större kommersiella modellerna, Wiz mäter 7,5 till 9,7 % högre recall i sitt benchmark för penetrationstestning till en 2,3 till 5,2 gånger lägre kostnad, och Cloud Vulnerability Research-teamet identifierade en kritisk grundläggande sårbarhet på mindre än två timmar, där forskningen vanligtvis tar månader. Den generella modellen är redan driftsatt i Antigravity, Gemini API via Google AI Studio och Android Studio, Stitchs gränssnittsgenerering, Gemini Enterprise samt för Google AI Pro- och Ultra-prenumeranter i Gemini-appen, AI Mode i Google Search och Google Sheets.
🔗 Tillkännagivandet av Gemini 3.8 Flash och 3.8 Flash Cyber
CursorBench-poängen som dokumenterar lanseringen
Cursor lade till Gemini 3.8 Flash i sin modellväljare några timmar efter presentationen, och företagets eget benchmark ger det bästa tillgängliga måttet på modellens kapacitet under agentiska förhållanden. CursorBench-loggen, daterad samma dag, anger att 3.8 Flash befordras till Gemini-versionen ”Latest” och att 3.7 Flash flyttas till en sekundär position.
| Modell och ansträngningsnivå | CursorBench 3.2-poäng | Genomsnittlig kostnad per uppgift | Steg per uppgift |
|---|---|---|---|
| Fable 5.1 Max | 73,4 % | 9,64 dollar | 70 |
| Grok 4.6 Extra High | 70,8 % | 2,81 dollar | 46 |
| Fable 5.1 High | 69,4 % | 4,80 dollar | 44 |
| Opus 5 Extra High | 69,3 % | 7,35 dollar | 72 |
| Gemini 3.8 Flash High | 69,2 % | 2,38 dollar | 161 |
| Gemini 3.8 Flash Medium | 67,0 % | 1,93 dollar | 136 |
| Gemini 3.7 Flash High | 61,6 % | 1,20 dollar | 99 |
Tabellen kan läsas diagonalt: med 69,2 % får Gemini 3.8 Flash High en poäng i nivå med Fable 5.1 High till ungefär halva priset och med Opus 5 Extra High till en tredjedel av priset. Skillnaden mot föregående generation är 7,6 poäng. Kolumnen med antal steg påminner dock om den dolda kostnaden för Googles designval: 161 steg per uppgift, jämfört med 44 för Fable 5.1 High. Cursor anger själv två förbehåll längst ned på sidan — resultaten uppvisar variation, och den angivna kostnaden har beräknats utifrån de offentliga priserna per miljon tokens och inte uppmätts på en faktura.
🔗 Gemini 3.8 Flash i Cursor · 🔗 CursorBench-resultat
Muse Spark 1.3, den agentiska modellen från Meta Superintelligence Labs
2 september — Meta Superintelligence Labs släppte Muse Spark 1.3, efterföljaren till Muse Spark 1.2, som samma dag driftsattes i Muse Code och i Meta Model API, tillgängligt från dev.meta.ai. Det är laboratoriets andra lansering på två dagar, efter Muse Voice Transcribe.
Den uttalade inriktningen är inte jakten på höga poäng utan faktisk användbarhet. Modellen är utformad för att klara långvarigt arbete genom att hantera flera flöden i en och samma tråd: inför ett öppet mål använder den verktyg för att bygga upp sitt eget sammanhang från oordnade och motstridiga källor, rättar till luckor i sin plan och håller reda på vad den har lärt sig. Den mest ovanliga delen gäller samarbetet: Muse Spark 1.3 är tränad att ställa klargörande frågor när en instruktion är tvetydig, be användaren om hjälp när den har kört fast och begära bekräftelse före en åtgärd med konsekvenser. Jämförelser utförda av Meta-ingenjörer visar att den använder omkring 20 % färre verktygsanrop och 25 % färre tokens än version 1.2 — en skillnad som syns direkt på fakturan.
| Utvärderad kategori | Benchmark | Muse Spark 1.3 | Muse Spark 1.2 | GPT-5.6 Sol | Opus 5 |
|---|---|---|---|---|---|
| Agent | GDPVal-AA v2 (kunskapsarbete) | 1754 | 1615 | 1710 | 1824 |
| Agent | OSWorld 2.0 (agentisk användning av datorn) | 66,9 | 47,6 | 62,7 | 68,3 |
| Agent | DeepSearchQA (agentisk navigering) | 89,4 | 85,9 | 93,0 | 90,4 |
| Agent | AutomationBench (heltäckande affärsarbetsflöde) | 49,4 | 38,2 | 46,7 | 50,3 |
| Lång kontext | MRCR 512K-1M | 98,1 | 55,5 | 73,8 | – |
| Kodning | DeepSWE v1.1 (lång agentisk kodning) | 75,4 | 55,0 | 73,0 | 74,0 |
| Kodning | SWEAtlas CodeBase QnA | 59,4 | 46,2 | 53,5 | 52,7 |
Tabellen förtjänar en noggrann läsning. Muse Spark 1.3 dominerar tydligt inom lång kontext och kodning, men Opus 5 ligger före i de fyra agentiska testerna som valts ut här. Framför allt har jämförelsen inte genomförts på lika villkor, vilket framgår av Metas publicerade metodik: Muse Spark 1.3 och 1.2 utvärderades på ansträngningsnivån xhigh, medan Claude Opus 5 och GPT-5.6 Sol utvärderades i läget max. Det finns ett enda undantag, DeepSWE v1.1, där Muse Spark 1.3 mättes i max — just det läge som ännu inte är tillgängligt och som enligt Meta kommer när de kompletterande säkerhetstesterna har slutförts.
Ett stycke i färdplanen väcker särskilt intresse för det öppna ekosystemet.
Stay tuned for more updates soon, including bigger models, Muse Spark open weights, and more.
🇸🇪 Håll utkik efter fler nyheter snart, däribland större modeller, öppna vikter för Muse Spark och mycket mer. — @AIatMeta på X
Efter ett år då Meta tydligt minskade sina lanseringar med öppna vikter är åtagandet anmärkningsvärt — det återstår att se vilken version det gäller, eftersom varken datum eller omfattning anges.
🔗 Vi presenterar Muse Spark 1.3
Qwen3.8-Max-0902 intar förstaplatsen på Code Arena WebDev
2 september — Qwen släppte en uppdatering av sin flaggskeppsmodell: Qwen3.8-Max-0902, en daterad snapshot som också svarar på aliaset qwen3.8-max-2026-09-02. Modellen behåller augustiversionens strukturella egenskaper — 2 400 miljarder parametrar och ett kontextfönster på 1 miljon tokens — men har genomgått ytterligare en efterträningsfas inriktad på ”Coding & Cowork”.
| Modellegenskap | Publicerat värde |
|---|---|
| Parametrar | 2,4 T |
| Kontextfönster | 1 M tokens |
| Maximal indata | 991 K tokens (983 K i thinking-läge) |
| Maximal utdata | 131 K tokens |
| Resonemangsbudget | 262 K tokens |
| Pris för indata och utdata | 2 dollar och 6 dollar per miljon tokens |
| Explicit cacheläsning | 0,17 dollar per miljon tokens |
| Implicit cacheläsning | 0,25 dollar per miljon tokens |
| Explicit cachening | 2,50 dollar per miljon tokens |
| Hastighetsgränser | 1 M tokens per minut, 15 K förfrågningar per minut |
Modellen tar emot bilder, text och video som indata och erbjuder fem integrerade verktyg via Responses API: kodtolk, bild-till-bild-sökning, text-till-bild-sökning, webbutdragare och webbsökning. Den blev tillgänglig via API på QwenCloud samma dag.
Samma dag publicerade Arena.ai sina resultat för Code Arena WebDev. Qwen3.8-Max-0902 går direkt in på förstaplatsen i totalrankningen med 1 691 poäng, vilket är 22 poäng mer än föregående version, 3 poäng före Claude Opus 5 med inställningen Max och 17 poäng före Kimi K3 med inställningen Max. Med ett blandat pris på 5 dollar per miljon tokens intar modellen den högst rankade positionen på Arenas Paretofront, det vill säga det bästa förhållandet mellan poäng och kostnad i hela rankningen.
Detaljerna per kategori nyanserar bilden: etta inom Data & Analytics och Consumer Product, tvåa inom Brand & Marketing, Gaming och Simulations samt trea inom Content Creation Tools och Reference-Based Design. Modellens styrka ligger alltså mer i dataapplikationer och konsumentprodukter än i uppgifter med kreativ tyngdpunkt. Arena meddelar att poäng från Agent Arena kommer senare.
🔗 Tillkännagivandet av Qwen3.8-Max-0902
Inferensen lämnar molnet: video på en stationär dator, en lokal motor med öppen licens
Det är dagens underström, och den ryms inte i något enskilt tillkännagivande. Två stora publiceringar och fyra mer diskreta signaler pekar i samma riktning: att lokalt köra sådant som i går krävde en GPU i ett datacenter.
2 september — FastVideo-teamet vid Hao AI Lab (UCSD) har publicerat den lokala portningen av FastH3, sin destillerade version av den öppna videomodellen MiniMax H3. Gemensam generering av video och ljud krävde hittills en GPU i ett datacenter; modellen körs nu på en NVIDIA DGX Spark, två DGX Spark sammankopplade via QSFP-länk eller en Mac med Apple Silicon och minst 36 GB enhetligt minne.
Den främsta begränsningen är inte beräkningskraften utan minnet. DGX Spark har 128 GB enhetligt LPDDR5X-minne med cirka 270 GB/s, ungefär en tiondel av bandbredden hos HBM i datacenter, varav 121 GB faktiskt är tillgängliga för en arbetslast. Pipelinen arbetar därför i faser: koda prompten, frigöra textkodaren, läsa in transformern, brusreducera, frigöra den och därefter läsa in VAE. På en diskret GPU frigörs enhetens minne när vikterna kopieras tillbaka till värden; på Spark hamnar kopian i samma pool. Teamet har tagit bort den till förmån för direkt inläsning av DiT på GPU:n — transformerns inläsningstid sjunker från 445 s till 39 s, och en körning i 768×1344 med 124 bilder från 772 s till 336 s.
| Testmaskin | Första genereringen | Upprepad generering |
|---|---|---|
| Apple M4 Max | 504 s | 465 s |
| DGX Spark | 264 s | 243 s |
| 4x GB200 | 10,2 s | 5,1 s |
Jämfört med det offentliga vLLM-Omni-receptet för DGX Spark, som kräver 1 881 s i 1024×576 för fem sekunders video och 50 steg, når FastH3 i fyra steg 268 s, alltså omkring 7x; förhållandet stiger till 8,4x i 832×480 och sjunker till 7,9x i 1344×768. På M4 Max går kodningen av en prompt som inte är cachad från cirka 80 s till cirka 17 s, och TAEH3-avkodaren minskar avkodningen från 102 s till 1 s samtidigt som minnestoppen sänks från 11,0 till 3,6 GiB. MLX-vikterna publiceras i INT8, INT6 och INT4 på Hugging Face, tillsammans med FastVideo Cookbook, som publiceras för första gången. Nästa aviserade mål: RTX-familjen, inklusive 5090 och 4090.
Samma kväll släppte Perplexity källkoden till Lily, den lokala inferensmotor som kör enhetsdelen av företagets hybridberäkning på Mac. Motorn hade presenterats dagen före i ett forskningsinlägg; nyheten är att koden har publicerats under licensen Apache-2.0 i repot perplexityai/pplx-garden, där den ansluter sig till fabric-lib och pplx-unigram.
Koden bekräftar en inriktning på extrem specialisering. Lily är ingen generell motor: den läser endast in en enda checkpoint, Qwen3.6-35B-A3B kvantiserad till 4-bitars affin representation i MLX-format med gruppstorleken 64, vilket verifieras vid inläsning. Täta Qwen-checkpoints, mindre varianter, BF16, GGUF, AWQ, GPTQ, int8 och fp8 avvisas uttryckligen. Den är skriven i Rust med Metal-kärnor som kompileras från källkod vid start, använder varken PyTorch eller MLX i sin exekveringsväg och kräver en Apple-GPU av familj 10 eller senare — en M5 eller nyare — med minst macOS 26. API-ytan är lika snäv: endast tre routes, alltid girig avkodning, och samplingsparametrar, streaming, verktyg och multimodalt innehåll avvisas i stället för att ignoreras. Det intressanta är just denna snävhet: Perplexity levererar inte en konkurrent till MLX-LM, utan visar att en motor som skräddarsytts för en viss plattform och modell slår ett generellt ramverk.
Fyra andra publiceringar under dagen pekar åt samma håll och tas upp i Kortnytt: TranslatePsy-Nano, översättningsmodeller på 17 till 42 MB som täcker sjutton språk; i64 Systems arbete med experter i en MoE-modell lagrade på NVMe utan att ändra en enda byte i utdata; Coheres argument för rätt dimensionering av små modeller i företag; samt NVIDIAs direktsändning om DGX Spark med fokus på lokal körning av Perplexitys Portable Computer. Ingen av dem väger tungt på egen hand, men tillsammans flyttar de beräkningen från datacentret till enheten.
🔗 FastH3 lokalt · 🔗 Lily som öppen källkod · 🔗 Repot pplx-garden
Anthropic släpper källkoden till Claude Commerce Agents
2 september — Anthropic har publicerat Claude Commerce Agents som öppen källkod, ett referensrepo under licensen Apache 2.0 för att bygga handelsagenter. Tillkännagivandet kommer avsiktligt inför julhandeln, då e-handelsteamen planerar sina driftsättningar.
Blueprinten innehåller två kompletta agenter. Inköpsagenten finns i företagets applikation: den söker i katalogen, sammanställer en uppsättning artiklar utifrån en begäran formulerad på naturligt språk, kommer ihåg kundens preferenser, visar produkter, jämförelser och varukorg i konversationen och lämnar sedan över till checkout — samtidigt som den besvarar kundtjänstfrågor i samma tråd. Handlaragenten riktar sig till teamen som driver butiken: försäljningsanalys, varningar om en vara som tar slut före en kampanj, prisrekommendationer baserade på historik och utformning av kampanjer.
| Del av repot | Levererat innehåll |
|---|---|
| Medföljande agenter | Inköpsagent (kund) och handlaragent (back-office) |
| Körbara vertikaler | Detaljhandel, resor, telekom, biljettförsäljning |
| Runtimes | Messages API, Claude Agent SDK, Claude Managed Agents (beta) |
| Driftsättningsplattformar | Claude API, Amazon Bedrock, Microsoft Foundry, Google Cloud Vertex AI |
| Plugin för Claude Code | commerce-builder@claude-commerce-agents |
| Tekniska förutsättningar | Python 3.11 eller senare, Node 22 |
| Redan observerade resultat | Hos detaljhandlare som kör inköpsagenter med Claude: upp till 35 % större varukorgar, köpare 60 % mer benägna att slutföra köpet |
Åtskillnaden mellan vad modellen beslutar och vad som faktiskt utförs är strukturell, inte deklarativ. På konsumentsidan innehåller backend-gränssnittet som agenten anropar helt enkelt ingen betalningsmetod. På handlarsidan skapar varje skrivverktyg en väntande ändring med ett identifierare som genereras på serversidan, och funktionen apply_change slutförs endast för identifierare som godkänts via en faktisk yta för mänsklig validering. Anthropic klargör att detta är en referensimplementation som inte underhålls och som inte tar emot bidrag: en utgångspunkt att forka, inte ett beroende att följa. Alla företag i demonstrationerna är fiktiva, och ingenting lägger beställningar eller debiterar kort.
🔗 Tillkännagivandet om Claude Commerce Agents · 🔗 Repot commerce-agents
Den tekniska delen: cache, latens och skyddsräcken i kod
Teknikguiden som publicerades samma dag och är skriven av Ali Shazal och Matthew Koen sammanfattar ett års arbete med detaljhandlare, marknadsplatser och reseaktörer. Dess första råd går emot intuitionen: för en agent som måste täcka många kategorier bör man inte skapa en underagent per domän. En handelskonversation är en enda tätt kopplad session, och uppdelning försämrar kvaliteten — förmågorna kommer från skills, inte från fler agenter.
| Behandlat ämne | Siffra angiven av Anthropic |
|---|---|
| Renderat handelssvar | 500 till 700 utdatatokens |
| Läsning av cachade tokens | En tiondel av kostnaden för nya tokens |
| Skrivning till cache | Påslag på cirka 1,25x, intjänat redan vid andra användningen |
| Önskad träffgrad för cache | 90 till 99 % |
| Hastighet för cacheläsningar | 1,5 till 2x snabbare runt 100 000 tokens |
| Vinst från minnet | 13 % högre faktamässig recall i den interna utvärderingssviten |
| Utvärderingsfall per flöde | 50 till 100 till att börja med |
När det gäller modellval är rekommendationen att börja med Opus för handlaragenter, där analys dominerar, och Sonnet för konsumentagenter, där latensen väger tyngre — och därefter köra hela utvärderingssviten för varje modell och varje ansträngningsnivå samt mäta kostnaden per slutförd uppgift i stället för per modellanrop. Säkerhetsavsnittet är däremot otvetydigt.
The prompt is where safe behavior starts, but in commerce it can’t be where safety is enforced. The failures are financial and often irreversible, and a prompt rule is one injection or one bad sample away from being skipped.
🇸🇪 Prompten är där säkert beteende börjar, men inom handel kan det inte vara där säkerheten upprätthålls. Felen är ekonomiska och ofta oåterkalleliga, och en promptregel kan kringgås med bara en injektion eller ett dåligt sampel. — Anthropic, En guide till effektiva handelsagenters anatomi
Fyra regler tillämpas därför i kod och definieras en enda gång för att delas mellan de tre runtimes: modellen förbereder, men en person eller policy verkställer; skrivningar och renderingar accepterar endast identifierare som utfärdats av servern; begränsade transaktioner måste tåla upprepade begäranden; innehåll från tredje part saneras.
Datorstyrningen flyttar till bakgrunden i Claude Code och Claude Cowork
2 september — Claudes datorstyrning (computer use) monopoliserar inte längre skärmen. Hittills innebar det att starta en sådan uppgift att lämna över datorn: de andra fönstren doldes medan Claude arbetade i den godkända applikationen. Nu fortsätter uppgiften i bakgrunden, både i Claude Cowork och på fliken Code i desktop-applikationen, medan användaren gör något annat.
Ändringen är i beta, förbehållen Pro- och Max-abonnemangen och begränsad till macOS — medan computer use i sig fortfarande finns som research preview på macOS och Windows. De som redan använde funktionen behöver inte aktivera något; övriga hittar den i Settings > General, med förbehållet att macOS också kräver systembehörigheterna Hjälpmedel och Skärminspelning.
Säkerhetsramverket ändras inte. Till skillnad från Bash-verktyget, som körs i en sandbox, körs computer use på det verkliga skrivbordet. Åtkomstnivåerna är fortfarande fastställda per applikationskategori och kan inte ändras: endast visning för webbläsare och handelsplattformar, endast klick för terminaler och IDE:er — vilket styr Claude mot det särskilda verktyget i stället för skärmkontroll — och fullständig kontroll för resten. Ett godkännande gäller för den aktuella sessionen, eller i trettio minuter i en session som startats från Dispatch.
🔗 Tillkännagivandet om computer use i bakgrunden
Cursor kör sina molnagenter på maskiner som hanteras av kunden
2 september — Cursor har publicerat ett produktinlägg av Jack Pertschuk som öppnar dess molnagenter för infrastruktur som kunden äger. Hittills kördes en Cursor-molnagent på en dedikerad virtuell maskin i leverantörens moln. Med Self-Hosted Machines flyttas verktygskörningen till maskiner i företagets nätverk, medan agentslingan, inferensen och planeringen stannar hos Cursor.
Siffran som motiverar åtgärden anges direkt: molnagenter producerar nu mer än 60 % av de pull requests som Cursor mergar internt. När en växande del av arbetet går genom dessa agenter upphör maskinen som de körs på att vara en detalj. Leverantören identifierar tre situationer som driver ett team mot egna maskiner: att köra verktygen i direkt anslutning till källkodshanteraren och interna tjänster, att ha särskild hårdvara som GPU:er eller Mac-datorer för iOS-utveckling eller att köra ett operativsystem som är svårt att paketera i en avbildning för en molnagent.
| Aspekt av lösningen | Teknisk detalj |
|---|---|
| Registreringskommando | agent worker start, långvarig utgående HTTPS-anslutning |
| Anslutningens riktning | Cursor initierar aldrig någon inkommande anslutning till kundens nätverk |
| Tillgängliga konfigurationer | My Machines (enskild arbetsstation eller VM) och Pools (delad teamkö) |
| Återupptagning efter inaktivitet | Viloläge via snapshot, återställning med samma worker-identifierare |
| Leverantörer av sandboxar | AWS Lambda, Cloudflare, Coder, Daytona, E2B, Modal, Namespace, Vercel |
| Datorstyrning | Linux stöds nu, utöver Mac, via Chrome eller Chromium |
Poolerna skalas upp via en styrenhet som övervakar kön av begäranden och startar maskiner med ett skript som teamet tillhandahåller; om ingen worker är ledig väntar begäran. För mellanläget mellan att återställa en maskin och att låta den vara påslagen, vilket är kostsamt åt båda hållen, introducerar Cursor viloläge: den inaktiva maskinen snapshotas och stängs av, och om en omstart kommer inom återanslutningsfönstret återställs snapshoten. Eftersom en pool inte är knuten till ett repo kan samma kö betjäna flera.
En reservation, som inlägget självt tar upp: endast exekveringsmiljön flyttas. Verktygens utdata skickas tillbaka till Cursor för inferens och kan innehålla kod, och agenttranskriptioner kan behandlas och lagras där. Det är alltså inte fullständig isolering, utan en förflyttning av exekveringsplatsen.
Claude Fable 5.1 blir allmänt tillgänglig hos integratörer
1 och 2 september — Samma dag som Claude Fable 5.1 lanserades blev modellen allmänt tillgänglig i GitHub Copilot. Dagen därpå integrerade Genspark den i Code Agent och Claw. Två integratörer på två dagar, för samma modell: det är en våg av införanden, inte två isolerade nyheter.
Hos GitHub är täckningen bred — Visual Studio Code, Visual Studio, Copilot CLI, coding agent, GitHub Copilot-appen, github.com, GitHub Mobile för iOS och Android, IDE:er från JetBrains, Xcode och Eclipse — för abonnemangen Pro+, Max, Business och Enterprise, med en gradvis utrullning och debitering enligt leverantörens offentliga prislista. Men den mest anmärkningsvärda aspekten av tillgängliggörandet är inte teknisk, utan avtalsmässig.
| Åtkomstvillkor | Vad som gäller för Fable 5.1 |
|---|---|
| Administratörspolicy | Inaktiverad som standard, måste aktiveras uttryckligen |
| Datalagring | Obligatorisk som standard för Anthropics säkerhetsklassificerare |
| Användning av lagrade data | Ingen träning av Anthropics modeller |
| Övriga Claude-modeller | Fortsatt nollagring, förutom för Fable 5 och Fable 5.1 |
| Undantag från nollagring | Berättigade företag, till slutet av kalenderåret |
| Efter undantaget | Enterprise Frontier Safeguards krävs |
Till skillnad från Copilots övriga Claude-modeller kräver Fable 5.1 datalagring som standard: Anthropic lagrar prompts och utdata för att driva sina säkerhetsklassificerare. Att aktivera policyn innebär därför ett uttryckligt godkännande av detta villkor, medan modellen helt enkelt förblir otillgänglig om policyn lämnas inaktiverad. Utvägen är tillfällig och selektiv: berättigade företag kan fortsätta med nollagring till slutet av kalenderåret, medan Anthropic driftsätter Enterprise Frontier Safeguards, som ska tillhandahålla automatiserad säkerhetsövervakning samt kundstyrda lagrings- och krypteringsnycklar. Berättigande kan inte erhållas genom självbetjäning: det måste gå via GitHubs säljteam, som supporten inte kan kringgå, och inte ens ett godkännande aktiverar något automatiskt.
Genspark uppger å sin sida att modellen integrerades redan den första dagen i Genspark Code Agent och Claw, utan benchmark eller prisuppgifter. Företaget ansluter sig därmed till de agentbaserade plattformar som gick över till modellen inom några timmar efter lanseringen, tillsammans med Cursor, Devin, Warp, v0, Amp och Perplexity Computer.
🔗 Fable 5.1 i GitHub Copilot · 🔗 Gensparks tillkännagivande
GitHub beskriver hur Copilot blev billigare utan försämrad kvalitet
2 september — GitHub publicerade en teknisk artikel av Erik Kristensen, tillsammans med Napalys Klicius, om hur kostnaden för Copilot minskades. Texten är ovanlig för genren: den redovisar siffror, beskriver misslyckade experiment och förklarar varför en uppenbar optimering kan få motsatt effekt.
Inledningens tes är kontraintuitiv. Att räkna tokens i en enskild interaktion mäter inte effektiviteten: ett kortfattat verktygssvar som utelämnar information som agenten behöver tvingar den att köra kommandot igen, vilket totalt sett gör uppgiften långsammare och dyrare. GitHub illustrerar fallgropen med RTK (Rust Token Killer), ett verktyg som förkortar shell-utdata innan de läses. Det förkortade visserligen vissa svar, men de efterföljande återställningsstegen tillförde fler turer: tokens sparades lokalt men förbrukades globalt. Det driftsattes inte.
| Utvärderad ändring | Uppmätt förbättring |
|---|---|
| Borttagning av radnummer i offline-tester | Cirka 5 % lägre inferenskostnad |
| Borttagning av radnummer i produktion för CLI | Cirka 3 % lägre genomsnittlig daglig kostnad per användare |
Komprimering av verktygsprompten task | 1 300 tokens borttagna per tur, 2,9 % lägre normaliserad kostnad per aktiv timme |
| Direkt leverans av slutfört bakgrundsarbete | Cirka 2,3 % lägre tokenrelaterad användning, mätt i AI Credits |
| Radnummer och komprimering i Copilot code review | Cirka 5 % färre prompttokens per granskning för vardera ändringen |
| Tidigare migrering till delade filverktyg | Cirka 20 % lägre granskningskostnad |
| RTK (Rust Token Killer) | Förkastat, högre totalkostnad i den testade konfigurationen |
Den valda komprimeringspolicyn är avsiktligt försiktig och består av tre delar: bevara utdata som liknar källkod intakta, ordna om sökresultat utan att ta bort något och endast komprimera repetitivt brus från installation, build och testning. Komprimering av git diff ingick i de första versionerna, men togs bort efter att benchmark-uppgifter visat att agenter öppnade originalutdata på nytt.
Det mest lärorika avsnittet gäller promptkomprimering. En meta-prompting-loop, där Copilot iterativt skrev om sin egen instruktion, halverade prompten för verktyget task — men det första online-experimentet avslöjade en regression som offline-utvärderingarna hade missat: loopen hade omvandlat en försiktig instruktion om parallellism till en strikt ordningsregel och därmed serialiserat oberoende agenter. Korrigeringen ersatte vit- och svartlistor med en enda mening som överlät beslutet åt modellen. Den sista och mest användbara lärdomen är att förbättringar inte kan överföras från en produkt till en annan. En mer koncentrerad uppsättning instruktioner, inspirerad av de goda resultaten för Copilot code review, fick kostnaden för Copilot CLI att öka.
None of these changes made the model smarter. They removed work the model never needed to do.
🇸🇪 Ingen av dessa ändringar gjorde modellen intelligentare. De tog bort arbete som modellen aldrig hade behövt utföra. — GitHub Blog, Så gör vi AI-kodning mer kostnadseffektiv
Copilots modellkatalog stöps om
1 och 2 september — Två changelog-poster från samma tidpunkt beskriver två sidor av samma omstrukturering: vad som försvinner ur Copilots katalog och vem som nu bestämmer standardmodell.
Sex modeller fasas ut den 1 september i de flesta Copilot-upplevelser — Copilot Chat, redigering online, lägena ask och agent samt kodkompletteringar.
| Borttagen modell | Alternativ som GitHub föreslår |
|---|---|
| Gemini 3.1 Pro | Gemini 3.7 Flash |
| Claude Opus 4.5 | Claude Opus 4.7, Claude Opus 4.8 eller Claude Opus 5 |
| Claude Opus 4.6 | Claude Opus 4.7, Claude Opus 4.8 eller Claude Opus 5 |
| Claude Sonnet 4.5 | Claude Sonnet 5 |
| Claude Sonnet 4.6 | Claude Sonnet 5 |
| Raptor Mini | MAI-Code-1.1-Flash |
Ett undantag kvarstår: Claude Sonnet 4.6 är fortfarande tillgänglig för individuella abonnenter med årsabonnemang. Ingen åtgärd krävs från användaren, men administratörer för Copilot Enterprise kan behöva aktivera ersättningsmodellerna uttryckligen i sina policyer. Annars visas de varken i VS Code eller på github.com.
Samtidigt kan företagshanterade inställningar nu använda valfri modell som standard för nya konversationer. Granulariteten sträcker sig längre än till företagsnivå: genom att ange nyckeln model som overridable och redigera teamets konfigurationsfiler i team-mappings.json kan en administratör låta varje team välja sin egen standard, medan användare som inte omfattas ärver den globala inställningen. Funktionen är allmänt tillgänglig för Copilot Business och Copilot Enterprise i GitHub Copilot-appen, Copilot CLI och Visual Studio Code.
🔗 Utfasade modeller · 🔗 Standardmodell för företag
Augusti månads Ship Log: Copilot i Slack och Teams samt media i CLI
1 och 2 september — Den månatliga sammanfattningen som GitHub publicerade i form av en X-artikel är ett marknadsföringsinslag, men den visar en leverans från augusti som inte tidigare hade uppmärksammats: GitHub Copilot är nu tillgängligt från Slack och Microsoft Teams. Integrationen för in de agentbaserade funktionerna från Copilot CLI och GitHub Copilot-appen i teamkonversationer — genom att nämna GitHub går det att planera ändringar, undersöka ett problem eller vidarebefordra en kodningsuppgift utan att lämna tråden.
| Del av augusti månads Ship Log | Vad som levererades |
|---|---|
| Copilot i Slack och Microsoft Teams | Agentbaserade funktioner från Copilot CLI och Copilot-appen |
| Copilot code review, djupet Balanced | Allmän tillgänglighet bredvid Lite, standard kan ställas in per organisation eller repo |
| Nya modeller som lyfts fram | Gemini 3.7 Flash, MAI-Code-1.1-Flash, Kimi K3 med drift hos Fireworks AI |
| Kampanj för GPT-5.6 Sol | Halva priset till och med den 3 september |
| Kampanj för automatiskt val | 30 % rabatt för Copilot Max-användare |
| GitHub Copilot Day | 10 september 2026 |
Sammanfattningen dokumenterar också djupet Balanced i Copilot code review, som blivit allmänt tillgängligt bredvid Lite: Balanced är avsett för mer ingående analys av pull requests, Lite för direkta ändringar, och standarddjupet kan ställas in på organisations- eller reponivå.
Ytterligare en leverans under månaden kompletterar bilden på kommandoradssidan: den upprepningsbara flaggan --attach i GitHub CLI, tillgänglig sedan gh v2.99.0, laddar upp en lokal bild eller video och refererar till den inline i en issue, en pull request eller en kommentar. Den fungerar med de sex kommandon som skriver Markdown, och detaljen som gör den praktiskt användbar är hanteringen av befintlig Markdown: en lokal sökväg som redan refereras i brödtexten skrivs om på plats, så att  behåller sin alternativa text och pekar på den uppladdade tillgången. Den alternativa texten anges efter ett # i sökvägen. Format som stöds: PNG, JPEG, GIF, WebP, SVG, MP4, MOV och WebM, med en gräns på 10 MB för bilder och 100 MB för video i betalabonnemang. GitHub Enterprise Server stöds inte i den här versionen. GitHub betonar uttryckligen att kodningsagenter ärver funktionen och nu kan visa ett resultat i stället för att beskriva det.
🔗 Ship Log för augusti 2026 · 🔗 Media i GitHub CLI
Fairwind Program, Googles cyberförsvar för betrodda försvarare
2 september — Samma dag som Gemini 3.8 Flash Cyber lanserade Google Fairwind Program, den kanal genom vilken modellen distribueras. Resonemanget som Four Flynn, vice vd för säkerhet och integritet, presenterar utgår från ett konkret dilemma för försvarsteam: att använda enorma frontier-modeller som är dyra och svåra att kontrollera i företags kodbaser, eller att välja mindre modeller med öppna vikter som har svårt att korrigera komplexa sårbarheter.
Lösningen kombinerar Gemini 3.8 Flash Cyber med CodeMender, Googles verktyg för automatisk korrigering. Huvudargumentet gäller inte detektering utan åtgärdande: att upptäcka svagheter skapar medvetenhet och rädsla, medan automatisk identifiering och korrigering skapar säkerhet. Löftet är att generera verifierade och driftsättningsbara korrigeringar på några minuter i stället för veckor, inuti kundorganisationens säkra molnmiljö.
Åtkomsten är avsiktligt stegvis och prioriterar tre grupper: regeringar och nationella cybersäkerhetsmyndigheter, operatörer av kritisk infrastruktur inom sjukvård, telekommunikation, energi och finansiella nätverk samt centrala teknikplattformar. Deltagande organisationer godtar strikta villkor — att begränsa åtkomsten till interna team för cybersäkerhet, incidenthantering eller penetrationstestning och att införa skydd som multifaktorautentisering. Google uppger att över 650 partner deltar världen över. Utanför programmet kan alla Google Cloud-kunder använda CodeMender med offentligt tillgängliga modeller på Gemini Enterprise Agent Platform, som komplement till AI Threat Defense. Företaget uppger dessutom att det har passerat sammanlagt 100 miljoner dollar i finansiering av cybersäkerhet genom Google.org, varav 36 miljoner till 35 cyberkliniker som har stöttat över 1 250 amerikanska sjukhus, skoldistrikt och kommunala verksamheter.
Googles kommandoradsverktyg: tre versioner på två dagar
1 och 2 september — Google levererade tre versioner inom samma område på två dagar, och helheten visar en tydlig prioritering: färre funktioner, mer isolering och stabilitet.
| Publicerad version | Datum | Huvudsakligt innehåll |
|---|---|---|
| Gemini CLI v0.58.0 | 1 september | Sju främst säkerhetsinriktade ändringar, lansering i stabil kanal |
| Antigravity CLI 1.1.23 | 1 september | Två förbättringar, elva korrigeringar |
| Antigravity 2.12.0 | 2 september | Sju förbättringar, nio korrigeringar |
Den stabila kanalen för Gemini CLI uppgraderades till v0.58.0, en lansering som gick obemärkt förbi eftersom den skedde trettiotvå minuter efter publiceringen av förhandsversionen v0.59.0. Innehållet är nästan helt defensivt. Den mest omfattande korrigeringen gäller macOS-sandlådan: Seatbelt-profilen isolerar nu sockets och binärfiler för Docker och container-runtimes, vilket stänger en klassisk flyktväg — en isolerad process som når värdens Docker-socket kan i praktiken ta sig ur sandlådan. Två andra ändringar härdar kärnan: utvärderingen av symboliska länkar blir konsekvent i hanteringen av ignorerade sökvägar, och säkerhetskontrollerna på toppnivå deklareras uttryckligen i skrivpolicyns konfiguration.
Antigravity 2.12.0 tillför två nya funktioner. Citering av svar gör det möjligt att markera en del av ett svar och återinföra den som kontext i nästa prompt — ett direkt svar på ett vardagsproblem i långa agentbaserade sessioner. Och kommandot /boost, som är reserverat för betalande användare, ökar resonemangsinsatsen genom en multi-agent-pipeline. Det kommer samma dag som Gemini 3.8 Flash, som Google medger arbetar hårdare till priset av fler tokens: båda förändringarna går i samma riktning, mot uttrycklig användarkontroll över insatsnivån. Resten åtgärdar verkliga irritationsmoment: de allmänna inställningarna visar vilka projekt som åsidosätter en inställning, terminalens delade skärmlayouter överlever omladdningar av fönstret och ett meddelande kan skickas medan dikteringen pågår.
Antigravity CLI 1.1.23 minskar slutligen belastningen från streaming av subagents genom att skicka metadata om förloppet en gång per delförlopp i stället för vid varje steg, och accepterar via Tab det föreslagna modellnamnet som spöktext i /model. De elva korrigeringarna avslöjar besvärliga vardagsfel: krascher orsakade av prompt-hooks, utelämnade verktygsanrops-ID:n när historiken rekonstruerades för Gemini-modeller, behörighetsdialoger som visade generiska rubriker i stället för läsbara åtgärdsbeskrivningar — ett verkligt problem, eftersom användaren ombeds godkänna en åtgärd som inte beskrivs — samt subagents deklarerade med enable_mcp_tools=true som misslyckades på grund av att en MCP-dispatcher saknades.
🔗 Versionsinformation för Gemini CLI v0.58.0 · 🔗 Ändringslogg för Antigravity
Gemini Notebooks Short Video Overviews utökas till fler än 70 språk
1 september — Gemini Notebook har utökat sina Short Video Overviews till fler än 70 språk och lagt till tre nya engelska varianter. Funktionen omvandlar källorna i en notebook till cirka 60 sekunder långa vertikala videor, som nu kan genereras på användarens språk.
Lanseringen omfattar webben och mobilen och är fortfarande begränsad till Ultra- och Pro-prenumeranter — teamet preciserade i samma tråd att utrullningen till Pro-användare ännu inte är fullständig. Två detaljer kompletterar tillkännagivandet: antalet källor i en notebook räknas inte in i tokenförbrukningen, och Pro-användare behåller möjligheten att generera Cinematic Video Overviews på engelska. Övergången från engelska till 70 språk förvandlar funktionen från en demonstration till ett verktyg som faktiskt kan användas utanför den engelskspråkiga världen.
🔗 Tillkännagivande från Gemini Notebook
Kodredigerare blir multiplexrar för modeller
1 och 2 september — Två till synes orelaterade tillkännagivanden beskriver samma rörelse: utvecklingsmiljön blir en åtkomstpunkt för tredjepartsmodeller, och det som särskiljer erbjudandena förskjuts från modellens kvalitet till villkoren under vilka den körs.
Zed publicerade sin stabila version 1.18.0, vars mest betydelsefulla innehåll finns i versionsinformationens AI-avsnitt. Redigeraren kommer på en gång ikapp flera nya lanseringar: kontextfönstret på 1 miljon tokens för GPT-5.6 stöds på Amazon Bedrock, Gemini 3.5 Flash-Lite läggs till bland Google AI-modellerna, Grok 4.5 och Grok 4.6 läggs till bland xAI-modellerna och stödet för Claude Fable 5.1, som lanserades dagen innan, förbättras. Två av dessa fyra tillägg är externa bidrag som erkänns i versionsinformationen. Därtill kommer användbarhetsförbättringar för arbete med agenter — möjligheten att ladda om en bruten anslutning till en extern agent utan omstart, lägre minnesförbrukning under långa sessioner och anslutningsfel som namnger värden som inte kan nås — samt en viktig korrigering för dem som ansluter MCP-servrar: OAuth-autentisering misslyckades med servrar som krävde icke-standardiserade scopes.
Mistral har å sin sida gjort GLM 5.2 tillgänglig i kodningsagenten Vibe Code för Pro- och Team-abonnemang. Det anmärkningsvärda är inte modellen utan hur den tillhandahålls: Mistral driftar den i Europa på sin egen infrastruktur. En europeisk utvecklare som använder GLM 5.2 via Vibe Code skickar alltså en inferens som körs av Mistral, utan att förfrågningarna passerar Z.ai:s servrar. Det är ett konkret uttryck för den regionala inferensstrategi som företaget har förespråkat sedan augusti — och situationen är dubbelt talande, eftersom Mistral har sin egen Devstral-familj men ändå väljer att erbjuda en modell med öppna vikter, utvecklad av ett konkurrerande laboratorium, i sitt verktyg.
🔗 Versionsinformation för Zed 1.18.0 · 🔗 GLM 5.2 i Vibe Code
NVIDIA: två ingenjörsartiklar och en allians som byter huvudman
2 september — Tre publikationer från NVIDIA samma dag, två tekniska och en om styrning.
Den första artikeln, den tredje delen i serien om co-design av modeller, ger fem regler för att finjustera speculative decoding. Tekniken är välkänd: en liten draft-modell föreslår flera tokens som målmodellen verifierar i ett parallellt pass. Den praktiska frågan kvarstår — hur många tokens ska spekuleras och med vilken mekanism? Under verifieringen växer beräkningsarbetet med (1 + D), medan minnesåtkomsten förblir oförändrad: draft-längden D bör därför ökas till den punkt där verifieringen går från memory-bound till compute-bound. För en representativ expert-GEMM gör D = 7 det möjligt att nå detta läge med en åttondel av den batchstorlek som krävs vid D = 0. När attention dominerar avkodningstiden blir den optimala längden D = 128/G − 1, där G är antalet query-heads som delar ett KV-head, och därutöver är det bättre att välja värden där G × (1 + D) är en multipel av 128, tile-storleken för attention-kärnan. Mätningarna bygger på SPEED-Bench, NVIDIAs benchmark för speculative decoding: med Qwen 3.5 122B A10B som mål uppnår den externa draft-modellen 35B A3B en accepterad längd på 6 vid D = 9. Artikeln betonar en ofta förbisedd punkt — högre acceptans innebär inte högre acceleration — och avslutas med en varning: fine-tuning av målmodellen förändrar dess utdatafördelning, vilket innebär att en drafter som tränats för en viss checkpoint kan få lägre acceptans även när målmodellen förbättras.
Den andra artikeln är en CUDA-optimeringsguide i sex steg, uppbyggd kring ett enda exempel: att konvertera tre RGB-bilder till gråskala och sedan beräkna medianen för varje tile på 32 × 32 pixlar. Utgångspunkten är avsiktligt felaktig kod som Compute Sanitizer diagnostiserar omedelbart — en skrivning utanför gränsen i delat minne, orsakad av att ett globalt index används där ett blockindex förväntades.
| Optimeringssteg | Total tid | Stegets vinst |
|---|---|---|
| Ursprunglig kod | 6,8 s | — |
| CUB (DeviceTransform och BlockRadixSort) | 635 ms | cirka 10x |
| Poolade minnescontainrar | cirka 244 ms | cirka 2,6x |
| Pinnat minne | 25 ms | cirka 10x |
| En CUDA-stream per bild | 23 ms | cirka 300x totalt |
Bara genom att ersätta den egenbyggda bubble sort-algoritmen med cub::BlockRadixSort minskar tiden för medianberäkningen från 2,142 s till 773 µs, en faktor på 2717. Inget av dessa steg är lågnivåoptimering: det handlar om att byta API:er.
Slutligen ansluter sig Open Secure AI Alliance, som NVIDIA var med och grundade, till Linux Foundation. Alliansens tes flyttar fokus från den vanliga debatten: en agent är inte bara en språkmodell, utan ett mjukvarusystem bestående av modeller, harnesses som förser den med kontext och guardrails som begränsar vad den får göra. Samtalet om safety har dock till stor del fokuserat enbart på modellen, trots att säkerheten beror på helheten — harnesses, alignment-mekanismer, exekveringsmiljöer, identitet, policy, observability och återställning. En öppen remiss pågår om SAFE (Shared AI Findings Exchange), en mekanism för konfidentiell insamling av incidenter och tillbud kopplade till AI, i samarbete med OpenSSF.
🔗 Speculative decoding · 🔗 Stegvis CUDA-optimering · 🔗 Open Secure AI Alliance
Equinix Inference Exchange, öppna modeller i 280 datacenter
2 september — Equinix har tillkännagivit Equinix Inference Exchange, ett program för distribuerad AI-inferens som utökar samarbetet med NVIDIA och lägger till Together AI. Lösningen bygger på tre lager: Equinix tillhandahåller den fysiska grunden som är ansluten till molnen via Equinix Fabric, NVIDIA bidrar med sina validerade referensarkitekturer för företag och Together AI kör plattformen ovanpå med stöd för fler än 200 open source-modeller, antingen i en delad driftsättning eller i en dedikerad single-tenant-miljö.
Argumentet gäller inferensens placering snarare än modellvalet, med tre avsedda användningsfall: inferens i storstadsnära edge-miljöer för att minska latensen, migrering av arbetslaster från slutna proprietära modeller till öppna alternativ och suverän AI för reglerade företag. Siffrorna över närvaron visar omfattningen av nätverket som tas i anspråk: fler än 280 datacenter i 77 storstadsområden, 230 anslutningspunkter till molntjänster och fler än 10 500 sammankopplade företag.
Det finns dock anledning att vara uppmärksam på tidsplanen: Equinix pressmeddelande anger uttryckligen att lösningen blir tillgänglig från och med första kvartalet 2027, medan Together AI:s meddelande beskriver plattformen som redan aktiv i Equinix globala datacenter. Det är ett tillkännagivande om ett partnerskap och en färdplan, inte en produktionssättning.
🔗 Pressmeddelande från Equinix
BenchMIRT, Ai2:s metod för att granska vad benchmarks faktiskt mäter
1 september — Ai2 har publicerat BenchMIRT, en metod som ställer en fråga som sällan behandlas direkt: mäter ett benchmark verkligen den förmåga som det påstår sig mäta? I stället för att utgå från slutresultatet går metoden ner på frågenivå och uppskattar vilka förmågor som faktiskt avgör om svaret blir rätt, med stöd av Item Response Theory från psykometrin i dess multidimensionella variant. Träningen använde resultat från 100 modeller med öppna vikter, 16 benchmarks och fler än 34 000 frågor.
Det mest robusta resultatet är metodologiskt: utan information om vilket benchmark som skulle mäta vad identifierade BenchMIRT på egen hand två dominerande dimensioner, säkerhet och allmänt resonemang, vilka återkom oförändrade när analysen kördes om från början.
| Granskat benchmark | Korrelation med resonemang | Korrelation med säkerhet | Granskningens slutsats |
|---|---|---|---|
| MMLU-Pro | 0,97 | -0,21 | Överensstämmer med sitt angivna syfte |
| BBQ | 0,85 | -0,06 | Följer resonemang trots sin status som säkerhetstest |
| WMDP | -0,89 | 0,21 | Mäter frånvaron av farlig kunskap |
| ToxiGen | 0,40 | -0,32 | Svagt på båda, benchmark mättat vid 92 % |
BBQ, som utformats för att testa om en modell förlitar sig på sociala stereotyper, korrelerar alltså med 0,85 till allmänt resonemang och inte alls till säkerhet: ett dåligt resultat säger kanske mer om modellens resonemang än om dess beteende. Det andra bidraget är praktiskt: genom att rangordna frågorna efter särskiljningsförmåga visar Ai2 att ungefär samma rangordning av modellerna bibehålls om endast 10 % av frågorna behålls, och att metoden korrekt förutsäger svaret på en fråga som inte observerats i 79 % av fallen, jämfört med 70 % för en naiv metod. Två erkända begränsningar: alla träningsmodeller är från tiden före mars 2025, och de identifierade dimensionerna beror på den uppsättning benchmarks som används.
Runway Dev MCP, kodningsagenten tar kontroll över medieintegrationen
2 september — Runway har lanserat Runway Dev MCP, en driftad MCP-server som ansluter dess utvecklarplattform direkt till det kodningsverktyg som används dagligen — Claude, ChatGPT, Codex eller Cursor. Argumentet kan sammanfattas i en mening: agenten som skrev integrationen kan nu välja rätt modell för den, konfigurera verktygen som den bygger på och felsöka den.
Tjänsten omfattar integrationens tre faser. Före det första API-anropet frågar agenten katalogen vilka modeller ett projekt kan använda, till vilket pris och med vilka indata, och hämtar sedan det exakta förfrågningsschemat för den valda modellen — målet är att anropa den korrekt vid första försöket i stället för att gissa. I produktion skapar och konfigurerar agenten en Model Router som väljer mellan flera modeller utifrån kostnad, latens eller kvalitet, med en kostnadsgräns per generering, och kan ta reda på vilken modell routern valde för ett visst anrop. Samma logik gäller för Characters. Den tredje fasen är felsökning: när en generering misslyckas granskar agenten uppgiften via ett definierat verktyg och läser den exakta orsaken till avslaget — avvisad av moderering, överskriden storleksgräns för en asset eller felaktigt utformad request body — innan felet korrigeras och körningen startas om. En Quickstart-meny skapar API-nyckeln och öppnar sedan Claude Code, Codex eller Cursor med ett färdigskrivet meddelande.
DreamX-Creator 1.0, inbyggd ljud- och videogenerering i 2K från en enda bild
2 september — Alibabas AMAP-team har presenterat DreamX-Creator 1.0, en modell med 7 miljarder parametrar under Apache 2.0-licensen som utgår från en enda bild och en textprompt för att skapa ett videoflöde och ett ljudflöde som är inbyggt synkroniserade i 2K, utan att seriekoppla en videomodell och en ljudmodell.
Tre byggstenar formar systemet: en grindstyrd korsmodal uppmärksamhet (Gated Cross-Modal Attention) i kombination med progressiv gemensam träning, som möjliggör dubbelriktad interaktion mellan de båda flödena; audio-visuell förstärkningsinlärning som drivs av modalitetskänslig multimodal återkoppling; samt en autoregressiv förfining i ett enda steg som höjer videon till 2K samtidigt som rörelsen och ljudets tidsmässiga synkronisering bevaras.
Publiceringen är fortfarande ofullständig i detta skede. GitHub-repositoriet, som initierades dagen innan, innehåller projektpresentationen och dess färdplan, och den tekniska rapporten har publicerats på arXiv. De validerade vikterna, inferenskoden, konfigurationerna och utvärderingsverktygen står fortfarande upptagna som ouppnådda milstolpar. Arbetet bygger på Wan2.2 och OpenMOSS MOVA, som båda uttryckligen tackas.
🔗 Tillkännagivande av DreamX-Creator 1.0
OpenAI API skiljer mellan alltför snabb uppskalning och modellöverbelastning
2 september — OpenAI har ändrat hur dess API signalerar två situationer som klientapplikationer hittills inte har kunnat skilja åt.
| HTTP-status | Felkod | Betydelse | Rekommenderad åtgärd |
|---|---|---|---|
| 429 | slow_down | Förfrågningstakten har ökat för snabbt | Respektera Retry-After, sänk takten och öka den sedan gradvis |
| 503 | server_is_overloaded | Den begärda modellen är tillfälligt överbelastad | Respektera Retry-After och försök sedan igen; förläng väntetiden om felet kvarstår |
Skillnaden får en omedelbar praktisk konsekvens för all kod för återförsök. Dokumentationen preciserar att ett slow_down-fel kan inträffa även när trafiken håller sig inom organisationens gränser för förfrågningar och tokens per minut: det signalerar inte att en kvot är uttömd, utan att accelerationen bedöms vara för kraftig — med andra ord kan en applikation strypas utan att ha överskridit någon visad gräns. Guiden om hastighetsgränser anger en tumregel: när trafiken har nått en miljon indatatokens per minut bör den inte ökas med mer än 50 % var femtonde minut. När headern Retry-After saknas rekommenderar OpenAI exponentiell backoff med en liten slumpmässig fördröjning, för att undvika att alla instanser av samma tjänst försöker igen samtidigt. Organisationer vars användningsbaserade trafik regelbundet stöter på dessa gränser hänvisas till Scale Tier och till Reserved Tier för GPT-5.6 och efterföljande modeller.
Kortfattat
- Claude Code 2.1.258 — en renodlad korrigeringsversion: starten på macOS 12 Monterey, som varit trasig sedan 2.1.255, fungerar igen, och fjärrsessioner och schemalagda sessioner misslyckas inte längre efter att en behörighet har godkänts på nytt. 🔗 CHANGELOG
- Claude Campus Ambassadors — ansökningarna är öppna med tre separata spår i år: grundutbildning, avancerad nivå samt doktorand- och postdoktorandnivå. 🔗 Tillkännagivande
- Nokia analyserar 50 miljoner kodrader med Cursor — två ingenjörer från Core Networks-divisionen gjorde arbetet på två veckor, där teamet uppskattade att ett dussintal experter skulle behöva arbeta i flera månader. En fallstudie från leverantören, utan oberoende mätprotokoll. 🔗 Fallstudie
- TranslatePsy-Nano — Tether AI Research släpper två familjer av kompakta översättningsmodeller, EuroNano för nio europeiska språk och AfriNano för åtta afrikanska språk, i varianter på 42, 31 och 17 MB med en enda checkpoint per språkgrupp. 🔗 Tillkännagivande
- Puffin-World — en enhetlig multimodal modell som representerar världen genom tre inbyggda tillstånd: fysik, geometri och utseende, publicerad tillsammans med datasetet Puffin-16M. 🔗 Presentation
- MoE-experter lagrade på NVMe — i64 Systems låter experternas vikter ligga kvar på NVMe med verifiering genom ett SHA-256-manifest och uppmäter byte-för-byte-identiska utdata mellan den inlästa sökvägen och den residenta sökvägen. 🔗 Tekniskt inlägg
- Sakana AI på CiNet International Conference — teknikchefen Llion Jones och forskaren Kai Arulkumaran kommer att hålla ett föredrag om broarna mellan neurovetenskap och maskininlärning den 5–7 oktober 2026 i Osaka. 🔗 Tillkännagivande
- Gemini CLI, nightly-versionen den 2 september — en enda ändring: förbättrad validering av destinationer och anslutningsdirigering i verktygen för webbhämtning, i linje med de nätverksförstärkningar som inleddes i slutet av augusti. 🔗 Versionsinformation
- MrBeast ingår ett flerårigt partnerskap med Google — avtalet utvidgar relationen med Beast Industries bortom YouTube till Gemini och Google Health, med en första video den 5 september där Gemini används för att överleva i djungeln, öknen och Arktis. 🔗 Tillkännagivande
- Sammanfattning av Googles AI-nyheter i augusti — ett månatligt inlägg som sammanställer sådant som redan behandlats under månaden, utan några egna nyheter. 🔗 Sammanfattning
- Enterprise Live Migrations allmänt tillgängligt — migrering av repositorier från GitHub Enterprise Server till molnet med datahemvist och nästintill noll driftavbrott, styrd med tillägget
gh elm. Ingen koppling till AI, men omnämns för fullständighetens skull. 🔗 Ändringslogg - ElevenLabs utser Ashley Kramer till intäktschef — företagets enda publicering under perioden, eftersom produktens ändringslogg inte har uppdaterats sedan den 24 augusti. 🔗 Tillkännagivande
- NVIDIA sänder en direktsändning om DGX Spark på Perplexitys Portable Computer — tjugosex minuter ägnas åt lokal körning, utan beskrivande text eller transkribering. Det är dagens andra demonstration som gör DGX Spark till en målplattform för lokal portering. 🔗 Sändning
- Kling AI dokumenterar Elements i sin MCP-server — en handledning om hur en karaktärs identitet bevaras mellan tagningar; produktutbildning, inte en lansering. 🔗 Handledningen
- Codex CLI 0.152.1 — en korrigeringsversion som släpptes omkring tjugo timmar efter 0.152.0: Guardians godkännandegranskning följer nu de policyer för Node REPL som överförs via modellens metadata. 🔗 Versionsinformation
- Cohere försvarar satsningen på små företagsmodeller — leverantören lyfter fram Command R7B, Tiny Aya med 3,35 miljarder parametrar och North Mini Code, som har fått 33,4 på Artificial Analysis Coding Index, för att argumentera för rätt dimensionering. Ingen lansering. 🔗 Inlägg
- Perplexity publicerar två utbildningsguider — om personliga assistenter och om att upptäcka hallucinationer. Den andra beskriver efterträning i två steg, där det första utvecklar produktbeteenden och det andra bygger på svårare forskningsuppgifter. 🔗 Guide
Vad det innebär
Priset har blivit huvudargumentet, även bland frontlinjemodeller. Tre lanseringar samma dag, och ingen framhäver ett rekordresultat. Google behåller föregående generations pris för Gemini 3.8 Flash och medger att modellen förbrukar fler tokens — ett sällsynt erkännande som flyttar prisfrågan från det angivna priset till den verkliga kostnaden för en uppgift. Qwen gör uttryckligen anspråk på toppen av Arenas Paretofront snarare än den rena förstaplatsen. Meta anger sin förbättring inte i benchmarkpoäng, utan som 20 % färre verktygsanrop och 25 % färre tokens. Och CursorBench-tabellen ger dagens mest talande mått: vid 69,2 % kostar Gemini 3.8 Flash 2,38 dollar per uppgift, medan ett motsvarande resultat kostade 4,80 med Fable 5.1 och 7,35 med Opus 5. Kolumnen med antal steg påminner dock om att priset betalas på annat håll — 161 steg jämfört med 44.
Utformningen av agentramverket blir en mätbar ekonomisk hävstång. GitHubs artikel är dagens mest användbara dokument för den som bygger ovanpå dessa modeller: fyra optimeringar som inte rör själva modellen och som sparar 2–5 % vardera, med de misslyckade experimenten dokumenterade. Anthropics guide om agentutveckling säger samma sak från andra hållet — sikta på 90–99 % cacheträffar redan i designfasen och mät kostnad per slutförd uppgift snarare än per anrop. Båda landar i en poäng som modellkapplöpningen döljer: med samma modell avgör agentramverket en betydande del av kostnaden, och förbättringarna kan inte överföras från en produkt till en annan. GitHub visar detta genom att en optimering som fungerade för kodgranskning ökade kostnaden i CLI:n.
Inferensen flyttar ner till arbetsstationen, och beräkningsplatsen blir en designparameter. FastH3 gör att videogenerering ryms på en Mac eller stationär dator, Perplexity öppnar koden till en motor som bara kör en enda modell på en enda typ av hårdvara, Tether publicerar översättare på 17 MB, i64 Systems låter MoE-experter finnas på NVMe och Cohere argumenterar för rätt dimensionering. Denna rörelse möter uppifrån satsningen från Equinix, NVIDIA och Together AI, som distribuerar inferens över 280 datacenter av latens- och suveränitetsskäl. Den gemensamma nämnaren är inte miniatyrisering utan specialisering: Lily vinner på att vägra allt som inte är Qwen3.6-35B-A3B på Apple Silicon, och Perplexitys satsning är att denna snäva inriktning är en fördel, inte en begränsning.
Kontrollen och styrningen skärps, och de sker numera genom avtal lika mycket som genom teknik. GitHub kräver datalagring för Fable 5.1 — med ett undantag som löper ut vid kalenderårets slut — samtidigt som varje företagsteam får välja standardmodell, och tar samma dag bort sex modeller ur katalogen. Cursor flyttar agenternas exekvering till kundens nätverk, samtidigt som företaget preciserar att transkriberingarna fortfarande behandlas hos dem. Google reserverar sin cyberförsvarsmodell för 650 utvalda partner, med skriftliga driftsvillkor. Mistral levererar en kinesisk modell från Europa och gör det till ett försäljningsargument. Slutligen påminner BenchMIRT om att de utvärderingsverktyg som en del av dessa beslut bygger på själva förtjänar en granskning: ett benchmark för social bias som korrelerar med 0,85 mot allmänt resonerande och med −0,06 mot säkerhet mäter inte vad etiketten påstår.
Källor
- Gemini 3.8 Flash och 3.8 Flash Cyber
- CursorBench-resultat
- Gemini 3.8 Flash i Cursor
- Vi presenterar Muse Spark 1.3
- Färdplan för Muse Spark
- Qwen3.8-Max-0902
- Resultat från Code Arena WebDev
- FastH3 lokalt på DGX Spark och Apple Silicon
- Lilys källkod
- Öppnandet av Lilys kod
- Claude Commerce Agents
- Repositoriet commerce-agents
- Utvecklingsguiden för handelsagenter
- Computer use i bakgrunden
- Cursor Self-Hosted Machines
- Claude Fable 5.1 i GitHub Copilot
- Genspark integrerar Fable 5.1
- Så gör vi AI-kodning mer kostnadseffektiv
- Utfasade Copilot-modeller
- Standardmodell i centralt hanterade företagsinställningar
- Leveranslogg för augusti 2026
- Media i GitHub CLI
- Fairwind Program
- Gemini CLI v0.58.0
- Antigravity-ändringslogg
- Short Video Overviews på 70 språk
- Zed v1.18.0
- GLM 5.2 i Vibe Code
- Samdesign och speculative decoding
- Den moderna CUDA-verktygslådan i praktiken
- Open Secure AI Alliance
- Equinix Inference Exchange
- BenchMIRT
- Runway Dev MCP
- DreamX-Creator 1.0
- Ändringslogg för OpenAI API
- Claude Code CHANGELOG
- Claude Campus Ambassadors
- Nokia och Cursor
- TranslatePsy-Nano
- Puffin-World
- MoE-experter på NVMe
- Sakana AI på CiNet International Conference
- Gemini CLI, nightly-versionen den 2 september
- MrBeast, Gemini och Google Health
- Googles AI-nyheter i augusti 2026
- Enterprise Live Migrations
- ElevenLabs utser Ashley Kramer
- Direktsändning om DGX Spark och Perplexity Portable Computer
- Elements i Kling MCP
- Codex CLI 0.152.1
- Cohere och små modeller
- Perplexitys utbildningsguider