Sök

Jalapeño levererar sina första uppmätta siffror, WebMCP Challenge samlar sex plattformar, Perplexity kör sin agent lokalt

ai-powered-markdown-translator

Artikeln översatt från fr till sv med gpt-5.4-mini.

Visa projekt på GitHub ↗

Femtioen tillkännagivanden på tjugofyra timmar, fördelade över nio områden: dagen den 25 augusti är veckans mest intensiva. Fyra rörelser träder fram. OpenAI publicerar de första uppmätta resultaten från Jalapeño, sitt egenutvecklade inferenschip, och lanserar i samma veva en tio dagar lång hackathon kring WebMCP med Chrome, Cloudflare, Shopify, Vercel, Render och Netlify. Perplexity flyttar hela sin Computer-agent till användarens maskin. IBM öppnar Granite 4.2, sin första familj av resonemangsmodeller. Och Anthropic förenar Claudes minne mellan chatten och Cowork, och gör det läsbart och redigerbart fil för fil. Resten — WeatherNext Cyclones i drift hos National Hurricane Center, Stability AIs Series B, ett tjugotal verktygsuppdateringar — följer nedan.


WebMCP: en standard, dess produktstöd, dess interna användning och en tävling för att få i gång den

25 augusti — OpenAI lanserar WebMCP Challenge, en tio dagar lång hackathon tillägnad en fortfarande experimentell öppen standard som förändrar hur agenter interagerar med webben. Det problem som adresseras är konkret: i dag måste en agent som ska utföra en uppgift på en webbplats gissa hur den ska navigera i ett gränssnitt som är byggt för ögon och mus. WebMCP vänder på logiken: webbplatsen exponerar själv strukturerade verktyg som agenten anropar direkt.

Tävlingen är inte det mest anmärkningsvärda i tillkännagivandet. Det är den samordning den avslöjar: Chrome (Google), Cloudflare, Shopify, Vercel, Render och Netlify ansluter sig alla till OpenAI kring samma standard. Juryn bär spår av detta, med Sarah Drasner (Distinguished Engineer, Chrome), Andrew Galloni (VP Research & Innovation, Cloudflare), Jude Gao (Next.js Core-teamet, Vercel), Ilya Grigorik (Distinguished Engineer, Shopify), Sean Roberts (VP of Applied AI, Netlify), Justin Rushing (Browser Agent Lead, OpenAI) och Alex Nahas, skaparen av MCP-B.

The WebMCP Challenge is here. We’ve teamed up with @ChromiumDev, @CloudflareDev, @ShopifyDevs, @vercel, @render, and @Netlify for a 10-day hackathon. Up for grabs: $35,000 in cash prizes, Codex Micros, ChatGPT Pro subscriptions, and more prizes from our supporters.

🇸🇪 WebMCP Challenge är igång. Vi har samarbetat med @ChromiumDev, @CloudflareDev, @ShopifyDevs, @vercel, @render och @Netlify för en tio dagar lång hackathon. På spel står 35 000 dollar i prispengar, Codex Micro, abonnemang på ChatGPT Pro och andra priser skänkta av våra partners.@OpenAIDevs på X

Tidsplanen är tajt och bedömningskriterierna är tydliga: nytta, originalitet, genomförande, genomtänkt användning av WebMCP och kvaliteten på människan–agent-upplevelsen. Anmälan och inskick sker via Devpost. OpenAI publicerar också agent-nativa demonstrationsappar för att sätta fart på projekten — agentstyrd 3D-modellering, kollaborativt skrivande där agenten kommenterar under sin egen identitet, en generator för personliga korsord, Wandernote för att förvandla reseanteckningar till en resplan, och datautforskning via DuckDB-Wasm i webbläsaren. Det är tillåtet att utgå från en befintlig app och lägga till WebMCP.

TävlingsdelAnnonserad detalj
Annonserad längd10 dagar
Öppning för inskick25 augusti 2026, 12.00 PT
Sista inlämningsdatum3 september 2026, 13.00 PT
Tillkännagivande av vinnare23 september 2026 (preliminärt datum)
Total prissumma35 000 dollar
Pris per vinnare (topp 10)3 000 dollar, ett år med ChatGPT Pro, ett Codex Micro-tangentbord, goodies
InlämningsplattformDevpost

Produktdelen som gör standarden användbar i vardagen kommer samma dag: den inbyggda webbläsaren i ChatGPT desktop-appen och ChatGPT Sites kan nu konsumera WebMCP. När ChatGPT eller Codex besöker en kompatibel webbplats upptäcker agenten de verktyg som sidan exponerar och använder dem automatiskt i stället för att famla i gränssnittet — uppdatering till den senaste versionen av desktop-appen krävs. Den andra halvan av loopen ligger på produktionssidan: det blir möjligt att be Codex skapa en WebMCP-kompatibel app och sedan distribuera den direkt till Sites. Värt att notera är asymmetrin i stödet med Chrome, där WebMCP fortfarande ligger bakom en experimentell flagga eller en origin trial, medan ChatGPT-webbläsaren hanterar det nativt.

Det återstår den tredje delen, den mest lärorika: OpenAI dokumenterar sin egen interna användning. En ingenjör på företaget berättar hur han slutade skriva en automatisering per uppgift för att bygga Runme, en öppen webbapp för notebooks utformad för att samarbeta med Codex. Där skriver han ett kort mål med explicita instruktioner — läsa en tidigare körning, skriva en detaljerad plan, vänta på godkännande innan start, dokumentera de kommandon som körs och hur de tolkas — och Codex läser och uppdaterar sedan notebooken medan arbetet fortskrider. Två arkitekturbeslut förtjänar uppmärksamhet. Först uthålligheten: notebooks sparas i Google Drive, och Runme genererar parallellt ett kompletterande Markdown-index *.index.md som Drive kan indexera, vilket gör det möjligt för en agent att hitta en tidigare körning som operativ kontext. Därefter exponeringsytan: Runme är en statiskt serverad klientapp, och att lägga till en server bara för att exponera en klassisk MCP-endpoint hade introducerat infrastruktur och flyttat behandlingen av notebook-data. WebMCP gör det möjligt för appen att registrera sina verktyg direkt från webbläsaren.

🔗 WebMCP Challenge · Stöd i ChatGPT desktop och Sites · Codex, Runme och WebMCP hos OpenAI


Jalapeño: OpenAI publicerar de första siffrorna för sitt inferenschip och står för sin compute-strategi

25 augusti — OpenAI publicerar de första uppmätta resultaten för Jalapeño, det första inferenschip som de själva har konstruerat. Det intressanta med tillkännagivandet ligger inte bara i de råa förbättringarna, utan i vilken kompromiss det påstår sig lösa: befintliga inferenssystem måste i regel balansera genomströmning och latens, medan Jalapeño hävdar båda i en och samma arkitektur.

Mätningarna bygger på InferenceX, ett offentligt benchmark från SemiAnalysis som simulerar den fullständiga behandlingen av en begäran. Tre öppna modeller testades — GPT-OSS 120B, DeepSeek R1 670B och Kimi K2.5 1T — mot kommersiella system. Valet att normalisera per watt snarare än per chip är uttryckligt och praktiskt: Jalapeño förbrukar hälften så mycket som systemen den jämförs med. Jalapeño anges till 700 W, och den uppmätta ihållande förbrukningen låg kvar på 550 W eller mindre under de testade belastningarna, jämfört med 1 200 W för GB200 och 1 400 W för GB300.

Utvärderad modell (jämfört system)Toppgenomströmning per kWEnd-to-end-latensMinsta TBT
GPT-OSS 120B (GB200, 1 200 W)≈1,9x (85 448 vs 44 960)≈1,7x (1,03 s vs 1,80 s)≈2,7x (0,69 vs 1,87 ms)
DeepSeek R1 670B (GB300, 1 400 W)≈1,7x (19 641 vs 11 781)≈3,6x (1,65 s vs 5,99 s)≈4,1x (1,43 vs 5,90 ms)
Kimi K2.5 1T (GB300, 1 400 W)≈1,5x (18 195 vs 11 862)≈3,4x (1,56 s vs 5,31 s)≈3,8x (1,44 vs 5,48 ms)

Sett över de tre modellerna hävdar OpenAI 1,5 till 1,9 gånger mer AI-arbete per watt vid toppgenomströmning och 1,7 till 3,6 gånger lägre end-to-end-latens än jämförelsesystemen, och upp till 2,1 till 4,1 gånger bättre prestanda på mycket interaktiva belastningar. Tekniskt kommer förbättringarna från samdesign av chip, minne, nätverk, mjukvara och system på racknivå. Inferens passerar två faser med olika flaskhalsar: prefill, som behandlar prompten och belastar beräkningen, och decode, som producerar tokens en och en och främst är beroende av minnesbandbredd. Jalapeño försöker minimera dataförflyttningar, och modellens tillstånd — inklusive KV-cache — kan placeras explicit och hållas lokalt medan systemet aktiverar rätt kombination av beräkning, minne och nätverk beroende på fas.

Den mest intressanta delen för en utvecklare gäller AI:s roll i själva chipdesignen. OpenAI anger att de gick från initial design till tapeout på nio månader genom att förkorta looparna för design, mätning och verifiering. Chipet har utformats som ett förutsägbart programmeringsmål både för AI och för människor: arbete beskrivet via lokala tensorer, explicit kommunikation, förutsägbar synkronisering. Med Codex och GPT-Astra fick teamet på två månader upp tre modeller med öppna vikter som saknades i den ursprungliga produktionsplanen, och på utvalda attention- och mixture-of-experts-block i GPT-OSS kör AI-genererade kärnor 1,5 till 1,8 gånger snabbare än implementeringar skrivna av mänskliga experter. Nyansen är värd att behålla: dessa siffror gäller de utvalda blocken, inte hela modellen. Tidslinjen förblir försiktig — produktionskvalificering pågår, mjukvaran ska mogna, utrullning i OpenAI-infrastrukturen annonseras till årets slut, Gen 2 är långt framskriden och Gen 3 börjar ta form.

Samma dag publicerar Sarah Friar inlägget som ger den ekonomiska logiken bakom allt detta. Där försvarar hon en bred compute-portfölj — Microsoft och NVIDIA i botten, kompletterat av AWS, AMD, Broadcom, Cerebras, CoreWeave, Oracle, SB Energy och SoftBank — med ett argument som är lika kommersiellt som tekniskt: att bevara ett trovärdigt val mellan leverantörer gör det möjligt att styra varje arbetslast till bästa förhållande mellan prestanda och pris och att upprätthålla prisdisciplin. En konkret siffra följer med resonemanget: på Artificial Analysis Coding Agent Index når GPT-5.6 Sol i maximal resonemangsläge ett nytt rekord samtidigt som det använder 54 % färre output-tokens än en annan ledande modell. Texten omfamnar slutligen Jevons paradox — att göra intelligens billigare minskar inte konsumtionen, det utvidgar området för lönsamma användningar. På infrastruktursidan presenteras Project Camellia i Georgia med ett slutet vattenkretslopp och åtaganden som ska granskas årligen av en oberoende offentlig revision. OpenAI förtydligar att de kommer att fortsätta att i stor skala rulla ut accelerators från NVIDIA och sina andra partners, både för träning och för inferens.

🔗 Jalapeño — första resultaten · Hela stacken bakom riklig intelligens


Perplexity Portable Computer: allt körs på maskinen, med benchmarks som stöd

25 augusti — Perplexity lanserar Portable Computer, en variant av sin Computer-agent som körs helt och hållet på användarens maskin. Skiftet är mer arkitektoniskt än kosmetiskt: det är inte bara modellen som kör lokalt, utan hela orkestreringskedjan — orkestrerare, planerare, verktygsrouter, schemaläggare, beständig uppgiftskö och lokal sökindex.

Idag lanserar vi Portable Computer på @NVIDIA DGX Spark.

Portable Computer is a fully local version of Perplexity Computer, where the entire runtime: orchestrator LLM, subagent LLM, agent harness all run on your local hardware. No cloud dependency.

🇸🇪 Vi lanserar idag Portable Computer på @NVIDIA DGX Spark. Portable Computer är en helt lokal version av Perplexity Computer, där hela exekveringsmiljön — den orkestrerande LLM:en, subagenternas LLM:er, agentharnessen — körs på din lokala hårdvara. Inga molndependens.@perplexity_ai på X

Tillkännagivandet görs tillsammans med NVIDIA och riktar sig först till DGX Spark — en Grace Blackwell GB10-plattform, Arm-CPU med 20 kärnor, NVIDIA GPU, 128 GB enhetligt minne — med utlovad utvidgning till PC med RTX-GPU:er. Två modeller erbjuds som val, Qwen 3.8 27B eller PPLX 27B, den eftertränade versionen av Qwen-modellen från Perplexity, och NVIDIA Nemotron 3.5 Lightning, en öppen 30B-modell, ska läggas till i väljaren. Arbete som hanteras lokalt förbrukar inga krediter. Upptrappning till molnet förblir möjlig — aktuella uppgifter, webbläsare, anslutna appar eller en av de 15 frontier-modellerna och fler — men kräver uttryckligt godkännande från användaren. Konnektorerna Google Drive, Gmail, Slack och GitHub fungerar från enheten, diktering körs lokalt via NVIDIA Nemotron 3.5 ASR Model utan att ljudet lämnar maskinen, och kodkörning sker i en isolerad (sandbox) sandlåda. Portable Computer är reserverad för Pro- och Max-prenumeranter med en DGX Spark, först på Linux och därefter Windows, med installation med ett klick från appen.

Samma dag publicerar ingenjörsteamet siffrorna som dokumenterar lanseringen. Tesen är att modell och harness (harness) måste utformas tillsammans: generiska harness antar en frontier-modell som kan absorbera långa kontexter och planera över en utsträckt horisont, vilket lokala modeller hanterar sämre.

Mätt benchmarkComputer (Qwen 3.8 27B)PiHermesComputer + PPLX 27B
Local Knowledge Work Bench (53 uppgifter)82,6 %77,6 %74,0 %85,4 %
BrowseComp (1 266 uppgifter)66,7 %50,2 %43,9 %
ParseBench-100 (multimodala dokument)65,1 %13,9 %34,6 %

På BrowseComp använder Computer dessutom 61 % mindre tid och 16 % färre tokens än Hermes, och 51 % mindre tid och 70 % färre tokens än Pi. Fyra designval förklarar gapet: en minimal systemprompt, modulariserade förmågor i skills som laddas och avladdas längs trajektoriet, mycket använda konnektorer (Gmail, GitHub, Outlook, Google Calendar) omvandlade till kompakta kommandoradsverktyg i stället för att exponeras som MCP-servrar vars definitioner äter upp kontext, och en alltid aktiv och icke-konfigurerbar sandlåda — om den inte är tillgänglig, stängs harnessen av innan något verktygsanrop i stället för att falla tillbaka till icke-isolerad exekvering. Perplexity noterar också en praktisk iakttagelse: Qwen 3.8 27B anger ett fönster på 260K tokens, men börjar empiriskt få problem bortom 100K.

Terminal Bench 2.1 (89 uppgifter)PoängAPI-kostnad per körning
Qwen 3.8 27B, 100 % lokal59,6 %cirka 0
Qwen 3.8 27B + Claude Opus 5-rådgivare73,0 %0,415 USD
Claude Opus 5 ensam82,4 %0,65 USD

Mekanismen för upptrappning till en rådgivarmodell (advisor) är den mest intressanta punkten i rapporten: den återtar ungefär tre femtedelar av gapet till frontier för ungefär två tredjedelar av kostnaden, och avvägningen ligger fortfarande i användarens händer. Före varje anrop väljer harnessen den relevanta kontexten, tillämpar en klassificerare för personuppgifter och visar användaren vad som skulle lämna enheten; rådgivarmodellen returnerar bara text och har ingen direkt åtkomst till filer eller verktyg. PPLX 27B:s efterträning kombinerar slutligen en affinering genom avvisning (rejection fine-tuning) och därefter förstärkningsinlärning på syntetiska miljöer som körs i Docker-containrar, utan några verkliga användardata. En teknisk rapport och öppnandet av utvärderingsbenchmarken som öppen källkod tillkännages.

🔗 Lokala harness-benchmarks · Portable Computer — Perplexity-inlägg


Claude: ett enda minne mellan chatten och Cowork, läsbart fil för fil

25 augusti — Anthropic suddar ut gränsen mellan två minnen som hittills existerat parallellt. Det som Claude minns från dina konversationer i chatten är nu exakt det som det har tillgång till i Claude Cowork, och det omvända är också sant. Konkret innebär det att när Cowork utför en uppgift i molnet, startar den med kontext som ackumulerats under månaderna: kvartalets prioriteringar, projektens status, en medarbetares skrivpreferenser. Anthropic ger medvetet jordnära exempel — att be om en statusuppdatering för sin chef utan att behöva precisera vem det är eller hur personen vill ta emot informationen.

Den andra förändringen är mer diskret men ändrar beteendet i vardagen: minnet uppdateras under samtalets gång i stället för genom en sammanfattning i efterhand. Att nämna att en deadline skjuts upp till september räcker för att nästa konversation ska ta hänsyn till det. Formuleringen ”kom ihåg detta” finns kvar för att tvinga fram lagring av ett specifikt element, och minnet kan pausas eller återställas när som helst.

När det gäller transparens har Anthropic valt en läsbar representation snarare än en svart låda: allt som Claude minns visas som korta filer, sorterade per ämne, under Inställningar och sedan Minne. Var och en kan läsas, rättas eller raderas. Den praktiska nyttan är omedelbar — att korrigera företagets gamla namn i en enda fil räcker för att alla följande konversationer ska använda det korrekta.

Hanteringen av känsliga ämnen är den mest intressanta punkten ur produktvalssynpunkt. Som standard memorerar Claude inte sådant som rör hälsa, ursprung, etnicitet, religiös övertygelse, politiska åsikter eller könsidentitet. Anthropic erkänner dock att gränsen är personlig och erbjuder en valfri inställning för att inkludera dessa ämnen — till exempel så att Claude kan komma ihåg en glutenintolerans när den föreslår recept. Denna inställning är inte retroaktiv och kan stängas av när som helst. En kategori är fortsatt utesluten oavsett inställning: identifikationsnummer, brottslig historik, migrationsstatus och mer allmänt allt som strider mot Acceptable Use Policy. Claude signalerar uttryckligen när det inte kan spara en sådan information, ett designval som prioriterar synligt avslag framför tyst filtrering.

Minnets aspektBeskrivet beteende
OmfattningEtt enda delat minne mellan chatten och Claude Cowork
Tidpunkt för uppdateringUnder konversationen, i stället för en sammanfattning efteråt
LagringsformatKorta filer sorterade per ämne, läsbara och redigerbara en och en
Känsliga ämnenInte memorerade som standard, kan aktiveras med inställning, utan retroaktiv effekt
Permanenta undantagIdentifikationsnummer, brottslig historik, migrationsstatus
Free-, Pro- och Max-planerMinne aktivt som standard på webben, datorn och mobilen
Team- och Enterprise-planerÖppnas av administratören, avaktiverat per användare tills aktivering

🔗 Claude-minnet fungerar överallt · @claudeai tillkännagivande


IBM öppnar Granite 4.2, sin första resonemangsfamilj, och två ASR-modeller på 470M

25 augusti — IBM publicerar Granite 4.2, presenterad som dess första familj av täta, decoder-only språkmodeller, uttryckligen utformade för resonemang. Där tidigare generationer siktade på effektivitet och klassiska företagsuppgifter, placerar denna version resonemanget i centrum och gör det modulärt: varje modell exponerar tre lägen — thinking, non-thinking och low-effort — som applikationen väljer beroende på vilken budget för latens och tokens den accepterar att betala. De tre storlekarna (3B, 8B, 30B) delar samma arkitektur och samma pipeline, vilket gör övergången från den ena till den andra smärtfri ur integrationssynpunkt.

Arkitekturen förblir klassisk: GQA-attention med 40 huvuden för 8 KV-huvuden, RoPE med ett θ på 10 miljoner för att klara kontextfönstret på 131 072 tokens, MLP SwiGLU, RMSNorm-normalisering, träning i bfloat16 på ett NVIDIA GB200 NVL72-kluster hos CoreWeave. Förträningen börjar från noll på cirka 15 000 miljarder tokens fördelade över fem faser. Det som verkligen skiljer Granite 4.2 åt är efterträningen: en förstärkningspipeline med kedja av specialiserade steg snarare än en enda passering, i asynkron GRPO med trunkerad importance sampling, så att genererings- och träningshalvorna i loopen aldrig blockerar varandra. Läroplanen kedjar samman tre RLVR-pass med verifierbara belöningar, riktade förstärkare för instruktionsföljande och kod, två steg för mjukvaruutveckling i 128K-kontext, ett terminalsteg, ett forskningssteg, och därefter RLHF-anpassning. Det agentiska förstärkningsblocket tillämpas endast på 8B- och 30B-modellerna, vilket förklarar prestandaskillnaden i agentisk kodning mellan 3B och dess större syskon.

Benchmark publicerad av IBM3B Dense8B Dense30B Dense
SWE-Bench Verified47,6757,00
SWE-Bench Multilingual30,7841,89
Terminal-Bench 2.120,5629,24
τ³-bench45,7858,0662,00
AIME2578,3386,6789,17
GPQA54,8064,1466,41
LiveCodeBench v669,7173,2475,77
MMLU-Pro67,8474,0477,60
RULER 128K55,3071,4181,38

Publiceringen begränsar sig inte till bfloat16-vikter: fyra kvantiserade varianter följer med släppet för vLLM — dynamisk kanalvis FP8 utan kalibrering, NVFP4 och MXFP4 via GPTQ kalibrerad på 2 000 SFT-exempel — samt fjorton GGUF-format för llama.cpp, från Q2_K till Q8_0. Tolv språk stöds, däribland franska, och tre agentiska kodningsharness dokumenteras redan första dagen: OpenCode, Pi och OpenHands. När det gäller datakvalitet beskriver IBM en kedja där GPT-OSS-120B och Gemma 4 fungerar som domare för att betygsätta SFT-exemplen, innan lokal och global deduplicering via SHA-256-hashning.

Samma dag publicerar IBM Granite Speech 5.0 Turbo CTC, två modeller för engelsk taligenkänning på 470 miljoner parametrar som endast skiljer sig åt genom träningsdata och licens — Apache 2.0 för standardvarianten, CC-BY-NC-SA-4.0 för varianten som tränats på ytterligare data. Arkitekturförändringen är betydande: tidigare Granite Speech kombinerade en akustisk encoder, en projektor och en LLM, medan dessa är encoder-only. Stacken staplar 16 Conformer-block, tillämpar auto-conditionering vid utgången av det åttonde blocket, ersätter skalärproduktattention med chunkwise-attention för att undvika kvadratisk skalning, och optimerar direkt CTC-förlusten. Den verkliga nyheten är tokenhastigheten: nedprovningsoperationer för in flödet från 100 bildrutor per sekund vid utgången av log-Mel-spektrogrammet till 12,5 per sekund, vilket förklarar ”Turbo” i namnet. Resultaten redovisas på OpenASR Leaderboard och FFASR Leaderboard för fjärrfält, med Pareto-grafer för hastighet/noggrannhet snarare än isolerade poäng, och en demonstration av kontinuerlig igenkänning körs i webbläsaren via WebGPU, begränsad till Chrome och Edge.

🔗 Granite 4.2 — teknisk genomgång · Granite Speech 5.0 Turbo CTC


WeatherNext Cyclones, den främsta AI-modellen som används i realtid av National Hurricane Center

25 augusti — Google AI beskriver WeatherNext Cyclones, en prognosmodell för tropiska cykloner från Google DeepMind och Google Research. Tillkännagivandet är anmärkningsvärt mindre för rå prestanda än för vad det säger om hur väder-AI går från labb till operativ drift.

Problemet som angrips är strukturellt. Hittills har övervakning av en cyklon krävt en kompromiss: de fysiska modeller som körs på superdatorer fångar väl de stora atmosfäriska strukturer som sveper över planeten, men för att förstå den lokala och intensiva fysik som avgör en stormstyrka har man tvingats växla över till helt andra regionala modeller. WeatherNext Cyclones tar bort detta fram och tillbaka genom att i ett enda svep förutsäga bana, intensitet och storlek.

Den utlovade vinsten är ett helt dygns extra framförhållning jämfört med tidigare system. Google formulerar jämförelsen träffande: tredygnsprognoserna når nu samma precision som de tidigare tvådygnsprognoserna, ett framsteg som historiskt krävde ett decennium av metodutveckling. Den andra vinsten är probabilistisk: modellen är tillräckligt snabb för att producera upp till 1 000 simuleringar per storm, vilket ersätter den enda ”mest sannolika” banan med ett spektrum av scenarier. Det gör snabb intensifiering mer läsbar, definierad som en ökning av de maximala ihållande vindarna med minst 30 knop på 24 timmar. I år levereras 1 000 sannolikhetsprognoser per storm till prognosmakare via WeatherLab.

Det mest betydelsefulla är fortfarande den faktiska driftsättningen. Under orkansäsongen 2025 testades WeatherNext Cyclones inom det amerikanska National Hurricane Center — första gången denna institution använder AI-modeller i operativ realtid. Meteorologerna använde den för att ta fram prognosen för kategori 5-landfall för orkanen Melissa på Jamaica, vilket gav lokala myndigheter extra tid för förberedelser. En artikel publicerades i Nature, och Google meddelar att modellens kod och vikter släpps som open source på GitHub.

Modellens aspektBidrag från WeatherNext Cyclones
Förutsagda storheterBana, intensitet och storlek i ett enda svep
FramförhållningEn dag; prognos på 3 dagar = samma precision som den gamla på 2 dagar
Simuleringar per stormUpp till 1 000
Operativ driftsättningU.S. National Hurricane Center, orkansäsongen 2025
Dokumenterat användningsfallKategori 5-landfall för orkanen Melissa på Jamaica
IntensifieringströskelMer än 30 knop i ihållande maxvindar på 24 timmar
TillgänglighetsformerWeatherLab; kod och vikter som open source på GitHub

🔗 Tillkännagivande @GoogleAI · Google DeepMind-inlägg


Stability AI avslutar en Serie B på 76 miljoner dollar med EA, Sony Music, Universal och Warner

25 augusti — Stability AI meddelar att Serie B-rundan är avslutad: 76 miljoner dollar i nytt kapital, vilket lyfter den totala finansieringen till 232 miljoner sedan Prem Akkaraju tog över företaget i juni 2024, inklusive två aktierundor och konvertibla obligationer. Beloppet är måttligt sett till branschen, men rundans sammansättning är den verkliga poängen.

Fyra tungviktare inom underhållning går in som ägare: Electronic Arts för spel, Sony Music Group, Universal Music Group och Warner Music Group för musik. De tre skivjättarna är nu aktieägare i samma laboratorium. Därtill kommer AMD Ventures och Pacific Alliance Ventures. Dessa investerare kommer inte från tomma intet: EA, Universal och Warner hade redan varit strategiska partners till Stability AI sedan hösten 2025. Rundan omvandlar alltså befintliga kommersiella avtal till ägarandelar.

Den andra signalen handlar om de finansiella investerarnas lojalitet. Coatue, Greycroft, Kadmos Capital, Sean Parker och Eric Schmidt satsar igen för andra rundan i rad under den nya ledningen — vilket, efter den turbulenta period som Stability AI gick igenom 2023 och 2024, fungerar som en bekräftelse. Thomas Laffont, medgrundare av Coatue, går in i styrelsen där James Cameron, Sean Parker, Dana Settle och Prem Akkaraju redan sitter.

This unmatched group of investors is an affirmation of our vision where generative AI empowers every producer, musician, and storyteller. Stability is unique in the AI field because we are creative people making tools for creatives.

🇸🇪 Denna unika grupp av investerare bekräftar vår vision, en generativ AI som ger varje producent, musiker och berättare större möjligheter. Stability är unikt inom AI eftersom vi är kreatörer som bygger verktyg för kreatörer. — Prem Akkaraju, VD för Stability AI, pressmeddelande den 25 augusti

Den uttalade strategin är den för ett nischat laboratorium: ingen allmän modell, utan verktyg för kreativa proffs, byggda tillsammans med rättighetsinnehavarna snarare än mot dem. Det är exakt linjen för Stable Audio 3.0, en familj av modeller med öppna vikter tränad på helt licensierade data, utökad den 18 augusti med ett plugin för ljudarbetsstationer. Pengarna ska finansiera produktutveckling, tillämpad forskning och den professionella tjänsteverksamheten.

🔗 Tillkännagivande @StabilityAI


ChatGPT för företag: Admin-plugin, tillägg för flera webbläsare och Premium-plats för 100 dollar

25 augusti — Tre OpenAI-tillkännagivanden riktar sig mot samma publik: organisationer som driftsätter ChatGPT och Codex i stor skala.

Det mest substantiella är Admin-pluginet för ChatGPT Work och Codex, som samlar i en konversation det som tidigare krävde navigering mellan analysinstrumentpaneler, inställningsskärmar och rapporter. Omfattningen täcker de dagliga uppgifterna: förstå adoption och kreditförbrukning, identifiera medlemmar eller grupper som närmar sig sina gränser, hantera in- och utträden, granska faktiska behörigheter och felsöka åtkomstproblem, justera användningsgränser och bedöma utgiftsförfrågningar genom att jämföra dem med faktisk förbrukning. Den mest intressanta delen är automatiseringen utan att skriva kod: väntande användningsförfrågningar kan skickas vidare till Slack eller Microsoft Teams för godkännande i det verktyg som godkännaren redan använder, och förfrågningar om åtkomst till en funktion kan beviljas automatiskt när de uppfyller fördefinierade kriterier, medan undantag skickas vidare till en människa. Viktigt ur säkerhetssynpunkt: pluginet verkar inom användarens befintliga roll och behörigheter och utökar inte åtkomsten, eftersom varje instruktion mappas till en stödd läs- eller skrivåtgärd med ett strukturerat resultat. OpenAI hänvisar till sin egen användning — en ChatGPT Work-agent i Slack hanterar interna IT-förfrågningar, och de utrullade arbetsflödena löser ungefär 45 % av ärendevolymen, med borttagen backlog trots att supportvolymen nästan hade fördubblats.

Det andra tillkännagivandet är att ChatGPT:s webbläsartillägg lämnar Chrome-fokuset och stöder Microsoft Edge, Brave, Opera och Vivaldi. Förändringen spelar roll för den som arbetar i en alternativ webbläsare av integritetsskäl eller på grund av företagskrav. Två användningsfall lyfts fram: att föra in kontexten från öppna flikar i en uppgift via referensen @ tab i ChatGPT Desktop, så att Codex arbetar utifrån dokumentationen eller ärendet som redan visas; och att låta agenten styra webbläsaren för att utföra konkreta webbaserade uppgifter, där uppsägning av prenumerationer nämns bland exemplen.

Det tredje tillkännagivandet, mer lakoniskt, är att en Premium-plats för 100 dollar nu ingår i ChatGPT Business-erbjudandet, positionerad för småföretag och startups med en plan som presenteras som flexibel och skalbar beroende på teamets storlek. Tillkännagivandet gjordes på X utan något utförligt blogginlägg, och den exakta sammansättningen av platsen preciseras inte i meddelandet.

🔗 Admin-plugin · Tillägg för flera webbläsare · Premium-plats för ChatGPT Business


NVIDIA: Gamescom för RTX Spark, och SANA som delar MiniMax H3:s latens med 27

25 augusti — NVIDIA använder Gamescom, som hålls denna vecka i Köln, för att utöka katalogen för RTX Spark, sin planerade Windows-PC-plattform som väntas i höst. Electronic Arts, Embark Studios och Ubisoft ansluter till KRAFTON, NetEase, Riot Games och XBOX, som redan ställde sig bakom projektet vid COMPUTEX i maj. De namngivna titlarna täcker olika tekniska krav: EA SPORTS F1 25 och Apex Legends från EA, Anno 117: Pax Romana hos Ubisoft, ARC Raiders och THE FINALS hos Embark Studios.

Den mest konkreta punkten gäller anti-cheat. Att få ett spel att köra räcker inte: stora onlinetitlar är beroende av anti-cheat-system som måste porteras till varje plattform, annars blir spelet ospelbart i multiplayer. NVIDIA meddelar att man arbetar med EA för att få EA Javelin Anticheat inbyggt nativt på RTX Spark — just den typ av infrastrukturdeta l som avgör om en ny PC-plattform faktiskt får genomslag. På renderingssidan är DLSS 4.5 Ray Reconstruction tillgängligt direkt, med en andra generationens transformer-modell som ersätter klassiska brusreducerare med ett nätverk tränat på superdator. Path tracing kommer till CONTROL Resonant och 007 First Light, Gears of War: E-Day får RTX Mega Geometry, och NVIDIA ACE-teknikerna meddelas i Aniimo för början av 2027.

Den andra sidan av samma aktör, 24 augusti, är mer teknisk. MiniMax redovisar resultaten som NVIDIA:s SANA-team uppnått på Sol Engine tillämpat på dess videomodell H3: tio sekunder video i 768p genererad på en enda GB200 går från 414 sekunder till 14,93 sekunder, alltså en acceleration med faktorn 27,7. Metoden bygger inte på kärnoptimering utan på att generationen delas upp i två steg — ett utkast i låg upplösning producerat av H3 i 4 steg, följt av ett förfiningssteg i målupplösning som överlämnas till LTX i 3 steg med Sol-Attn. Totalt sju steg. Den andra hävstången är att dyra VAE-avkodningar ersätts av TAEH3 och TAEHV, lättviktsavkodare, samtidigt som latenterna hålls stabila för förfiningssteget.

Mätning för MiniMax H3Uppmätt värde
Uppmätt belastning10 s video i 768p, en enda GB200
Latens före414 s
Latens efter14,93 s
Accelerationsfaktor27,7x
Generationssteg4 (lågupplöst H3-utkast) + 3 (LTX)
Ersatta avkodareTAEH3 och TAEHV som ersättning för VAE-avkodningar
Projekterad genomströmning per nod378 000 videor per månad, mer än 97 % GPU-marginal

Den projekterade genomströmningen är en uppskattning från MiniMax, inte en produktionsmätning, och bör läsas som sådan. Men riktningen är tydlig: vid femton sekunder för tio sekunder video lämnar högkvalitativ videogenerering den asynkrona batch-renderingen för en nästan interaktiv infrastruktur.

🔗 NVIDIA på Gamescom · SANA och Sol Engine på H3


De öppna kinesiska modellerna blir forskningsreferensen, och Qwen3.8-27B tar sig in i topp 10 på Code Arena

25 augusti — Qwen delar två resultat samma morgon, och det andra ger mening åt det första.

Det första är en ranking. Qwen3.8-27B går in i rankingen Code Arena: WebDev, som utvärderar modeller på generering av webbgränssnitt, på nionde plats totalt med 1595 poäng. Det är den enda modellen i sin storlekskategori i topp 10, och ligger bara sex placeringar bakom Qwen3.8-Max, som är betydligt större. Arena framhåller att den ritar om Pareto-gränsen för rankingen och ger en talande referenspunkt: Gemma 4-31B, som är jämförbar i storlek men släppt i april, ligger på 80:e plats.

Utvärderad modellRankning i Code Arena: WebDevPoängKommentar i rankingen
GLM-5.3 (Max)8:e totalt1597Notering från 20 augusti, 2:a bland öppna modeller
Qwen3.8-27B9:e totalt1595Enda modellen i sin storlek i topp 10
Qwen3.8-MaxSex placeringar före 27Bn.a.Betydligt större modell i samma familj
Gemma 4-31B80:e totaltn.a.Släppt i april 2026

Det andra resultatet är en användningsmätning. Nathan Lambert, som var med och ledde Olmo-projektet på Ai2, lät Codex gå igenom 500 000 arXiv-artiklar inom AI och maskininlärning publicerade sedan ChatGPT släpptes, för att identifiera vilka öppna modeller som faktiskt används i forskning. Vändningen handlar om två siffror: 2024 nämndes ungefär 30 % av artiklarna av en amerikansk öppen modell mot 10 % en kinesisk; i dag citerar ungefär 40 % en kinesisk öppen LLM och bara 25 till 30 % en amerikansk.

ModellfamiljAndel artiklar som citerar en LLM
OpenAI (slutna modeller)ungefär 37 %
Qwenungefär 33 %
Gemini, Claude10 till 15 %
Gemma, Mistral5 till 10 %
Olmoungefär 1 %

I detalj nämns Qwen i en tredjedel av artiklarna som citerar någon LLM överhuvudtaget. Llama nådde sin topp kring april 2025 på 30 %, samtidigt som Llama 4 släpptes, och har sedan dess sjunkit. Lambert sätter själv en viktig begränsning: publikationer ligger efter modellsläppen, eftersom forskning tar tid — dessa siffror beskriver läget i pågående arbete snarare än samtidens preferenser. En underliggande trend går att läsa parallellt, skild från öppet mot slutet-duellen: andelen AI-artiklar som nämner en LLM har ökat från 10,43 % i januari 2023 till över 50 % år 2026.

🔗 Qwen3.8-27B på Code Arena · Qwens återgivning av arXiv-analysen · Analys @natolambert


Claude Code går över till 2.1.245, och Claude-renderingen på webben blir 4 gånger smidigare

Två versioner av Claude Code släpptes i fönstret, och deras innehåll riktar sig tydligt mot driftsättning i organisationer. CHANGELOG saknar datum, men Git-historiken placerar dem: 2.1.243 syns i kommiten från 24 augusti kl. 23:40 UTC, 2.1.245 i den från 25 augusti kl. 05:13 UTC.

Tillagd inställningBerörd versionPraktisk nytta
modelPricing2.1.243Kontraktspriser i /cost, statusraden och telemetrin
modelPicker2.1.243Sorterad och etiketterad modellista för /model
promptCacheTtl / subagentPromptCacheTtl2.1.243En timmes prompt-cache för konversationen, 5 min för subagenter
Ventilering av loops i /usage2.1.243Hitta /loop-uppgifter som spårar ur
Nyckellös anslutning via Console2.1.243Organisationer som förbjuder API-nycklar
glibc 2.44-fix2.1.245Uppstarts-krasch på Arch Linux, CachyOS och Fedora Rawhide

Den mest genomgripande inställningen är modelPricing : hittills resonerade de visade kostnaderna utifrån publik prislista, men en organisation kan nu mata in sina avtalspriser per modell och sin rabattfaktor, vilket gör siffrorna direkt användbara för intern vidarefakturering. Kombinationen promptCacheTtl och subagentPromptCacheTtl hanterar en konkret ekonomisk kompromiss för användare med API-nyckel: behåll en timmes cache på huvudkonversationen, där sammanhanget är stabilt, men låt subagenterna ha fem minuter, eftersom deras sammanhang är mer volatilt. På fix-sidan fastnar inte längre avlägsna MCP-servrar i icke-interaktivt läge efter ett avbrott, /resume är inte längre begränsat till de femtio senaste sessionerna, och stumma sessioner som varar mer än tio minuter går nu ut efter ungefär tre minuter innan ett nytt försök och ett tydligt felmeddelande.

Den 24 augusti meddelar Anthropic dessutom att de har skrivit om motorn som visar svar medan de genereras på Claude web och desktop. Principen är klassisk i gränssnittsrendering: bara röra det som fortfarande ändras, i stället för att rita om hela svaret vid varje nytt fragment. På ett långt svar är skillnaden strukturell — renderingskostnaden slutar öka med längden på den redan visade texten. De utlovade vinsterna är samstämmiga: ungefär 4 gånger smidigare, 9 gånger färre blockeringar på en svag laptop, ett 4,5 gånger kortare värsta gränssnittsfrys, och 120 bilder per sekund hållna från början till slut på en MacBook med 120 Hz. Den intressanta detaljen är målgruppen: det är de blygsamma konfigurationerna som tjänar mest.

🔗 Claude Code CHANGELOG · 4x smidigare rendering, @ClaudeDevs


Kodagenter industrialiseras: Warp publicerar formatet för sina factories, Rohlik låter agenter skriva 90 % av sin kod

24 augusti i slutet av dagen — Warp visar den interna mekaniken bakom Warp Factories, sin molnagentplattform som tillkännagavs den 18 augusti: det valda konfigurationsformatet och öppningen av tidig tillgång. Utgångspunkten är uttalad — Warp flyttar sina egna agenter bort från lokala maskiner, av kvalitets- och kostnadsskäl, och behövde beskriva miljöer, harnessar och säkerhetsbehörigheter som versionshanterad kod.

KonfigurationsdelVärde som valts
Definitionsfilfactory.yaml, schemaVersion: v1alpha1
Huvudnycklarname, repositories (owner / name), agentDefaults.model
Definition av en agentagents/<nom>/agent.md med agentType (FOREMAN, REVIEW…) och model
Utlösareautomations/<nom>/automation.md : agent, triggers (leverantör, händelse)
Tillgängliga gränssnittCLI (warp agent run-cloud), REST API, TypeScript SDK, MCP-server
Tidig tillgångUpp till 10 000 USD i kostnadsfri användning för kvalificerade kunder

Uppdelningen är intressant: agenterna beskrivs inte i en enda YAML utan i dedikerade Markdown-filer, så att definitionen av en agent blir ett läsbart och diffbart dokument. Warp tillämpar receptet på sig själv — dess interna factory, kallad ”wilson”, omfattar repos som warp-server eller warp-terraform, deklarerar sina hemligheter och sina MCP-servrar, och sorterar sina agenter efter roll (code-review, foreman, implementation, spec, triage) på 34 rader. Siffrorna som lyfts fram på ansökningssidan om tillgång är affärsargument som inte kan verifieras utifrån: 200 000 agentkörningar per dag, mer än 30 % pull requests sammanslagna utan omarbetning, 20 % lägre kostnad per pull request.

Den 25 augusti publicerar Cognition sin sida om en fallstudie som är betydligt mer dokumenterad än den föregående. Rohlik Group är en livsmedelsdistributör på nätet, grundad i Tjeckien, verksam i fem länder, lönsam, med mer än 1,3 miljarder dollar i omsättning förra året; de levererar en veckokorg med 17 000 produkter på mindre än en timme eller inom femtonminutersfönster. Siffran som strukturerar artikeln: omkring 90 % av koden där genereras i dag av agenter, och ingenjörsorganisationen beskriver sig som ”agent-mostly”.

Detta är inte ett resultat som uppnåtts genom att bara koppla in ett verktyg. Rohlik säger att de började för ett år sedan, med en första erfarenhet av Devin som bedömdes som buggig. Det som förändrade läget var de grundvalar som lades på kundsidan: mer än femtio interna och externa MCP-integrationer, med principen att varje nytt verktyg ska vara tillgängligt för agenter redan från dag ett, ett semantiskt lager ovanpå Snowflake-datalagret, och en kunskapsbas som ger agenter det sammanhang man skulle ge en ny kollega. Arbetet når Devin där det uppstår, en Slack-konversation om en bugg eller ett Linear-specifikationsdokument som rullas fram till pull request. De utlovade resultaten — dubblerad ingenjörstakt sedan november, integrationen av AutoStore-robotik levererad på åtta månader där branschen normalt behöver två till tre år, prototypframtagning som gått från en månad till en dag — är alltjämt sådana som publiceras på en kundsida hos leverantören. Den mest talande effekten är någon annanstans: de bästa ingenjörerna lägger nu 80 % av sin tid på att läsa kod, och omkring 30 % av användningen av Devin hos Rohlik är dataanalys av verksamhetsanvändare.

🔗 Factory.yaml-formatet, @warpdotdev · Rohlik-fallstudie, @cognition · Devins kundsida


GitHub: fyra övningar om agentiska arbetsflöden och fliken Customize blir allmänt tillgänglig

25 augusti — GitHub lägger upp fyra nya övningar på sin lärplattform GitHub Skills. Vinkeln är tydlig: i stället för att dokumentera årets agentiska nyheter föreslår GitHub att man övar på dem i ett demo-repo, med instruktioner levererade allt eftersom pull requests flyter in.

Publicerad övningÖvningens syfte
Agent Orchestration Build Your AI Dream TeamAnpassade agenter i Copilot CLI: planera, designa, bygg, validera, överlämna
Agentic Workflows that Read the RoomTillägget gh aw, agentiskt arbetsflöde i Markdown, ändringar skickas via pull requests
Idea to Merge with the Copilot AppFrån en session till en sammanslagen pull request, helt i appen GitHub Copilot
Ship with QualityAutomatiserade kvalitetssignaler, testtäckning, tvingande kontroller på pull requests

Det mest anmärkningsvärda av de fyra är det första: det är första gången GitHub erbjuder en guidad bana för multiagent-orchestration i sin CLI, ett ämne som hittills bara dokumenterats i prosa. Det andra introducerar tillägget gh aw, med en viktig säkerhetsaspekt — de ändringar som föreslås av arbetsflödet går via pull requests i stället för att tillämpas direkt, vilket behåller en mänsklig granskningspunkt.

Samma dag får appen GitHub Copilot en flik Customize som blir allmänt tillgänglig. Dess funktion är att samla de fyra utökingsmekanismer som introducerats separat de senaste månaderna i en enda yta: MCP-servrar, plugins, skills och canvases. En vy Featured visar ett redaktionellt urval från varje kategori, för användaren som vet vad hen vill göra men inte vilken typ av tillägg som svarar mot det, och MCP-servrarna får tydlig navigering med alternativ som lyfts fram efter popularitet och en kategoribaserad väg. Changeloggen illustrerar nyttan med canvases med ett konkret fall: en Azure DevOps-canvas för att sortera issues, prioritera en backlog, tilldela uppföljningar och sedan ge en uppgift till Copilot så att den undersöker, implementerar eller förbereder granskningen.

🔗 Fyra GitHub Skills-övningar · Fliken Customize blir allmänt tillgänglig


Googles utvecklarverktyg: Gemini CLI 0.57.0 och Antigravity 2.10.0

25 augusti — Google publicerar den stabila versionen 0.57.0 av Gemini CLI, följd en kvart tidigare av preview 0.58.0. Innehållet i den här versionen säger mindre om nya funktioner än om hur Google underhåller sitt verktyg: av changeloggens 24 poster är 13 prefixerade med [SSR Agent] Issue Fix och pekar på issue-nummer som ofta är gamla, från 19239 till 28518. Dessa fixar hanterar irritationsmoment som hopats i backloggen — en oändlig blockering av terminalgränssnittet som nu får timeouts, ett vilseledande administratörsfelmeddelande för personliga konton, avsaknad av mellanrum efter autocompletion-förslag, terminalrendering som inte uppdaterades vid utdata från extern editor. Med andra ord låter Google en agent arbeta på sin egen tekniska skuld och resultatet landar direkt i den stabila versionen.

Publicerad versionDatum och tid (UTC)PubliceringskanalHöjdpunkter
v0.57.025 augusti, 18:37:14Stable13 [SSR Agent]-fixar, validering av evals, kontextuella retries
v0.58.0-preview.025 augusti, 18:22:01PreviewDocker-isolering i macOS-profilen Seatbelt, säkerhetskontroller

På funktionssidan ligger tyngdpunkten på utvärdering, med ett kommando för att validera evals och en formaterare för verktygskall som integrerar sammanfattningar av misslyckanden. Tillförlitligheten förbättras också: kapacitetsfel utlöser tysta retries som tar hänsyn till kontext, och avbrytning av en flerstegsförfrågan leder till en fullständig rollback i stället för ett partiellt tillstånd. För den som letar efter versionsnoterna kan nämnas att filen docs/changelogs/index.md i repot inte har uppdaterats bortom v0.54.0 från den 6 augusti.

Fyra dagar efter 2.9.1 och dess Remote Control går Google Antigravity över till 2.10.0 den 24 augusti och fyller två luckor som tvingade användaren att lämna verktyget: en inbyggd terminal och ett inbyggt Git-versioneringskontrollsystem, båda placerade direkt i sidofältet. Samlingen är logisk i ljuset av produktens riktning — Antigravity positionerar sig som en miljö där man styr agenter snarare än redigerar kod rad för rad, men då måste man också kunna köra ett kommando och inspektera en diff utan att byta fönster. Resten av versionen utvidgar vad som kan skickas till en agent och vad man ser av dess arbete: ljudfiler ansluter till de accepterade bilagorna, interaktiv kommentar på bilder gör det möjligt att annotera ett visuellt objekt för att styra agenten, och de berikade förhandsvisningarna av MCP-verktygens körning gör det läsbart vad en verktygsserver faktiskt gjorde. Google anger versionen till 13 förbättringar och 8 korrigeringar, med gradvis utrullning.

🔗 Gemini CLI v0.57.0 · Antigravity-changelog


Anthropic finansierar 5 miljoner dollar i oberoende utvärderingar om välbefinnande

25 augusti — Anthropic öppnar ett stipendieprogram på 5 miljoner dollar som ska finansiera oberoende forskning om AI:s inverkan på användarnas välbefinnande. Mottagarna får direkt finansiering, tillgång till modeller och teknisk support, men arbetar helt självständigt: deras utvärderingar publiceras med öppen källkod och kan återanvändas av hela branschen. Ansökningar är öppna till 21 september, och kandidater som väljs ut för att lämna in ett komplett förslag får besked före 5 oktober.

Det tekniska resonemanget förklarar varför detta område står emot vanliga utvärderingsmetoder. För de flesta modellbeteenden räcker det att granska ett isolerat svar för att avgöra om det är korrekt och lämpligt. Välbefinnande kräver sammanhang: en användare i nöd nämner inte nödvändigtvis självskadande tankar direkt, och råd om rimlig kosthållning i ett fall kan bli potentiellt farliga om personen visat tecken på ätstörningshistorik. Safeguards-teamet publicerar samtidigt fem rigorösa kriterier: formulera tydligt vad som mäts, låt kliniker och ämnesspecialister bidra till designen, testa både försiktighetsåtgärderna och skadorna — det vill säga utvärdera risken för överdriven medgörlighet lika väl som överdrivet avslag —, spegla verklig användning med flerstegsscenarier, och validera de automatiska rättarna mot verkliga experter. Det tredje kriteriet, symmetrin mellan överanpassning och överavslag, är det som skiljer denna ansats från en enkel skärpning av skyddsräckena.

🔗 Forskningsstipendier om välbefinnande


Quantization-Aware Healing : en 4-bitmodell som överträffar sin fullprecisionsoriginal

25 augusti — Standardpipelinen för att göra en stor modell möjlig att driftsätta består av tre steg: komprimera arkitekturen, kvantisera resultatet och sedan reparera kvalitetsförlusten. Det dominerande receptet för det sista steget är QAT (quantization-aware training), som infogar operationer för skenkvantisering och tränar om; ett alternativ, QAD, destillerar från den komprimerade modellen i full precision. I båda fallen kan eleven som bäst bara komma ikapp sin komprimerade lärare och ärver därmed det tak som sätts av komprimeringen.

Multiverse Computing föreslår en ändring på en enda rad: destillera direkt från originalmodellen, den som fanns innan komprimeringen. Kvantiseringen slutar då vara en förlustgivande efterbearbetning och blir i stället ett fullt utvecklat inlärningssteg. Resultatet är kontraintuitivt — tillämpat på GPT-OSS 120B komprimerad till 60B och sedan kvantiserad i MXFP4 producerar metoden en 4-bitmodell som matchar eller överträffar sin egen bfloat16-källa på sju av nio benchmarktester, med de största vinsterna där komprimeringen gör mest ont: +7,4 poäng på AA-LCR i resonemang med långt sammanhang och +5,6 på AIME 2025. De två enda tillbakagångarna, på MMLU-Pro och SciCode, ligger båda under en och en halv poäng.

Den direkta jämförelsen med QAT med identisk pipeline är kanske det mest praktiska resultatet. På GPT-OSS 9B kvantiserad i MXFP4 når båda metoderna en jämförbar topp, 54,9 mot 54,6, men inte till samma pris: QAH når dit på omkring hundra steg och håller sig där, medan QAT behöver cirka 700 steg för att nå dit och sedan försämras. Den konkreta konsekvensen är en annan driftsättningsrisk — en QAT-checkpoint kräver noggrann övervakning av tidig stoppning, en QAH-checkpoint mycket mindre.

🔗 Quantization-Aware Healing


Gradio integrerar gr.Workflow, en konstruktör för AI-pipelines i graf

25 augusti — Hugging Face publicerar en guide som presenterar gr.Workflow, en primitiv som nu är integrerad i Gradio. Utgångspunkten är enkel: de flesta intressanta AI-applikationer är inte ett enda modellanrop utan en kedja — man genererar en bild, frilägger bakgrunden, tar fram en voice-over och ber en LLM om en titel. Tidigare krävdes det att man byggde både logiken och gränssnittet för att koppla ihop den här kedjan och exponera den snyggt. gr.Workflow slår ihop båda: man beskriver stegen som en graf av typade noder, och grafen blir i sig själv gränssnittet.

Vinsten för utvecklare går längre än den visuella demonstrationen. Varje utgång i grafen får automatiskt sin egen REST-åtkomstpunkt: mediestudion som används som exempel, och som kedjar en FLUX-generering, friläggning, talsyntes och en LLM, exponerar tre separata rutter (/sticker, /voiceover, /episode_title) som kan anropas från kod utan att gå via gränssnittet. Noderna kan tala med fyra världar — modeller som hostas via Hugging Face Inference Providers, andra publika Gradio Spaces som återanvänds som byggstenar, en rad i en dataset från Hubben och godtycklig Python. Den sista punkten öppnar flest dörrar: en operatörnodo som dekoreras med @spaces.GPU reserverar en ZeroGPU-GPU under sin körning, vilket gör det möjligt att köra sina egna vikter. Fem verkligt driftsatta applikationer i Spaces följer med guiden, däribland en datasetprofilare och en demonstration som animerar en stillbild med Lightricks/LTX-Video.

🔗 Guide för gr.Workflow


ElevenLabs lanserar Composer, en sångeditor för sektion för sektion

25 augusti — ElevenLabs tillkännager Composer, en sångeditor som arbetar sektion för sektion. Principen bryter med den dominerande genereringsmodellen för musikmodeller: i stället för att skapa en hel låt i ett svep och börja om från början när ett avsnitt inte passar, låter Composer dig ta om ett versparti, en refräng eller en brygga var för sig. Fyra utgångspunkter erbjuds — dina egna texter, ett befintligt spår som du själv tar med, en tom sida eller en enkel prompt — och låten byggs därefter upp genom successiva justeringar.

Detta är ElevenLabs andra steg mot musik efter Eleven Music, och det kommer under en intensiv vecka för företaget, då CLI v1 släpptes dagen innan. Positioneringen är konsekvent med resten av ljudsektorn: Suno lanserade Studio 2.0 den 13 augusti, Pika släppte sin Pika Music-serie den 18 augusti, och Stability AI levererade sin plugin för ljudarbetsstationer samma dag. Fin kontroll över låtens struktur, snarare än rå genereringskvalitet, har blivit konkurrensfältet. En reservation finns dock: inget blogginlägg följer med tillkännagivandet, och inget är tillgängligt om abonnemangsplanerna som ger tillgång till Composer, exportformat eller API-åtkomst.

🔗 Composer-tillkännagivandet, @ElevenLabs


LiveAvatar tar bort alla samtidighetsgränser och sjunker till 0,01 USD per minut

25 augusti — HeyGen tillkännager att samtidighetsgränserna för LiveAvatar, deras realtidsprodukt för avatarer, tas bort. Formuleringen betonar förändringens natur: gränserna höjs inte, de försvinner. En session eller tiotusen körs på samma API, utan förhandling om kvot i förväg. Två parametrar följer med tillkännagivandet — renderingen förblir i helkropps-1080p, och priset sjunker till så lite som 0,01 USD per minut i stor skala.

Denna prisnivå förändrar vilka användningsområden som är möjliga: till en cent per minut blir en realtidsavatar gångbar för kundsupport i stor skala, utbildning eller interaktiva kiosker, användningsfall där styckkostnaden hittills avgjorde om det över huvud taget var genomförbart. Att ta bort samtidighetsgränsen är den tekniskt intressanta punkten. Plattformar för realtidsavatarer sätter normalt ett tak för antalet samtidiga sessioner eftersom varje session använder GPU kontinuerligt; att lyfta det taket kräver antingen en stor kapacitetsmarginal eller en effektivitetsvinst i modellen. HeyGen publicerar en artikel som förklarar deras tillvägagångssätt, men de tekniska detaljerna var inte tillgängliga vid genomgången.

🔗 Obegränsad samtidighet på LiveAvatar


Grok 4.6 kommer till OpenCode Go

25 augusti — Grok 4.6 ansluter till OpenCode Go, abonnemangsmodellen för open source-kodagenten OpenCode. Tillkännagivandet kommer från OpenCode sent på dagen, och kontot @grok vidarebefordrar det en halvtimme senare. Det konkreta för utvecklare är kvoten: 169 förfrågningar per 5-timmarsperiod för användare av Go-planen. Det är ett rullande tak, inte en månadsräkning, vilket passar den burst-användning som är typisk för assisterade kodningssessioner.

Denna integration ingår i en serie öppningar av Grok 4.6 mot tredjepartsverktyg: modellen kom till GitHub Copilot den 14 augusti, till Amazon Bedrock den 19 augusti och sedan till Google Gemini Enterprise Agent Platform den 21 augusti. xAI hade dessutom redan kopplat OpenCode till sina SuperGrok- och X Premium-abonnemang i maj 2026 — dagens bidrag handlar alltså inte om åtkomst till OpenCode i sig, utan om att modell 4.6 finns i Go-planen, med en inkluderad kvot i stället för ett xAI-abonnemang som man själv måste stå för.

🔗 Vidarebefordran @grok · Tillkännagivande @opencode


Cohere publicerar en IDC-studie om införandet av suverän AI 2026

25 augusti — Cohere publicerar resultaten av ett InfoBrief som beställts från IDC om införandet av suverän AI i reglerade sektorer. Studien intervjuade mer än 500 seniora beslutsfattare i företag med mer än en miljard dollar i omsättning i Kanada, USA, Storbritannien och Tyskland, mellan april och maj 2026.

Det mest anmärkningsvärda resultatet handlar mindre om införandet än om den begreppsliga förvirringen. En av tre chefer har svårt att beskriva suverän AI med egna ord, och endast 13 % uppger att de är mycket väl medvetna om ämnet. Bland dem som kan ge en definition formulerar 52 % det i termer av lokal eller nationell kontroll och 35 % nämner digital självständighet. Klyftan går också genom organisationens hierarki: IT-chefer visar dubbelt så hög medvetenhet som verksamhetschefer.

Tillfrågad sektorDataläckage och regelefterlevnad som främsta oroKonkurrensfördel som drivkraft
Finansiella tjänster82 %21 %
Industri77 %32 %
Telekommunikation75 %37 %
Vård74 %28 %
Energi70 %21 %

När det gäller drivkrafter är konsensus tydlig och tvärsektoriell: dataläckage, sekretess och regelefterlevnad hamnar i topp i alla undersökta sektorer. Konkurrensfördel framträder som en sekundär men växande drivkraft, tydligare i Kanada (35 %) och USA (28 %) än i Tyskland (23 %) eller Storbritannien (18 %). Studien tjänar förstås Cohere:s positionering, vars agentplattform North körs i den infrastruktur och jurisdiktion som kunden väljer; kvar står dock att siffrorna tillskrivs en identifierad källa. IDC förutspår dessutom att fram till 2028 kommer CIO:er i multinationella företag att öka sina investeringar i modulära suveräna molnmiljöer och datalokalisering med 65 %.

🔗 State of Sovereign AI Adoption 2026


Kortnotiser

  • Bain & Company ansluter till Claude Partner Network — Konsultfirman blir Global Premier-partner, kopplad till en utrullning av Claude bland sina 19 000 anställda; över 7 000 aktiva användare redan i pilotfasen, och mer än två tredjedelar av deltagarna har antagit Claude for Excel. 🔗 Anthropic-inlägg
  • Amp förklarar vad orbs är — Thorsten Balls notis som svar på förvirringen kring namnet: en orb är en fjärragent som kan styras från webben, mobilen eller CLI. Två användbara klargöranden om kostnaden: obegränsad vila debiteras inte och antalet samtidiga orbs är inte takbegränsat. 🔗 Amp-notis
  • Together AI öppnar Qwen3.8 27B för fine-tuning och dedikerad inferens — Modellen blir tillgänglig både för finjustering på egna data och för Dedicated Model Inference på reserverad hårdvara. 🔗 Tweet @togethercompute
  • FINAL-Bench öppnar FINCHAL, en tävling i finansiell prognostisering för agenter — Med 2 000 dollar i prispott kräver den positioner snarare än prognoser och publicerar ett luck ceiling för att skilja kompetens från slump. 🔗 FINAL-Bench-inlägg
  • Au-Zone publicerar EdgeFirst Model Zoo — Fyra YOLO-familjer för detektering och segmentering mätta på verklig inbyggd kiselhårdvara, där varje publicerad siffra pekar tillbaka till den valideringssession som producerade den, i kontrast till tillverkarnas opaka TOPS-värden. 🔗 EdgeFirst-inlägg
  • Geminis smarta diktering för macOS — Diktera i vilket fönster som helst på skrivbordet, med automatisk borttagning av tvekan och hänsyn till korrigeringar mitt i en mening; rösten kan också användas för att sammanfatta filer och skriva om text. 🔗 blog.google-guide
  • Push-regler accepterar sökvägsundantag — I offentlig förhandsversion kan reglerna Restrict file paths och Restrict file size undanta specifika sökvägar, till exempel blockera JAR-filer överallt utom **/gradle/wrapper/*.jar. 🔗 GitHub-changelog
  • Blockering av en användare från ett säkerhetsmeddelande — Åtgärden görs via trepunktsmenyn i beskrivningen eller i en kommentar, i offentliga repor, utan att gå tillbaka till inställningarna; meddelandet förblir intakt. 🔗 GitHub-changelog
  • Manus rapporterar stark efterfrågan på dataåterställning — Återställningar som inte går igenom måste startas om senare samma dag; tydlig instruktion att bevara säkerhetskopieringspaketen intakta och oförändrade. 🔗 Tweet @ManusAI
  • Kling publicerar tre guider om sin MCP-server — Koppla Kling till en MCP-kompatibel assistent för att spela upp en validerad kreativ konfiguration och generera varianter i batch; två av de tre handledningarna nämner Claude Code som klient. 🔗 Kling-blogg
  • Wan 3.0 kommer till Runway och Replicate — Runway integrerar det den 24 augusti med flera referensinmatningar i bild, video och ljud; Replicate följer den 25:e och lyfter fram 30 sekunder inbyggt i ett enda tag med synkroniserat ljud. 🔗 Tweet @runwayml
  • Runway annonserar nya talare till sin AI Summit — Utökat program med robotik, autonoma fordon, marknadsföring och infrastruktur för septemberevenemanget i San Francisco. 🔗 Tweet @runwayml
  • MiniMax publicerar ett index över H3-integrationer — Awesome MiniMax H3 Integrations samlar det som byggs runt den öppna videomodellen, däribland konfigurationer som körs på 24 GB VRAM. 🔗 Tweet @MiniMax_AI
  • Luma lanserar Dream Lab Weekly — Första avsnittet i en videoserie om Lumas kreativa proffs och deras veckovisa arbete med produkten. 🔗 Tweet @LumaLabsAI
  • NVIDIA sänder en Nemotron Labs-session om routing av öppna modeller — 55 minuter lång livesändning med titeln Get Started with Open Model Routing, en fortsättning på arbetet med Nemotron 3.5 Lightning och NeMo Switchyard. 🔗 Tweet @NVIDIAAI
  • En vecka kvar för Grok Imagine-tävlingen på Odysséen — Man måste komponera en scen hämtad ur Odysséen som visar verktygets video- och röstkapacitet; prispengar på 100 000, 50 000 och 25 000 dollar. 🔗 Tweet @grok
  • Bank av återställningar av gränser för Plus- och Pro-prenumeranter — I stället för att vänta på återställningsfönstret använder användaren en återställning som lagts i reserv; en gratis vid lansering och fler via värvning, med delade workspace-krediter på Business-sidan. 🔗 Changelog ChatGPT och Codex

Vad detta innebär

Kisel är åter ett ämne för modelllaboratorier. OpenAI publicerar samma dag de första uppmätta siffrorna för sitt eget inferenschip och inlägget som redogör för deras compute-strategi. Det är ingen slump i kalendern: en modellleverantör som konstruerar sitt eget kisel, mäter det mot ett offentligt tredjepartstest och öppet står för en portfölj med tio partners förändrar konkurrensens natur. Frågan blir inte längre ”vilken modell är bäst” utan ”till vilken kostnad per lyckad uppgift”, och svaret avgörs lika mycket i racket som i vikterna. Den kanske mest betydelsefulla detaljen finns någon annanstans: AI användes för att utforma chippet och skriva dess kernels, med en väg till tillverkning på nio månader och genererade implementationer som överträffar mänskliga experters på de utvalda blocken. Cirkeln sluts — modellerna utformar hårdvaran som ska köra dem.

AI flyttar tillbaka ned på enheten, och siffrorna börjar följa efter. Tre signaler samma dag pekar i samma riktning. Perplexity kör hela sin agent lokalt på en DGX Spark, utan att förbruka krediter, med en molnupptrappning som förblir användarens beslut. Multiverse Computing publicerar en metod där en 4-bitars modell motsvarar eller överträffar sin källa i full precision, vilket tar bort det vanliga argumentet mot aggressiv kvantisering. Au-Zone publicerar mätningar av inbyggd kiseldriven vision och kritiserar de annonserade TOPS-siffrorna för att inte säga någonting om vad en given modell faktiskt kommer att göra. Ingen av dessa tre arbeten påstår sig nå frontier: Perplexitys ärliga siffra är 59,6 % lokalt mot 82,4 % för Claude Opus 5 ensam på Terminal Bench 2.1. Men en upptrappning till en rådgivande modell hämtar tillbaka tre femtedelar av gapet till två tredjedelar av kostnaden, och det är den avvägningen, mer än paritet, som gör lokal körning försvarbar.

Öppna vikter etablerar sig som standardposition. Analysen av 500 000 arXiv-artiklar som Qwen sprider dokumenterar en redan märkbar vändning: öppna kinesiska modeller har gått från 10 % till omkring 40 % av omnämnandena, medan öppna amerikanska modeller står stilla mellan 25 och 30 %. Qwen3.8-27B som går in i topp 10 i Code Arena som den enda i sin storlek, GLM-5.3 som överträffade GPT-5.6 Sol och Claude Fable 5 på DeepSWE i flera försök till en kostnad som var 2,1 till 5,4 gånger lägre, IBM som öppnar Granite 4.2 med fyra kvantiserade varianter och fjorton GGUF-format redan första dagen — samma logik upprepas. Att öppna vikterna är inte längre en efterhandsåtgärd utan ett sätt att bli andras standardinfrastruktur, med den nyans som Nathan Lambert själv lyfter: publikationer släpar efter lanseringar, och dessa kurvor beskriver pågående arbete snarare än de aktuella preferenserna.

Och webben förbereder sig på att läsas av agenter snarare än av ögon. WebMCP Challenge är en tävling med ett prispott på 35 000 dollar, vilket är lite; det den avslöjar är mer värt. Chrome, Cloudflare, Shopify, Vercel, Render och Netlify linjerar upp sig med OpenAI kring en standard som kräver att webbplatser exponerar strukturerade verktyg i stället för att låta agenter gissa sig till ett gränssnitt. Samma dag kan ChatGPT desktop nativt konsumera WebMCP, Codex kan producera och distribuera en kompatibel applikation, och OpenAI dokumenterar sin interna användning av protokollet i ett anteckningsverksverktyg. Denna konvergens knyter an till det Rohlik beskriver på sitt håll med mer än femtio MCP-integrationer och principen att varje nytt verktyg ska vara åtkomligt för agenter redan första dagen. Gränssnittslagret för agenter slutar vara ett forskningsämne och blir ett ingenjörskrav.


Källor