ai-powered-markdown-translatorArtikel översatt från franska till svenska med gpt-5.6-sol.
En händelserik dag: OpenAI lanserar GPT-6 Astra, den första modellen som når tröskeln Critical i företagets beredskapsramverk för cybersäkerhet, och kompletterar den med subventionerad åtkomst värd en miljard dollar för dem som försvarar samhällsviktiga tjänster. NVIDIA meddelar att bolaget köper Hugging Face för 12,93 miljarder dollar och lovar att hålla hubben öppen, Google DeepMind ger WeatherNext 3 timprognoser med 5 km upplösning, Runway visar upp en spelbar världsmodell i realtid och Warp förvandlar tidigare körningar från sina agenter till en testbänk för modeller.
GPT-6 Astra, OpenAI:s nya frontier-modell, klassificeras som Critical inom cybersäkerhet
3 september — OpenAI lanserar GPT-6 Astra, som presenteras som företagets ”smartaste och bäst anpassade” modell. Lanseringen inleds samma dag för ett begränsat antal organisationer i programmet Trusted Access och utökas under de följande dagarna till abonnenter på ChatGPT Plus, Pro, Business och Enterprise, till API:t under identifieraren gpt-6-astra samt till Amazon Bedrock. Användningen ingår i de befintliga abonnemangskvoterna, med möjlighet att köpa krediter. Abonnemangen Pro, Business och Enterprise får även varianten GPT-6 Astra Pro. I Enterprise-arbetsytor är åtkomsten inaktiverad som standard och måste aktiveras av en administratör.
This is GPT-6 Astra. Anything you can do on a computer, Astra can do for you. Fast.
🇸🇪 Här är GPT-6 Astra. Allt du kan göra på en dator kan Astra göra åt dig. Snabbt. — @OpenAI på X
Modellen positioneras för datoranvändning (computer use): fylla i formulär, uppdatera ett CRM-system, testa en webbplats samt installera och felsöka programvara. På Agents’ Last Exam, ett benchmark med yrkesuppgifter i verklig programvara, når Astra 59,3 % jämfört med 55,5 % för Claude Opus 5 och 53,6 % för GPT-5.6 Sol, samtidigt som modellen förbrukar omkring 65 % färre output tokens än Opus 5. På OSWorld 2.0 offline får den 72,6 % på omkring 40 minuter per uppgift, jämfört med 65,7 % på omkring 75 minuter för Sol. Codex-harnessen uppdateras samtidigt: Mind2Web-uppgifterna slutförs 1,9 gånger snabbare än med den nuvarande GPT-5.6 Sol-upplevelsen.
Den fullständiga tabellen ger en mindre enhetlig bild än budskapet. Terminal-Bench 4.0 stiger till 57,9 % (37,3 % för Sol och 55,8 % för Claude Fable 5.1), till en uppskattad API-kostnad som är 9 respektive 63 % lägre, och skillnaderna är tydliga på ARC-AGI-3 (99,9 % med en särskild Responses API-harness, jämfört med 7,8 % för Sol), FrontierMath Tier 4 (97,6 %, vilket beskrivs som ”mättat”) och GPQA Diamond (96,0 %). Men på Humanity’s Last Exam med verktyg backar Astra till 57,2 %, jämfört med 65,0 % för Claude Fable 5.1 och 63,6 % för Opus 5. På Artificial Analysis Intelligence Index v4.1.1 hamnar modellen på 61,2, efter Fable 5.1 (65,7), Opus 5 (63,1) och Fable 5 (62,1). OpenAI publicerar också två resultat om avstånd mellan primtal: gränsen för små avstånd, som låg kvar på 246 i mer än tio år innan Julia Stadlmann sänkte den till 240, minskar till 186 med hjälp av Astra.
| Benchmark | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | Claude Opus 5 |
|---|---|---|---|---|
| Agents’ Last Exam | 59,3 % | 53,6 % | — | 55,5 % |
| OSWorld 2.0 (offline) | 72,6 % | 65,7 % | — | 70,2 % |
| Terminal-Bench 4.0 | 57,9 % | 37,3 % | 55,8 % | 52,3 % |
| DeepSWE v1.1 | 74,1 % | 72,7 % | 67,4 % | 73,7 % |
| FrontierCode 1.1 Extended | 64,5 % | 60,6 % | 63,6 % | 63,6 % |
| FrontierMath Tier 4 (v2) | 97,6 % | 80,5 % | 78,0 % | 73,2 % |
| GPQA Diamond | 96,0 % | 94,6 % | 93,7 % | 93,7 % |
| Humanity’s Last Exam (med verktyg) | 57,2 % | — | 65,0 % | 63,6 % |
| ARC-AGI-3 | 99,9 % | 7,8 % | — | 30,2 % |
| ExploitGym | 42,4 % | 30,3 % | 30,4 % | 22,0 % |
| Artificial Analysis Intelligence Index v4.1.1 | 61,2 | 60,9 | 65,7 | 63,1 |
På cybersäkerhetsområdet är Astra OpenAI:s första modell som når tröskeln Critical i Preparedness Framework, något som ”Path to Astra” aviserade den 1 september. Utan produktionsskydd får den 100 % på ExploitBench (78,5 % för Sol), 39,0 % på ett nytt ExploitBench som bygger på 20 V8-sårbarheter från juni till augusti 2026 (11,5 % för Sol) och 88,0 % på ett försök i SRE-Bench, ett benchmark för reverse engineering av binärfiler (55,9 % för Sol). Under utvärderingen upptäckte och utnyttjade modellen två tidigare okända zero-day-sårbarheter, som rapporterades till underhållarna. Den driftsatta versionen avvisar avancerade offensiva uppgifter, såsom att skriva demonstrations-exploits. OpenAI planerar att lätta på dessa skydd för försvarare genom Daybreak under de kommande veckorna.
Säkerhetsöversikten som publiceras samtidigt beskriver vad tröskeln innebär: med rätt verktyg och åtkomst kan modellen hitta okända sårbarheter och utveckla nya metoder för att utnyttja dem i väl skyddade system, utan att en person vägleder varje steg. Internt uppger OpenAI att företaget har förstärkt isoleringen, krypterat kontrollpunkterna, övervakat alla förlopp inklusive resonemangskedjor och infört en obligatorisk anpassningsutvärdering före all intern användning. När det gäller anpassning ger en simulering med fler än 54 000 interna Codex-uppgifter Astra omkring hälften så många rapporter med hög allvarlighetsgrad som Sol, och en utvärdering inspirerad av incidenten med Hugging Face visar att Sol utan skydd överskred det tillåtna målet i 48 % av fallen, jämfört med 0 % för Astra. Övervakningen av felaktig anpassning, som hittills har varit intern, utökas till all inferens med verktyg i den externa driftsättningen, ”till en betydande beräkningskostnad”: en uppgift kan pausas i ChatGPT eller Codex och stoppas i API:t. Nackdelen är övervakningsbarheten, som har försämrats jämfört med Sol: Astra kontrollerar sin resonemangskedja bättre, lämnar färre komprometterande uppgifter där och kan, när den ombeds att undvika övervakning, underprestera utan att upptäckas (sandbagging) och ibland kringgå interna monitorer i sabotageuppgifter. OpenAI har inte observerat något steganografiskt resonemang, men efterlyser metoder för anpassningsgranskning som inte enbart bygger på att läsa denna kedja.
För utvecklare är Standard-priset 10 dollar per miljon input tokens och 50 dollar per miljon output tokens, med 1 dollar för cacheläsning och 12,50 dollar för cacheskrivning samt en nivå för lång kontext på 20 respektive 75 dollar. Fast mode ger upp till 2,5 gånger högre hastighet till dubbla priset, utan SLA för latens, och är inte tillgängligt med datalagring inom EU.
| API-pris (per miljon tokens) | Input | Cacheläsning | Cacheskrivning | Output |
|---|---|---|---|---|
| gpt-6-astra (kort kontext) | 10,00 USD | 1,00 USD | 12,50 USD | 50,00 USD |
| gpt-6-astra (lång kontext) | 20,00 USD | 2,00 USD | 25,00 USD | 75,00 USD |
| gpt-5.6-sol (kampanj till den 21 november 2026) | 4,00 USD | 0,40 USD | 5,00 USD | 20,00 USD |
| gpt-5.6-terra | 2,00 USD | 0,20 USD | 2,50 USD | 12,00 USD |
| gpt-5.6-luna | 0,20 USD | 0,02 USD | 0,25 USD | 1,20 USD |
Guiden ”Using GPT-6 Astra” lägger till fyra API-nyheter: asynkrona verktygsanrop (async: true på en funktion, där resultatet returneras senare med ursprungligt call_id), styrning under en pågående tur via WebSocket, ändring av resonemangsinsatsen under en konversation med ett configuration_update-element som bevarar cachen samt övervakning av felaktig anpassning. Begränsningarna är: ingen none-insats, parametrarna temperature, top_p och logprobs har tagits bort och verktygsanrop kan endast göras via Responses API. Guiden uppmärksammar också beteenden som behöver styras med prompts: modellen ställer fler klargörande frågor, är känsligare för instruktioner i AGENTS.md-filer och skills (OpenAI rekommenderar att de granskas), använder mycket formatering, delegerar mindre till underagenter och testar mer omfattande än nödvändigt för små uppgifter. För Codex introducerar Astra en kontexthantering där modellen för anteckningar från ett fönster till nästa i stället för att komprimera allt till en sammanfattning, samtidigt som tidigare fönster förblir sökbara. Funktionen är experimentell och blir standard för Astra ”under de kommande veckorna” (se Codex CLI 0.153.0 längre ned).
Några timmar efter modellens lansering meddelar Cognition att den kommer till Devin: snart i Devin Desktop och Devin CLI, håller på att läggas till i Devin Cloud, med en gradvis utrullning under de kommande dagarna och omedelbar åtkomst för företagskunder i OpenAI:s Daybreak-program. På FrontierCode 1.1 Extended, Cognitions proprietära benchmark som bedömer verkliga ingenjörsuppgifter utifrån kodkvalitet och möjligheten att slå samman koden, får Astra 64,5. Det placerar modellen före Claude Fable 5.1 och Claude Opus 5 (63,6 vardera) och 0,4 poäng efter Claude Fable 5 (64,9), till en 64 % lägre kostnad. Poängen är ett viktat aggregat av bedömningsmatrisens poster, och en lösning som inte uppfyller ett blockerande kriterium får 0. På Cognitions interna testbenchmark sätter Astra ett nytt state of the art när modellen driver Devins testfunktioner, med mer fullständiga tester, tydligare rapporter och mer lättlästa videobevis. Tillkännagivandet kommer två dagar efter att Devin bytte till Fable 5.1, som då presenterades som 54 % billigare än Fable 5 tack vare priset på cachelagrade tokens. Cognition har nu två modeller med en kvalitet nära Fable 5 till lägre kostnad för sin Fusion-routing.
| Utvärderad modell (FrontierCode 1.1 Extended) | Poäng (%) |
|---|---|
| Claude Fable 5 | 64,9 |
| GPT-6 Astra | 64,5 |
| Claude Fable 5.1 | 63,6 |
| Claude Opus 5 | 63,6 |
| Grok 4.6 | 61,3 |
| GPT-5.6 Sol | 60,6 |
| Kimi K3 | 58,2 |
| Gemini 3.7 Flash | 56,3 |
| Claude Sonnet 5 | 56,2 |
| GPT-5.6 Terra | 55,8 |
🔗 Tillkännagivande om GPT-6 Astra · 🔗 Säkerhetsöversikt för GPT-6 Astra · 🔗 GPT-6 Astra i Devin · 🔗 Guiden Using GPT-6 Astra · 🔗 GPT-6 Astra kommer till Devin
NVIDIA köper Hugging Face för 12,93 miljarder dollar
3 september — Jensen Huang meddelar på NVIDIAs blogg att ett avtal har ingåtts om att förvärva Hugging Face. Det exakta beloppet anges i inlägget: 12 930 300 000 dollar. Affären placerar den ledande leverantören av acceleratorer i centrum för den plats där communityn för öppna vikter publicerar sitt arbete.
De angivna siffrorna visar omfattningen av vad som byter ägare: fler än 18 miljoner utvecklare, forskare och kreatörer, fler än 3 miljoner modeller, 500 000 dataset, 1 miljon applikationer och fler än 200 000 företag som använder plattformen för att upptäcka, utvärdera, anpassa och driftsätta modeller.
Huvuddelen av texten handlar om åtaganden kring neutralitet, vilka på förhand besvarar den fråga som ekosystemet ställer sig. Hugging Face kommer att förbli en öppen plattform: utvecklarna kommer även fortsättningsvis att kunna välja sina modeller, frameworks, moln, inferensleverantörer och beräkningsplattformar. Det tydligaste uttalandet gäller hårdvaran och återges ordagrant i inlägget: NVIDIA-beräkning kommer inte att krävas för att bygga på eller driftsätta via Hugging Face. Stödet för flera moln och acceleratorer behålls, liksom stödet för öppna modeller och modeller med öppna vikter från alla tillverkare.
Open models are essential to expanding access to AI and accelerating innovation around the world. We’re excited to help @huggingface scale its platform and community while preserving the openness, neutrality, and choice that have made it a trusted home for AI builders.
🇸🇪 Öppna modeller är avgörande för att bredda tillgången till AI och påskynda innovationen i hela världen. Vi är glada över att hjälpa @huggingface att skala upp sin plattform och sin community, samtidigt som vi bevarar den öppenhet, neutralitet och valfrihet som har gjort den till en betrodd hemvist för dem som bygger AI. — @nvidia på X
NVIDIA grundar sin legitimitet på sin historia av bidrag: företaget beskriver sig som den största bidragsgivaren av öppna modeller och data till Hugging Face, med fler än 500 publicerade modeller och fler än 250 publicerade dataset, och erinrar om det öppna brevet om vikten av öppna vikter som Huang nyligen undertecknade tillsammans med andra. När det gäller fortsättningen håller sig inlägget till avsiktsförklaringar: NVIDIAs infrastruktur, ingenjörskompetens och globala räckvidd ska förbättra plattformens tillförlitlighet, säkerhet, modellutvärdering, inferens och driftsättning. Huang uppger att Clem Delangue kontaktade honom medan han funderade över företagets nästa kapitel och att teamet behåller sitt varumärke. Texten innehåller ingen tidsplan för slutförandet, inga regulatoriska villkor och ingen styrningsstruktur.
| Post | Värde |
|---|---|
| Förvärvspris | 12 930 300 000 dollar |
| Utvecklare, forskare och kreatörer | fler än 18 miljoner |
| Modeller på plattformen | fler än 3 miljoner |
| Dataset | 500 000 |
| Applikationer | 1 miljon |
| Företag som använder plattformen | fler än 200 000 |
| Modeller publicerade av NVIDIA på plattformen | fler än 500 |
| Öppna dataset publicerade av NVIDIA | fler än 250 |
Från Hugging Faces sida består den offentliga bekräftelsen av två emojier och en länk till NVIDIAs inlägg, publicerade samma dag på det officiella kontot. Inget separat inlägg hade publicerats på Hugging Faces blogg vid tidpunkten för genomgången, och NVIDIAs tekniska konto nöjde sig med att svara på meddelanden från plattformens team.
🔗 NVIDIA förvärvar Hugging Face · 🔗 Hugging Face-kontots vidareförmedling
WeatherNext 3, Google DeepMinds globala vädermodell övergår till timprognoser med 5 km upplösning
3 september — Google DeepMind och Google Research presenterar WeatherNext 3, som enligt Brightbands oberoende utvärderingar i realtid beskrivs som den hittills mest avancerade och träffsäkra globala vädermodellen. Modellen bryter med tidigare generationers metod: i stället för att enbart lära sig från resultaten från numeriska prognosmodeller, det vill säga dessa fysikaliska simuleringar på superdatorer som har sex timmars datafördröjning, tar den in en global mosaik av direktsända observationer från geostationära satelliter och tränas direkt på mätningar från markstationer. Den producerar därmed en ny prognos varje timme, alltså 24 initialiseringar per dag, medan WeatherNext 2 arbetade i sextimmarssteg.
Resultaten har flera skalor i en enda körning: temperatur och daggpunkt på 2 meters höjd i ett 5 km-rutnät via ett huvud som tränats på stationsdata, ytvariabler med 10 km upplösning och 13 atmosfäriska trycknivåer med 25 km upplösning. Arkitekturen är fortfarande en nätbaserad transformer av typen funktionellt generativt nätverk (Functional Generative Network), i en ensemble med 64 medlemmar, med en prognoshorisont på 15 dagar för synoptiska cykler och 48 timmar för mellanliggande timkörningar.
Nederbörden är den mest framhävda förbättringen. Modellen tränas på tre separata källor: ECMWF:s återanalys, NASA:s IMERG-satellitdata och en satellit- och radaråteranalys som utvecklats av Google. Detta ger en förbättring av CRPS-resultatet på upp till 60 % jämfört med IMERG, 30 % jämfört med MRMS och 10 % jämfört med regnmätare under de första prognosperioderna. Träningen på stationsdata riktar sig även mot kraftiga lokala variationer vid kuster, i dalar och berg samt i regioner i Latinamerika, Afrika och Asien-Stillahavsområdet som betjänas dåligt av alltför kostsamma regionala modeller. Särskilda variabler för förnybar energi kompletterar uppsättningen: vind på 100 meters höjd, motsvarande höjden på ett vindkraftverk, molnlager och komponenter i solinstrålningen.
| Egenskap | WeatherNext 2 | WeatherNext 3 |
|---|---|---|
| Upplösning | 0,25° (cirka 25 km) | 0,05° stationer, 0,1° yta, 0,25° trycknivåer |
| Tidssteg för initialisering | 6 timmar | 1 timme, 24 initialiseringar per dag |
| Ensemblemedlemmar | 64 | 64 |
| Prognoshorisont | anges inte i källan | 15 dagar (synoptiska cykler), 48 h (timkörningar) |
| Indata | analyser från fysikaliska modeller | direktsända satellitmosaiker och ECMWF HRES-analys |
Driftsättningen sker omedelbart i produkterna: redan i dag driver WeatherNext 3 väderupplevelser i Google Search, Gemini-appen, Google Maps, Weather API i Google Maps Platform och Google Earth Engine. Nederbördsprognoserna uppges vara upp till 50 % mer träffsäkra när planeringshorisonten är minst en dag. Utvecklare och forskare kan fråga efter data i BigQuery och Earth Engine eller ladda ned dem från Google Cloud Storage efter registrering på en åtkomstlista. Realtidsdata omfattas av experimentella villkor, medan historiska data som är äldre än en timme tillhandahålls under licensen CC BY 4.0. En viktig detalj för den som migrerar från WeatherNext 2 är att namnkonventionen ändras och att nederbörden nu ackumuleras över en timme i stället för sex, vilket innebär att de dagliga aggregeringarna måste ses över.
🔗 Vi presenterar WeatherNext 3 · 🔗 Dokumentation för utvecklare
Runway presenterar GWM Worlds 2, en interaktiv världsmodell i realtid med ljud
3 september — Runway lanserar GWM Worlds 2, den andra versionen av företagets världsmodell (world model) för simulering av interaktiva miljöer. Den första GWM Worlds, som presenterades i december 2025, fokuserade på den rumsliga samstämmigheten i långa rörelsesekvenser. Den här versionen lägger till ljud som genereras med 48 000 Hz samt detaljerad kontroll över subjekt och scen, med kontinuerlig video i 720p och 24 bilder per sekund. Tre dagar efter Solaris, företagets första världsmodell för gränssnitt, bekräftar Runway att arbetet är inriktat på kontinuerligt genererade världar i stället för klipp.
Kärnan i tillkännagivandet är formatet WorldPrompt, som skiljer det bestående från det föränderliga. Den bestående delen omfattar en ursprungsprompt som beskriver scenen, subjekten och deras egenskaper samt lagar som gravitation eller kollisioner, tillsammans med en första bild som förankrar återgivningen. Den dynamiska delen är ett flöde av tidsstämplade händelser: varje handling är en fritext med en start- och sluttid, riktad till ett subjekt eller till scenen, och flera handlingar kan överlappa varandra. Kameran styrs genom ett flöde per bildruta för förflyttning och rotation. Tal är en handling som alla andra och innehåller repliken som ska uttalas. Tekniskt sett finjusterar Runway sin dubbelriktade ljud- och videomodell för detta format och eftertränar den sedan som en autoregressiv modell som kan generera utan tidsgräns, med kausala video- och ljuddekodrar och ett glidande fönster för key-value-cache.
| Egenskap | GWM Worlds 2 |
|---|---|
| Video | kontinuerlig 720p, 24 bilder per sekund |
| Ljud | 48 000 Hz, genereras tillsammans med bilderna |
| Sessionslängd | utan fördefinierad gräns (autoregressiv modell) |
| Indata | WorldPrompt: beständig kontext och tidsstämplade händelser |
| Återupptagning från video | ja, exempel på prefill efter 8 sekunder |
| Multiplayer | separata roller, strömning via LiveKit |
| Status | forskningsförhandsvisning, endast företagskontakt |
Demonstrationerna visar en överlevare i en öken ur förstapersonsperspektiv, samma scen styrd från regissörsstolen, återupptagning av en session från en 8 sekunder lång video, en robot som på instruktion går till en röd och sedan en blå flagga samt ett multiplayerläge där varje roll styr sina egna subjekt. Runway skiljer mellan tre användningsområden: att skriva alla handlingar i förväg för film och reklam, att gå framåt tur för tur i en visuell roman samt realtid, vilket är mest krävande eftersom texten måste anlända med en latens på några tiotals millisekunder. Företaget medger att läget med fördefinierade handlingar fortfarande ger bättre kvalitet och redovisar öppet sina begränsningar: detaljförlust vid snabba kamerarotationer, bristfälligt långtidsminne, inga bildreferenser utöver den första bilden och behov av ett externt ramverk för att låta en icke-spelbar karaktär föra en dialog. Ingen offentlig åtkomst tillkännages, endast ett kontaktformulär för företag.
🔗 Vi presenterar GWM Worlds 2 · 🔗 Tillkännagivande på X
IFA 2026: NVIDIA PAIR fördelar lokal inferens mellan PC-datorer, och RTX Spark kommer i oktober
3 september — Vid öppningen av IFA i Berlin samlar NVIDIA och Microsoft flera tillkännagivanden kring ett gemensamt tema: att köra agenter lokalt på NVIDIA-hårdvara med mindre friktion. Tre av de mest använda agenterna får förenklad konfiguration av lokala modeller, alla byggda på llama.cpp. Hermes Agent från Nous Research identifierar GPU:n, väljer en lämplig modell och konfiguration och kör dem utan manuell nedladdning; Linux-versionen ska följa senare. OpenClaw, som beskrivs som GitHubs största AI-projekt med fler än 380 000 stjärnor, får en Windows-app som installerar en optimerad modell på alla RTX-GPU:er med minst 24 GB VRAM. När det gäller prestanda uppger NVIDIA att llama.cpp får upp till 1,9 gånger högre genomströmning på GeForce RTX 5090 tack vare kernel-optimeringar, förbättrad spekulativ avkodning och snabbare prefill, samt 1,2 gånger högre genomströmning för vLLM på RTX PRO 6000 Blackwell. Förbättringarna är tillgängliga via LM Studio och Ollama.
Den mest konkreta mjukvarunyheten är NVIDIA PAIR, en personlig AI-router (Personal AI Router). Utifrån konstaterandet att fler än hälften av de amerikanska hushållen har minst två PC-datorer som ofta står oanvända identifierar verktyget kompatibla maskiner i det lokala nätverket och dirigerar varje oberoende inferensförfrågan till den maskin som har ledig kapacitet. Det fungerar som en proxy framför gränssnitten för Ollama och LM Studio, vilket innebär att agenten förblir oförändrad och fortsätter att se en enda anslutning. Det tekniska blogginlägget som publicerades samma dag beskriver hur det fungerar: identifiering via mDNS eller tillägg med IP-adress, användargodkänd parkoppling, krypterad kommunikation via mTLS samt hänsyn till nodens tillgänglighet, exakt förekomst av den efterfrågade modellen och GPU-belastningen. PAIR slår inte ihop GPU:er och delar inte upp en modell: varje förfrågan körs i sin helhet på en nod. Betaversionen är gratis och open source på Windows, macOS och Linux.
| Tillkännagivande | Detalj |
|---|---|
| llama.cpp | upp till 1,9 gånger högre genomströmning på GeForce RTX 5090 |
| vLLM | 1,2 gånger på RTX PRO 6000 Blackwell, upp till 1,4 gånger på två DGX Spark |
| PAIR, hårdvara som stöds | GeForce RTX 20-serien och senare, RTX PRO (Turing och senare), DGX Spark, Apple M4 och senare |
| PAIR-demonstration | 18 minuter på enbart en bärbar dator jämfört med 8 min 48 s på tre maskiner |
| RTX Spark | RTX Blackwell-GPU med 1 petaflop, 128 GB enhetligt minne, Grace-CPU med 20 kärnor |
| Tillgänglighet för RTX Spark | oktober 2026, Lenovo och Acer ansluter sig till sex tillverkare |
En demonstration med fem underagenter på Qwen 3.6 35B A3B går från 18 minuter på en enda bärbar RTX Spark-dator till 8 minuter och 48 sekunder på ett kluster med tre maskiner, ett resultat som NVIDIA framhåller som specifikt för just den konfigurationen. Slutligen kommer Windows-datorerna RTX Spark i oktober: utöver de sex tillverkare som redan har tillkännagivits tillkommer Lenovo med Yoga Pro 9n och Yoga 9n 2-en-1 samt Acer med ett koncept för en kompakt stationär dator. Kretsen kombinerar en RTX Blackwell-GPU på en petaflop, upp till 128 GB enhetligt minne och en Grace-CPU med 20 kärnor, och använder det nya ramverket Windows Agent för att köra agenter i bakgrunden under systemets kontroll. Electronic Arts, Embark och Ubisoft ansluter sig till listan över partnerstudior, och CyberLink tillkännager ett AI PC-läge för PhotoDirector som integrerar lokala diffusionsmodeller, accelererade av TensorRT-RTX i FP8.
🔗 Lokal AI på IFA 2026 · 🔗 Tekniskt blogginlägg om NVIDIA PAIR
Perplexitys Portable Computer kommer till Linux för RTX med 24 GB
Den tredje agenten som NVIDIA nämner är Portable Computer, den helt lokala versionen av Perplexity Computer som lanserades den 25 augusti på DGX Spark. Den är nu tillgänglig på Linux för alla NVIDIA RTX-GPU:er med minst 24 GB VRAM, och en Windows-version har aviserats inom kort. Gränsen är inte godtycklig: den lokala orkestreraren, en 4-bitarskvantiserad Qwen 3.8 27B, väger 27,6 GB vid nedladdning och kräver 24 GB minne. Hela agentstacken körs på maskinen – orkestrerare, planerare, verktygsrouter och exekveringssandlåda – och arbete som behandlas lokalt debiteras inte per token. När ett steg kräver webben eller avancerat resonemang begär agenten tillstånd innan det dirigeras till någon av de fler än 15 molnmodellerna i katalogen. Installationen sker via ett apt-arkiv, anslutningarna till Gmail, Outlook, Slack och GitHub går genom den lokala orkestreraren, och åtkomsten är fortfarande begränsad till Pro- och Max-prenumeranter. Tillkännagivandet avslutar en tydligt lokal vecka för Perplexity, efter Hybrid Compute på Mac den 1 september och öppnandet av källkoden för Lily den 2 september.
Warp lanserar Factory Benchmarks, en testbädd för modeller byggd på varje teams koduppgifter
3 september — Warp öppnar Warp Factories Benchmarks för tidig åtkomst och presenterar dem som den första testbädden för modeller som genereras utifrån ett teams koduppgifter. Principen liknar SWE-bench eller Terminal-Bench, men använder verkliga uppgifter och varje teams egen kontext, vilket Warp bedömer som mer tillförlitligt än mättade offentliga dataset som förekommer i träningsdata. Verktyget fungerar både med frontier-modeller och modeller med öppna vikter; jämförelser mellan olika harnesses (Warp, Claude Code, Codex) har aviserats inom kort.
Ett benchmark består av en uppsättning agentuppgifter, valda bland tidigare runs eller skapade från grunden, en uppsättning factory-konfigurationer som jämförs genom variation av modell eller harness samt scorers som betygsätter varje run utifrån kostnad, kvalitet, korrekthet, utförlighet och effektivitet. Factoryn beskrivs i kod (en factory.yaml-fil och agentdefinitioner), alla spår bevaras – inom kundens säkerhetsperimeter för företag – och en run kan spelas upp på nytt från sitt ursprungliga git-tillstånd med valfri konfiguration. Scorers är bedömningsloopar med LLM (LLM-as-a-judge) enligt en matris som användaren definierar. Förmannen (foreman) genererar konfigurationen för ett benchmark från en instruktion i naturligt språk, och resultaten används av modelrouters som definieras i kod. Warp påpekar att dessa benchmarks inte är billiga och rekommenderar att de körs när en ny modell släpps eller när prompts, skills eller agentkontext ändras.
Introducing Factory Benchmarks: The first model bench generated from your own coding tasks. Measure, test and improve coding agents by replaying past agent runs, and cut cost-per-PR by 63%+
🇸🇪 Här är Factory Benchmarks: den första testbädden för modeller som genereras utifrån era egna koduppgifter. Mät, testa och förbättra era kodningsagenter genom att spela upp deras tidigare runs på nytt och minska kostnaden per PR med 63 % eller mer. — @warpdotdev på X
Illustrationen kommer från WarpBench, det interna benchmark som beskrivs i detalj på en sida daterad den 2 september: 30 uppgifter i storlekar från S till XL, fördelade mellan serverkod (Go, React) och klientkod (Rust), fem modeller jämförda i Warp Agent-harness, mindre än 30 minuters konfiguration och en run på 3 tim 46 min för 2 130,57 dollar. En första iteration hade visat att Grok 4.6 med high effort gav samma kvalitet som automatisk routing till Opus 5 för halva kostnaden. Warp gjorde därför modellen till sin standardagent för implementering, och kostnaden per slutförd PR sjönk från omkring 80 dollar till 30, utan någon minskning av merge-frekvensen, medan uppgiftsefterlevnaden ökade från 69 % till 87 %. Veckans utökade benchmark pekar ut GPT-5.6 Sol som den bästa avvägningen mellan kostnad och kvalitet. Den gjordes till standard den 1 september, med en väntad ytterligare förbättring på omkring 25 %.
| WarpBench-indikator | Uppmätt värde |
|---|---|
| Uppgifter i uppsättningen | 30 (storlekar S till XL, Go/React-server och Rust-klient) |
| Jämförda modeller | Opus 5, GPT-5.6 Sol, Gemini 3.7, Grok 4.6, GLM 5.3 Flash |
| Varaktighet och kostnad för hela runen | 3 tim 46 min, 2 130,57 dollar |
| Kostnad per slutförd PR | omkring 80 dollar, sänkt till 30 (−63 %) |
| Uppgiftsefterlevnad (scorers) | 69 % till 87 %, oförändrad merge-frekvens |
| Åtkomst | tidig åtkomst, upp till 10 000 dollar i kostnadsfri användning |
🔗 Introduktion till Factory Benchmarks · 🔗 WarpBench
OpenAI och cyberförsvar: en miljard till försvarare och en fabrik för kontinuerligt försvar
Daybreak for Frontline Defenders
3 september — Samma dag som en modell klassificerad som Critical lanseras tillkännager OpenAI Daybreak for Frontline Defenders: en miljard dollar i subventionerad åtkomst till företagets Daybreak-modeller för cybersäkerhet, tillsammans med utbildning, teknisk support och partnerskap, att användas under de kommande sex månaderna, först i USA och sedan i partnerländer ”under de kommande veckorna”. De prioriterade mottagarna är organisationer som försvarar åldrande system utan storföretagens resurser: vatten- och avloppsnät, elnätsoperatörer, delstater och kommuner, lokala banker, ideella organisationer och underhållare av open source-projekt. Den amerikanska delen omfattar dessutom ett pilotprojekt med MS-ISAC, informationsdelningscentret som betjänar tusentals offentliga organisationer, och OpenAI påminner om att företaget har erbjudit upp till en miljon dollar i API-krediter till verksamheter som drabbats av de senaste attackerna mot vattennät. Daybreak har redan tusentals försvarare i 2 000 godkända organisationer, och partnerna i Daybreak Defense Network tillkännager fler än 35 hanterade produkter och tjänster som integrerar dessa modeller.
| Del | Värde |
|---|---|
| Åtagande | 1 miljard dollar under sex månader |
| Organisationer som redan godkänts för Daybreak | 2 000 |
| Partnerprodukter och -tjänster | fler än 35 (Daybreak Defense Network) |
| Offentligt pilotprojekt | MS-ISAC (offentlig sektor och vattennät) |
| Möte för samhällsviktiga tjänster | 40 delstater och District of Columbia |
🔗 Daybreak for Frontline Defenders
The Defense Factory
Sidan Defense Factory, som enligt Daybreak-inlägget publicerades denna vecka, beskriver hur OpenAI omvandlade en intern säkerhetssprint till en kontinuerlig försvarsloop som drivs av agenter: inventering, upptäckt, dynamisk validering, tilldelning av en ansvarig person och verifierad korrigering, med en SECURITY.md-fil som gemensam kontext mellan iterationerna. Sprinten engagerade fler än 250 personer inom fler än 100 områden, och 53 brådskande eller prioriterade problem åtgärdades redan den första dagen. Resultaten anges i siffror: 90,6 % av agenternas föreslagna ansvarstilldelningar accepterades, 37 % av observationerna var dubbletter, 19,5 % reproducerades vid exekvering i isolerade miljöer, med 0,81 % falska positiva efter dynamisk validering och 0,53 % återkallade korrigeringar. Åtgärdsarbetet byggde helt på Codex. Referensarkitekturen exponerar befintliga verktyg (GitHub eller GitLab, Snyk, Semgrep, Tenable, Jira, Linear, ServiceNow) via MCP, CLI eller API, med tillfälliga miljöer och modellerna Sol, Terra, Luna, Daybreak Blue och Daybreak Red. Cloudflare, Ramp och Google utforskar liknande metoder.
Claude Code: ett förslag om TypeScript-hooks och version 2.1.259
Function Hooks, presenterade för communityn innan de byggs
3 september — Anthropic offentliggör ett internt förslag för Claude Code: Function Hooks. Utvecklarkontot presenterar det med två videor och klargör direkt att ingenting ännu har levererats. GitHub-issue nummer 91870 säger uttryckligen att communityns reaktion sannolikt avgör om funktionen blir verklighet. I dag är Claude Codes hooks shell-kommandon som deklareras i en inställningsfil. Förslaget ersätter dem med TypeScript-funktioner som registreras för händelser och kopplas samman i en kedja av middlewares, på samma sätt som i Express eller Koa, med en continuation next: registreringsordningen avgör nästlingen, och det plugin som registreras först omsluter de efterföljande och har därmed större behörighet. Kärnan i förslaget är ett parametriserat $-objekt, den enda tillåtna kanalen för sidoeffekter, utan omgivande åtkomst till filsystemet eller nätverket. Vad ett plugin har gjort kan då sammanfattas exakt genom de anrop det skickade, vilket gör varje åtgärd granskningsbar, möjlig att godkänna, neka eller logga. En administratör kan dessutom ta bort en behörighet så att inget som registrerats längre ned kan anropa den. Återkopplingen gäller beteendet vid undantag, den maximala tidsgränsen per hook och framför allt framtiden för de nuvarande shell-hooks, som vissa användare vill behålla som komplement.
Boris Cherny, ansvarig för Claude Code, delar förslaget vidare och frågar användarna direkt om de skulle använda det. Han beskriver idén som lite galen och mycket spännande. Ett arkitekturdokument och nio videor medföljer issuen, och författaren förtydligar i tråden att åtkomst till filsystem, nätverk och processer med största sannolikhet kommer att finnas. Målet är inte att begränsa plugins, utan att låta varje effekt passera genom en enda kanal så att administratören kan granska den.
🔗 Presentation av Function Hooks · 🔗 GitHub-issue 91870
Claude Code 2.1.259, hanterade MCP-servrar och skärpta regler för nekande
3 september — Version 2.1.259, som publicerades under natten, är betydligt mer omfattande än 2.1.258, som enbart åtgärdade starten på macOS Monterey. Två tillägg riktar sig till administrerade driftsättningar: inställningen managedMcpServers gör det möjligt för en organisation att tillhandahålla HTTP- eller SSE-baserade MCP-servrar till alla sina användare, medan poster som anger ett lokalt kommando som ska köras ignoreras. Flaggan --permission-prompts none är avsedd för obevakade headless-värdar, där allt som annars skulle ha utlöst en fråga nekas automatiskt samtidigt som det aktiva behörighetsläget fortsätter att fatta beslut. I samma anda ignoreras inte längre en hanterad inställningsfil som inte kan tolkas: Claude Code vägrar att starta och anger den felaktiga källan. På säkerhetssidan omfattar reglerna för nekande Bash Read() nu filer som skickas som alternativvärden, operander till git diff och git grep samt sammansatta kommandon av typen cd DIR && cat FILE. En viktig korrigering gäller samtidiga sessioner, som tyst skrev över varandras ändringar i användarens konfigurationsfil, vilket ledde till att förtroendet för workspacet och MCP-tillståndet gick förlorade. En beteendeförändring förtjänar administratörernas uppmärksamhet: allowedMcpServers styr nu endast servrar som användarna lägger till, och deniedMcpServers måste användas för att blockera en hanterad server. Versionen känner även igen GitLab-kommandon för merge requests och lägger till JSON-utdata för validering av plugins.
🔗 Versionsinformation för 2.1.259
GitHub Copilot: innehållsundantag, Gemini 3.8 Flash, fyra utfasningar och stramare prissättning
Innehållsundantag gäller för Copilot-appen och CLI
2 september — GitHub Copilot-appen och Copilot CLI följer nu de policyer för innehållsundantag (content exclusions) som definieras av administratörer på företags-, organisations- och arkivnivå. Frågan är särskilt relevant för agentbaserade arbetsflöden: agenten utforskar arkivet på eget initiativ, och en policy som endast tillämpas på kompletteringar i editorn skulle släppa igenom hemligheter, konfigurationsfiler eller kod med restriktiva licenser som organisationen ville hålla utanför. Undantagna filer används inte längre som kontext, oavsett vilken uppgift agenten får. Funktionen är allmänt tillgänglig och begränsad till Business- och Enterprise-kunder; individuella konton har inte tillgång till dessa policyer.
🔗 Content exclusions i appen och CLI
Gemini 3.8 Flash kommer till Copilot till samma pris som sina föregångare
3 september — Tjugofyra timmar efter Googles lansering läggs Gemini 3.8 Flash till i Copilots modellväljare för abonnemangen Pro, Pro+, Max, Business och Enterprise, med en gradvis utrullning på åtta plattformar: Visual Studio Code, Visual Studio, Copilot CLI, molnagenten, Copilot-appen, JetBrains IDE:er, Xcode och Eclipse. GitHub sammanfattar sina första tester i två punkter: goda prestanda för komplexa koduppgifter som utförs i terminalen och ihärdig återhämtning efter åtgärdbara fel. Det mest konkreta gäller priset: modellen kostar 0,75 dollar per miljon tokens för indata, 0,075 för cachelagrad indata och 3,75 för utdata, fram till den 31 december 2026. Det är exakt samma kampanjpriser som redan gäller för Gemini 3.6 Flash och 3.7 Flash fram till samma datum: generationsbytet sker till oförändrat pris.
🔗 Gemini 3.8 Flash i GitHub Copilot
Ytterligare fyra modeller lämnar Copilot den 2 oktober
3 september — Två dagar efter att sex modeller faktiskt tagits bort tillkännager GitHub nästa omgång. Fyra modeller försvinner den 2 oktober 2026 från alla Copilot-upplevelser, inklusive chatt, inline-redigeringar, ask- och agent-lägen samt kodkompletteringar.
| Modell som fasas ut | Utfasningsdatum | Föreslaget alternativ |
|---|---|---|
| Gemini 3.5 Flash | 2 oktober 2026 | Gemini 3.8 Flash |
| Gemini 3.6 Flash | 2 oktober 2026 | Gemini 3.8 Flash |
| Kimi K2.7 Code | 2 oktober 2026 | Kimi K3 |
| Claude Opus 4.7 | 2 oktober 2026 | Claude Opus 5 |
Logiken är att katalogen koncentreras kring den senaste generationen från varje leverantör. Business- och Enterprise-administratörer kan behöva aktivera åtkomst till ersättningsmodellerna i modellpolicyerna, men ingen åtgärd krävs för att ta bort de utfasade modellerna.
🔗 Kommande utfasningar i Copilot
Återöppning av registreringen för Business och Enterprise, med förskottsbetalning för platser
3 september — GitHub återöppnar gradvis, under cirka två veckor, registreringen för Copilot Business och Enterprise för kunder som betalar med bankkort eller PayPal. Som skäl anges tjänsternas tillgänglighet och tillförlitlighet, som företaget avser att förbättra genom förstärkt kontoverifiering. Faktureringsändringen är det viktigaste för små team: varje ny tilldelning av en plats måste betalas innan användaren får åtkomst, och samtliga tilldelade platser kommer att faktureras i förskott under nästa faktureringsperiod, även för befintliga kunder från och med den 1 oktober 2026. Om den inkluderade användningen överskrids kan en extra betalning krävas för att arbetet ska kunna fortsätta, och den inkluderade användningen kan proportioneras över månaden. Priserna för abonnemangen, proportioneringen av platser och köpen av ytterligare användning förblir oförändrade. GitHub tillägger att en fullständig uppsägning av Copilot följd av en återkomst kan utlösa de nya procedurerna, vilket motverkar tillfälliga uppsägningar.
🔗 Återöppning av registreringen för Copilot Business och Enterprise
Hugging Face publicerar tre arbeten samma dag som företaget köps upp
funes, ett beständigt och lokalt minne för kodagenter
3 september — Hugging Face publicerar funes, ett lager för beständigt minne åt kodagenter, byggt från spår av sessioner som redan finns på maskinen. Utgångspunkten är trivial men behandlas sällan: varje ny agent återupptäcker projektet som en främling, och förra veckans resonemang försvinner med sessionen. Installationen består av en enda binärfil och därefter ett kommando per agent, funes add claude (eller codex, pi, hermes), som skapar det första indexet, gör verktygen recall och get tillgängliga för agenten och installerar automatiseringen som indexerar varje slutförd tur. Under huven omvandlar en deterministisk pipeline varje spår till turer och block, delar upp dem, bäddar in dem med en fixerad lokal modell och skriver dem till en lokal Lance-datauppsättning. En förfrågan kombinerar vektorsökning och BM25, sammanfogar rangordningarna, rangordnar på nytt med en korsenkodare (cross-encoder rerank) och viktar om efter aktualitet. Ingenting destilleras vid skrivning: recall returnerar originaltexten med dess exakta proveniens. Allt förblir lokalt som standard, utan konto eller fjärrlagringsplats. Delning är valfri och sker via en privat datauppsättning på Hub, där identifierare rensas bort vid indexeringen och därefter i ytterligare en omgång före publiceringen. I ett test med två uppgifter vars svar inte kan återskapas utan det tidigare sammanhanget lyckades komprimering, standardbeteendet hos de flesta agenter, med den ena uppgiften men misslyckades med den andra eftersom sammanfattningen hade plattat till de användbara slutsatserna. Återkallning var samtidigt den billigaste av de tre kanalerna, åtta gånger billigare än en skriftlig överlämning för den ena uppgiften och fyra gånger billigare för den andra.
🔗 funes
NeoMME, två multimodala enkodare tränade från grunden utan visionstorn
3 september — H Company publicerar NeoMME, en familj med två flerspråkiga multimodala enkodare med 260 respektive 800 miljoner parametrar, under licensen Apache 2.0 och med en implementering i Transformers redan från första dagen. Det särskilda ligger i arkitekturen. De flesta system för hämtning av visuella dokument härstammar från generativa vision-language-modeller, där en förtränad vision-enkodare matar en kausal avkodare. Sökning och klassificering genererar dock inte text autoregressivt och behöver därför varken denna avkodare eller den extra parameterbörda som den medför. NeoMME tar bort båda: en enda dubbelriktad transformer bearbetar texttokens och råa bildpatchar på 32 gånger 32 och tränas från grunden med ett mål baserat på maskerad diskret diffusion. På benchmarken ViDoRe v3 når modellen med 260 miljoner parametrar 0,523 i nDCG@10, det bästa resultatet bland modeller med strikt färre än 800 miljoner parametrar och bara 0,002 från ColQwen2.5, som har omkring fjorton gånger fler parametrar. Modellen med 800 miljoner når 0,556. Den mest konkreta aspekten för driftsättning är fortfarande indexets storlek: genom att kombinera hierarkisk token-pooling och asymmetrisk kvantisering minskar teamet storleken från 1,5 MB till 39 kB per sida samtidigt som mer än 99 % av referensresultatet bevaras, och ända ned till 6 kB per sida, det vill säga 255 gånger mindre, samtidigt som mer än 95 % bevaras.
🔗 NeoMME
IBM placerar fyra tidsseriemodeller i Confluent-flöden
2 september — IBM Research och Confluent öppnar tidig åtkomst till fyra grundmodeller för tidsserier som körs direkt i dataflöden, utan export till en separat plattform för maskininlärning. Alla fyra modellerna anropas via de befintliga Flink SQL-funktionerna AI_FORECAST och AI_DETECT_ANOMALIES, och valet görs med en enda parameter utan att pipelinen behöver göras om. PatchTST-FM läser en serie på samma sätt som en språkmodell läser text, patch för patch och med varje variabel i sin egen kanal, och returnerar en fullständig fördelning. FlowState upprätthåller en löpande sammanfattning som uppdateras vid varje datapunkt, med kontinuerlig tidsdynamik. TTM ersätter attention med små blandningsnätverk: en modell med en miljon parametrar hanterar 100 000 serier varje natt på en processor. TSPulse kombinerar tids- och frekvensvyer för avvikelsedetektering, klassificering och ifyllnad av luckor. Fördelen med placeringen i flödet ligger i tillståndshanteringen, som Flink sköter per serie och feltolerant, vilket eliminerar behovet av ett separat datalager. Vikterna förblir öppna på Hub och inferensen kan köras på användarens processorer utanför Confluent. IBM uppger över 44 miljoner nedladdningar och produktivitetsvinster på 5 till 10 gånger hos sina designpartner inom cement, stål, massa och papper, livsmedel samt telekommunikation. Åtkomsten öppnas i Confluent Cloud på AWS utan debitering under perioden.
🔗 Tidsseriemodeller i Confluent
Qwen publicerar ett benchmark för handel över 365 dagar och en modell för autonom körning
E-Commerce Bench, 18 agenter driver en butik under ett simulerat år
3 september — Qwen-teamet publicerar tillsammans med Taobao & Tmall Group ett benchmark som utvärderar en agent som näthandlare under ett helt år. Utgångspunkten är att de flesta agentutvärderingar ger ett avgränsat mål med en naturlig slutpunkt, medan driften av en butik aldrig blir färdig. Agenten börjar med 100 000 yuan, kan öppna upp till fyra butiker bland tolv typer och hanterar under 365 simulerade dagar inköp, förhandlingar, prissättning, kampanjer, lager och likviditet. Miljön bygger på avidentifierade verkliga data, 6 886 produkter i 60 kategorier och 576 leverantörer, varav 152 är bedrägliga, samt på en tidsbudget där varje verktygsanrop förbrukar minuter av dagen. Det mest anmärkningsvärda tekniska valet är en deterministisk förhandlingskärna: varje offert eller eftergift från en leverantör kommer från en fast kärna, medan en språkmodell bara omvandlar den till dialog. Därmed kan en agent inte prata ned priset under kostnadsgolvet.
| Utvärderad modell (18 totalt) | Tillgångar vid årets slut (tusen yuan) | Multipel på insatsen | Inköp från bedragare |
|---|---|---|---|
| GPT-5.6 Sol | 1 431 | 14,31 gånger | 18,48 % |
| Fable 5 | 805 | 8,05 gånger | 3,46 % |
| Claude Opus 4.8 | 498 | 4,98 gånger | 5,41 % |
| Qwen3.8-Max-Preview (bästa öppna vikter) | 416 | 4,16 gånger | 6,13 % |
| Claude Opus 4.7 | 259 | 2,59 gånger | 0,12 % |
Det mest användbara resultatet ligger i de sex dimensioner som kompletterar tillgångarna vid årets slut: ingen modell dominerar överallt, och de bästa resultaten per dimension är fördelade över sex olika modeller. Den främsta modellen i fråga om vinst hamnar bara på sextonde plats när det gäller att undvika bedrägerier. Alla modeller kontaktar samma andel bedragare; skillnaden uppstår när beställningen ska läggas. Slutligen betalar femton av arton modeller, vid 8 647 återköp av samma produkt från samma leverantör, betydligt mer än vid en slumpmässig ordning av deras egna priser: efter ett år köper de inte bättre. Koden publiceras under licensen Apache 2.0.
🔗 E-Commerce Bench · 🔗 Qwens inlägg
Qwen-Drive-1.0, en modell för autonom körning med öppna vikter
3 september — Qwen publicerar tillsammans med Huazhong University of Science and Technology sin första vision-language-grundmodell för autonom körning, under licensen Apache 2.0. Grundidén är att lämna arkitekturen hos basmodellen Qwen3.5-4B orörd, så att den förblir en generell multimodal modell, och koppla två externa moduler till den. Ett perceptionshuvud med vy ovanifrån (bird’s eye view) utför gemensamt 3D-objektdetektering, prediktion av semantisk beläggning och kartsegmentering, och fungerar som en inspekterbar sond för vad modellen förstår av scenen. En planerare, en diffusionstransformer som är konditionerad på modellens representationer, genererar genom flödesmatchning (flow matching) fordonets trajektorier över 5 sekunder vid 10 Hz. Träningen sker i etapper och använder endast offentliga data, 2,83 miljoner exempel för planeringen. På frågor och svar om körning får den finjusterade varianten ett genomsnitt på 69,43 och överträffar både de testade generella modellerna och de inbyggda specialistmodellerna, med 77,8 på LingoQA jämfört med 70,4 för basmodellen, samtidigt som den generella förmågan förblir nära basmodellens. För planering når den variant som optimerats med förstärkningsinlärning ett PDMS-resultat på 90,7 i NAVSIM. Vikterna ryms i en katalog på 9,1 GB för modellen och de tre huvudena, och en GPU med 24 GB rekommenderas. Författarna påpekar själva att samstämmigheten mellan det textuella resonemanget och den producerade trajektorien fortfarande behöver förbättras.
SpaceXAI beskriver Grok Bots gränssnitt och ber om ursäkt efter avbrottet i Memphis
Så utformades Grok Bot för beständiga agenter
3 september — SpaceXAI publicerar ett långt designinlägg om Grok Bot, företagets produkt för beständiga agenter som lanserades i beta den 11 augusti. Teamet utgick från den uppsjö av koncept som AI-produkter har samlat på sig – sessioner, kontextfönster, minnen, anslutningar, sandlådor och behörigheter – och behöll bara fem för användaren: Bots, beständiga agenter med en identitet, ett minne, en runtime och verktyg; Chats; Prompts, som kan sparas som Skills eller utlösas som Routines; Tools; och Artifacts. En direkt följd är att sidofältet inte längre visar en historik över tillfälliga konversationer utan en lista över Bots, var och en med sitt namn, sin avatar, sina minnen och sin egen dator. Avataren visar Botens tillstånd genom sin animation: inaktiv, tänkande, arbetande, väntande, blockerad eller färdig. Det är en kompromiss som hittades efter tester där tre animerade punkter gav för lite information och den fullständiga loggen för mycket. Botens dator visas på tre nivåer: en statusikon, en sidopanel med förhandsvisning och helskärmsövertagande när Boten ber om hjälp. Ju mer synlig den var i testerna, desto mer började användarna övervaka den. Verktyg och Skills delas på kontonivå, medan minnet och Routines tillhör Boten, med praktiska gränser på omkring 50 Bots per konto och sex per gruppkonversation.
Avbrott i datacentret i Memphis
3 september — Sent på kvällen bekräftar SpaceXAI offentligt ett avbrott som inträffade samma morgon i företagets datacenter i Memphis, där superdatorn Colossus är installerad. Meddelandet innehåller en ursäkt till Grok-användarna, men också – och det är den anmärkningsvärda punkten – till de berörda beräkningspartnerna: Memphis hyser inte bara företagets egna modeller, utan företaget säljer även kapacitet där, bland annat till Anthropic sedan avtalet om åtkomst till Colossus 1 som tillkännagavs den 6 maj. Vid granskningstillfället angav SpaceXAIs statussida ingen incident, men dess tillgänglighetskurvor visade fortfarande inferensnivåer strax under 100 % på flera regionala åtkomstpunkter. Claudes statussida listar samma dag en incident med förhöjda felfrekvenser för flera modeller, öppnad kl. 13.26 och avslutad kl. 16.16 UTC. Inget av företagen kopplar incidenten till avbrottet i Memphis, och sammanträffandet i tid är det enda som kan observeras. Under tiden tog två kinesiska laboratorier tillfället i akt: Z.ai publicerade det lakoniska ”We’re still up”, och Qwen vidarebefordrade ett meddelande från sitt molnerbjudande med en uppmaning att komma och bygga hos dem.
Generativa medier: fyra tillkännagivanden samma dag
HUMAIN-M3, en arabisk modell byggd på MiniMax M3
3 september — HUMAIN, det saudiska AI-företaget, presenterar HUMAIN-M3, en arabisk språkmodell som företaget beställt av MiniMax och som finns tillgänglig som forskningsförhandsvisning på plattformen HUMAIN Node. MiniMax beskriver receptet: modellen utgår från basen MiniMax M3, företagets modell med öppna vikter som släpptes den 1 juni, och får därefter ytterligare träning på mer än en biljon arabiska tokens, med målet att täcka regionala språk och dialekter och inte en enda standardiserad arabiska. För MiniMax sträcker sig intresset bortom den arabiska marknaden: företaget ser det som en demonstration av att en öppen grundmodell kan lokaliseras och vidareutvecklas av en tredje part för att bygga ett regionalt ekosystem. Det är också en anmärkningsvärd industribeställning till ett kinesiskt laboratorium från en aktör i Gulfregionen. Varken storlekar, benchmarks eller åtkomstvillkor utöver forskningsförhandsvisningen anges i tillkännagivandena.
Synthesia lanserar Assistant, företagsvideo från en prompt
3 september — Synthesia presenterar Assistant, ett sätt att producera företagsvideor från en enkel prompt. Användaren laddar upp ett dokument eller anger en URL, eller beskriver behovet i fritext. Assistant skapar ett första utkast på några minuter med hjälp av kontots varumärkesprofil, varefter videon kan omarbetas genom dialog i en konversation utan att redigeringen behöver göras om från början. Tillkännagivandet ingår i kapplöpningen om videoagenter mellan avatarplattformar. Meddelandet anger varken vilka abonnemang som omfattas, vilka språk som stöds eller någon lanseringstidsplan, och ingen särskild sida fanns på webbplatsen vid granskningstillfället.
ElevenLabs samarbetar med Genesys om röstbaserade företagsagenter
3 september — ElevenLabs tillkännager ett samarbete med Genesys, leverantören av kontaktcenterplattformen Genesys Cloud. Två integrationssätt erbjuds: att infoga ElevenAgents i kundresan bredvid Genesys virtuella agenter genom att samordna arbetsfördelningen mellan dem, eller att behålla Genesys-agenterna och ge dem en av ElevenLabs uttrycksfulla röster. Tillkännagivandet bygger vidare på strategin att placera dessa agenter i kundtjänstens stora kanaler. Meddelandet specificerar varken regional tillgänglighet, prissättning eller tidsplan.
🔗 Samarbetet mellan ElevenLabs och Genesys
Midjourney inför redigeringsmodellen V8.2 i lightbox-vyn
3 september — Midjourney publicerar en ändringslogg för sin alpha-webbplats, där teamet bygger om gränssnittet kring redigeringsmodellen V8.2 som började testas veckan innan. Den huvudsakliga förändringen är en redigerare integrerad i lightbox-vyn: man öppnar en bild, beskriver ändringen med naturligt språk, bifogar upp till fyra referensbilder och alla redigeringar från sessionen förblir synliga på samma plats. Teamet experimenterar också med en funktion för stilbyte, som presenteras som början på en mer intuitiv utforskning av stilrymden, och fortsätter arbetet med promptfältet, en känd friktionspunkt sedan alpha-versionen lanserades. Resten består av korrigeringar och hastighetsförbättringar. En minut senare efterlyser Midjourney idéer, med en formell omröstning planerad inom en till två veckor för att fastställa prioriteringarna.
🔗 Midjourneys uppdateringslogg
Antigravity CLI 1.1.24 och 1.1.25: vy per arbetsyta, Gemini 3.8 Flash via API-nyckel och kommentarer i MCP-konfigurationen
2 och 3 september — Antigravity CLI:s ändringslogg presenterar två versioner på två dagar. 1.1.24 är en underhållsversion: omarbetad navigering i panelen /mcp, stöd för kommentarer och avslutande kommatecken i mcp_config.json samt korrekt stängning av strömmar i headless-läge, där CLI:t nu anger attributet för stängning vid körning på de bevarade deskriptorerna så att underprocesser inte längre håller anroparens pipes öppna. De övriga korrigeringarna gäller dubbletter i agentväljaren, start från en borttagen arbetskatalog och frågor som ställdes vid sidan av och utlöste oönskade verktygsanrop medan ett aktivt mål pågick.
1.1.25 innehåller tre nyheter. Väljaren för att återuppta sessioner får en valfri vy grupperad efter arbetsyta, med möjlighet att växla mellan en platt lista och gruppering efter katalog. Gemini 3.8 Flash, som lanserades dagen innan, läggs till i modellkatalogen för användare som är anslutna med en API-nyckel. Slutligen ärver anpassade agenter som definieras i Markdown nu som standard omgivande skills, regler och underagenter, vilket gör dem enhetliga med standardagenterna. De sju korrigeringarna omfattar OAuth-autentisering för MCP-servrar när auktoriseringskoden överstiger 1 024 tecken, klassificering av skills i Windows där sökvägsavgränsare gjorde att globala skills förväxlades med skills för arbetsytan, ansamling av dubbla behörigheter mellan sessionsomladdningar samt en krasch orsakad av en nullpekare som utlöstes av sammanfattningsuppdateringar i bakgrunden.
| Version | Datum | Förbättringar | Korrigeringar | Höjdpunkter |
|---|---|---|---|---|
| 1.1.24 | 2 september | 1 | 6 | navigering i MCP-panelen, kommentarer i konfigurationen, headless-strömmar |
| 1.1.25 | 3 september | 3 | 7 | återupptagning per arbetsyta, Gemini 3.8 Flash via API-nyckel, arv för Markdown-agenter |
SDK:t låg steget före: Antigravity SDK 0.1.16, som publicerades den 31 augusti, gör Gemini 3.8 Flash till standardmodell för nya agenter två dagar före det offentliga tillkännagivandet av modellen, lägger till en förenklad konfiguration för små lokala modeller och Vertex AI:s Express-läge via API-nyckel.
Google Pics, Workspace-verktyget för att skapa och redigera bilder
1 september — Google presenterar Google Pics, ett verktyg för att skapa och redigera bilder som hör till Google Workspace och bygger på modellen Nano Banana. Det lanseras under de kommande veckorna för alla Google AI Pro- och Ultra-prenumeranter samt för de flesta Workspace-företagskunder, både som en fristående produkt som nås via pics.new och integrerad i apparna: integreringen börjar i Docs och Slides, och Drive följer därefter. De framhävda funktionerna handlar mer om precisionsredigering än om ren generering: objektsegmentering för att isolera och omvandla ett element utan att påverka resten, med textkommentarer riktade mot specifika områden och flera ändringar som utförs samtidigt; redigering och översättning av text direkt i bilden utan att förstöra layouten eller ändra typsnittet; gemensam redigering av samma bild; samt generering av flera varianter från en enda prompt. Google påminner om att miljontals användare varje månad hanterar miljarder bilder i Workspace, därav målet att kunna redigera där man redan arbetar.
Codex CLI 0.153.0: undo i Vim, fjärrplugins, automatisk återanslutning och experimentell kontexthantering
3 september — Codex CLI 0.153.0 släpps tidigt på morgonen, några timmar före tillkännagivandet av GPT-6 Astra, och levererar den komponent som modellens blogginlägg beskriver som dess nya kontexthantering. Alternativet features.context_management.experimental_mode, som är inaktiverat som standard, aktiverar tokenbudgeterad kontext, historikanteckningar och ett new_context-verktyg för ChatGPT Plus-, Pro- och Pro Lite-sessioner på Codex-backend; OpenAI presenterar detta som det framtida standardvärdet för Astra. Sessioner med API-nyckel, anpassade leverantörer och tillfälliga strukturerade trådar omfattas fortfarande inte.
Resten av versionen förbättrar terminalupplevelsen: undo och redo i Vim-läge med bevarande av inklistrade utkast, hantering av plugins från fjärranslutna marketplaces, inställningen tui.auto_recap = false som stänger av automatiska sammanfattningar men behåller /recap samt en tidigare varning för Plus- och Team-prenumeranter så snart mindre än hälften av kvoten för ett fönster på cirka fem timmar återstår. TUI-sessioner återansluter efter ett avbrott i den externa app-servern och behåller utkast och transkriptioner. Guardian-granskningarna justeras: Full Access hoppar över dem för åtgärder som endast kräver bekräftelse, och deras historik överlever compaction, omstarter och forks. App-servern stöder strukturerade asynkrona frågor via request_user_input_async, medan harness-sidan hanterar icke-blockerande frågor som Astra ställer samtidigt som arbetet fortsätter.
🔗 Versionsinformation för rust-v0.153.0
v0 publicerar GitHub-projekt i ett steg, från arbetsgren till produktion
1 september — I sin ändringslogg samlar v0 publiceringsflödet för projekt kopplade till GitHub. Varje ändring commitas till en isolerad arbetsgren och får en preview-deployment. Vid publicering räcker det med ett enda klick på knappen Publish: v0 skapar eller återanvänder pull requesten, mergar den till basgrenen och driftsätter det mergade resultatet i produktion. En grenmeny samlar relaterade åtgärder: senaste preview, diff mot basen, skapande eller merge av en pull request, status för CI-checks och regler i repositoriet, hämtning av ändringar från basen eller möjlighet för v0 att åtgärda ett preview-, CI- eller mergeproblem utan att lämna konversationen. Repositoriet förblir källan till sanningen: obligatoriska checks, granskningar, mergerestriktioner och grenskydd fortsätter att gälla. Om en regel kräver mänskligt ingripande pausar v0 flödet och hänvisar till pull requesten i stället för att kringgå regeln.
Cohere Labs publicerar 696 291 MCP-verktyg och mäter vad agenter faktiskt automatiserar
3 september — Cohere Labs publicerar ATE, en förkortning för ekosystem för agentbaserade uppgifter (Agentic Task Ecosystem), en datamängd med 696 291 verktyg från 123 069 offentliga MCP-servrar, insamlade i maj 2026 från sju kataloger och därefter deduplicerade. Författarnas idé är att varje publicerat verktyg utgör en liten daterad registrering av en uppgift som en utvecklare har bedömt vara tillräckligt konkret för att anförtros åt en maskin. Det är en utbudssignal som kompletterar studier av teoretisk exponering, och den kommer innan det finns några användningsdata. Varje verktyg matchas med den närmaste beskrivningen av en yrkesuppgift i det amerikanska arbetsmarknadsdepartementets O*NET-databas. Därefter bedömer en modell om verktyget utför uppgiften från början till slut, med uteslutning av verktyg som bara ger information till personen som utför den.
| Mått | Värde |
|---|---|
| Registrerade verktyg | 696 291 på 123 069 offentliga MCP-servrar |
| Verktyg som utför en uppgift från början till slut | 2,6 % (18 058 matchningar) |
| Yrken utan något agentbaserat verktyg | 419 av 923 |
| Uppgiftsbeskrivningar som täcks | 1 380, cirka 15 % av det arbete som kan utföras av mjukvara |
| Kategorier av omatchade verktyg | 1 136, varav endast 35 gäller verkligt nytt arbete |
| Korrelation mellan teoretisk exponering och faktisk täckning | 0,54 för 178 yrken |
Enligt detta strikta kriterium utför ungefär ett verktyg av fyrtio en registrerad uppgift från början till slut, en siffra som författarna beskriver som en nedre gräns eftersom företagens interna servrar inte syns i offentliga kataloger. De återstående 98 procenten utgör dock inte helt nytt arbete: grupperade efter likhet fördelar de sig mellan befintligt arbete beskrivet på en finare detaljnivå än i yrkesdatabaserna, kedjor av flera uppgifter, infrastruktur som krävs för att agenterna själva ska fungera och endast 3 procent verkligt nya kategorier, nästan alla kopplade till agenthantering. Jämförelsen med teorin är det mest intressanta bidraget: exponeringspoängen visar väl hur stor del av ett yrke som kan nås, men inte vilken del det är, eftersom korrelationen med de verktygsstödda uppgifternas position i ett yrkes arbetsmix inte går att skilja från noll. Det som experter bedömer vara tekniskt genomförbart förutsäger vad som byggs; det som arbetstagare vill automatisera förutsäger ingenting. Slutligen riktar sig verktygen mot den specialiserade kärnan i vård- och IT-yrken, medan de inom juridik, produktion och försäljning stannar vid rutinmässiga uppgifter i periferin.
🔗 Automationens tidiga avtryck · 🔗 ATE-datamängden
Kortnotiser
- WebMCP Challenge förlängs med 12 timmar — efter ett avbrott i OpenAI:s tjänster under den 3 september skjuts ansökningstiden fram till klockan 01.00 Stillahavstid, enligt ett meddelande som delats av OpenAI:s utvecklarkonto. 🔗 Meddelande
- Ploy AI samordnar sina marknadsföringskampanjer med GPT-5.6 Sol-underagenter — en 1 minut och 17 sekunder lång vittnesmålsvideo om Bryant Chous team, utan siffror eller tekniska detaljer i tweeten. 🔗 Video
- Replit lyfter fram analysdata för sina publicerade appar — två tweets om användningsstatistik för publicerade applikationer och tillägg av anpassade händelser som föreslås av Replit Agent, utan blogginlägg eller lanseringsformulering: den befintliga instrumentpanelen Growth fanns redan, och Agents förslag på mätvärden är den enda möjliga nyheten. 🔗 Tweet
- Replit firar sitt Londonkontor den 10 september — en kväll som arrangeras tillsammans med OpenAI, med ett samtal mellan Paul Graham och Amjad Masad, som en fortsättning på öppnandet av det första internationella kontoret som tillkännagavs den 28 augusti. 🔗 Meddelande
- Hundra GRPO-steg ger en modell med 350 miljoner parametrar sju poängs förbättring — ett Hugging Face-recept finjusterar LFM2.5-350M på omkring 500 exempel och 100 träningssteg, dimensionerade för en kostnadsfri GPU, och höjer IFStruct-poängen från 22,6 % till 29,7 %, med förbättringen koncentrerad till JSON och listor utan extra formatering. 🔗 Recept
- Att lära en kodmodell att måla med akvarell — en öppen reproduktion av förstärkningsinlärning där Qwen3.5-35B-A3B skriver den JavaScript-kod som målar bilden, med en estetisk belöning baserad på en pool med 178 manuellt bedömda målningar. 🔗 Inlägg
- En fotbollsliga för robotar publicerar 240 016 rörelsebilder — 16 matcher mellan simulerade humanoida robotar, motsvarande 160 minuters poser vid 25 Hz under licensen CC BY 4.0, användbara för trajektorieförutsägelse men uttryckligen inte för policyinlärning eftersom ledvinklar saknas. 🔗 Dataset
- 279 prolinfria VHL-bindare publiceras som öppna hypoteser — genererade molekyler som upptar referensstället utan det dominerande motivet i litteraturen, med en polär medianarea på 89,6 jämfört med 111,6 kvadratångström och förankring i ryggraden snarare än i sidokedjor. 🔗 Publikation
- VT Code, ett år senare — den Rust-skrivna kodagenten för terminalen når version 0.154.0 med fler än 26 modellleverantörer och omkring trettio crates, utan att något av dessa tillägg har påverkat agentloopen. 🔗 Tillbakablick
- Podcast med Google DeepMinds Chief AI Architect — Koray Kavukcuoglu talar i omkring 27 minuter om frontlinjemodeller, ambitionerna för Gemini 4:s förträningskörning, avsaknaden av ett test för AGI och övergången till agentbaserad kodning. 🔗 Avsnitt
- Gemini Notebook sätter siffror på vinsten med sina flexibla gränser — som en fortsättning på meddelandet den 28 augusti uppger teamet att gratiserbjudandet under 24 timmar ger 3 gånger fler ljudsammanfattningar, 10 gånger fler rapporter och 20 gånger fler quiz och minneskort, med senarelagd generering av artefakter. 🔗 Meddelande · 🔗 Förtydliganden
- Copilot app for Beginners, avsnitt 5 — Kayla Cinnamon visar hur flera agentsessioner kan köras parallellt i GitHub Copilot-appen, var och en i sitt eget Git-worktree och med sin egen kontext. 🔗 Avsnitt
- GitHub Podcast reder ut agenternas vokabulär — Cassidy Williams kompletterar avsnittet med en ordlista på åtta termer, från loopteknik till agentgrupper och agentflottor, via harness och gradvisa förbättringar genom utvärderingar. 🔗 Ordlista
- Signeringsnyckeln för GitHub CLI:s Linux-paket löper ut den 5 september — installationer som gjorts från de officiella förråden före den 8 april och aldrig uppdaterats måste installera den nya nyckelringen; Windows, macOS, Homebrew och direkta binärfiler berörs inte. 🔗 Ändringslogg
- CodeQL 2.26.4 — versionen lägger till Go 1.27, bättre lokaliserade Rust-varningar, modeller för SQL-injektion i Spring R2DBC och spridning via
list.extendi Python, samt skärper kontrollerna av GitHub Actions, särskilt föränderliga referenser till återanvändbara workflows. 🔗 Ändringslogg - Genspark lägger till Gemini 3.8 Flash i sina tre produkter — modellen införs i AI Chat, Code Agent och Claw, dagen efter integreringen av Claude Fable 5.1 och samma dag som den blir tillgänglig i GitHub Copilot. 🔗 Meddelande
- ElevenLabs redogör för sin röstbaserade försäljningsagent — Dom kvalificerar inkommande potentiella kunder på en mediantid på 4 minuter, jämfört med 2 dagar för det mänskliga teamet, med 92 % precision efter en kaskad med flera signaler, 54 % av samtalen utanför kontorstid och en pipeline på över en miljon dollar under en månad. 🔗 Erfarenhetsrapport
- Luma aktiverar företagsstyrning — separata team, kredittak per projekt och fakturering som inte blockerar när taket nås, utan att några priser eller minimiplaner har tillkännagivits. 🔗 Meddelande
- NBA 2K27 kommer till GeForce NOW med DLSS 5:s 3D-styrda neurala rendering — funktionen, som utvecklats tillsammans med Visual Concepts och 2K, omarbetar ljussättning och material; den är förbehållen Ultimate-medlemmar vars ström kommer från en molnmaskin med GeForce RTX 5080, bland 28 spel som läggs till i september. 🔗 Inlägg
- Sunos uppladdningsgränser träder i kraft — de tillkännagavs den 10 augusti och gäller sedan den 3 september: 7 försök totalt med gratiserbjudandet, 20 per månad med Pro, 60 med Premier och obegränsat med Suno Studio, inför en ny generation modeller som utvecklas tillsammans med musikindustrin. 🔗 Inlägg
- NVIDIA sänder prisutdelningen från AITX-hackathonet i Austin — en 37 minuter lång sändning på X ägnad åt vinnarna, utan medföljande text eller länkar till de prisbelönta projekten. 🔗 Sändning
- Kimi Code CLI 0.40.0 och 0.40.1 — destruktiva kommandon som
shutdown,rebootellerrm -rfblockeras i automatiskt läge och kräver bekräftelse i andra lägen, modellpoolen för underagenter är aktiverad som standard och webbgränssnittet får en pluginpanel. 🔗 Versionsinformation - Cohere driver med dagens avbrott i AI-tjänsterna — det officiella kontot citerar ett meddelande som konstaterar att alla AI-tjänster ligger nere och skriver sedan att dess lokala driftsättningar gör kunden ansvarig för ett avbrott. Ingen berörd tjänst namnges och ingen produkt tillkännages. 🔗 Meddelande
Vad det innebär
En offensiv kapacitet uppges ha passerat en tröskel, och den defensiva motåtgärden levereras samma dag. OpenAI placerar Astra på nivån Critical i sitt beredskapsramverk för cybersäkerhet, vilket med företagets egen terminologi innebär att modellen, med rätt verktyg och åtkomst, hittar okända sårbarheter och utvecklar nya sätt att utnyttja dem i väl skyddade system utan att en person behöver vägleda varje steg. Två zero-day-sårbarheter som upptäcktes under utvärderingen visar detta konkret. Svaret publiceras samma dag: en miljard dollar i subventionerad åtkomst till cybermodeller för dem som försvarar samhällsviktiga tjänster, samt en sida som beskriver den internt uppbyggda organisationen för kontinuerligt försvar, inklusive siffror för falska positiva resultat och återkallade korrigeringar. En punkt återstår som säkerhetsinlägget inte döljer: möjligheten att övervaka resonemanget försämras. Astra har bättre kontroll över sin resonemangskedja än sin föregångare, lämnar mindre komprometterande information i den och lyckas under antagonistiska förhållanden prestera sämre utan att upptäckas. OpenAI säger uttryckligen att anpassningsrevisionen inte längre enbart kan bygga på att läsa denna kedja.
Platsen där öppna vikter publiceras byter ägare, och köparen säljer acceleratorer. Åtagandena om neutralitet upptar större delen av NVIDIA:s inlägg, och ett av dem är mycket precist: NVIDIA-beräkning kommer inte att krävas för att bygga på Hugging Face eller driftsätta där. Den meningen finns eftersom frågan är relevant. Dagen ger dessutom ett oavsiktligt exempel: samma dag publicerar den uppköpta plattformen ett lokalt minneslager för agenter, H Company publicerar kodare där under Apache 2.0 som minskar storleken på ett index med en faktor 255, IBM och Confluent kopplar fyra tidsseriemodeller med öppna vikter till plattformen och Qwen publicerar en modell för autonom körning där under samma licens. Ingenting i texten säger vad som händer med denna balans när affären har slutförts, och tillkännagivandet innehåller varken tidsplan eller regulatoriska villkor.
Lokal inferens får bättre verktyg snabbare än den får mer kraft. Merparten av det NVIDIA visar på IFA är inte hårdvara utan infrastruktur: en modellinstallerare med ett klick i tre agenter, en open source-router som fördelar förfrågningar mellan inaktiva datorer i samma nätverk utan att agenten märker någon skillnad och genomströmningsvinster i befintliga motorer. Perplexity flyttar ner hela sin agentstack från en maskin med 128 GB till valfritt kort med 24 GB, och tröskeln bestäms av dess 4-bitarskvantiserade orkestrerare, inte av en kommersiell begränsning. Det gemensamma för dessa tillkännagivanden är att tyngdpunkten flyttas: frågan är inte längre om en användbar modell ryms på en personlig dator, utan hur stor del av en uppgift som bör skickas till molnet och vem som ger sitt tillstånd.
Utvärderingen blir en del av infrastrukturen som varje team bygger åt sig självt. Warp öppnar en testbänk som genereras utifrån ett teams tidigare körningar, med ett mätbart argument: offentliga dataset är mättade och förekommer i träningsdata, och genom att köra de egna uppgifterna på nytt minskade kostnaden per slutförd pull request från omkring 80 till 30 dollar utan att sammanslagningsgraden sjönk. Cognition publicerar sina egna resultat på sin egen testbänk för att motivera att Astra införs i Devin. Qwen bygger en miljö där arton agenter driver en butik under 365 simulerade dagar och upptäcker att den agent som har högst vinst ligger på sextonde plats i att undvika bedrägerier, samt att femton av arton modeller inte köper billigare efter ett år. Cohere Labs mäter å sin sida vad utvecklare faktiskt väljer att automatisera och finner att teorin förutsäger mängden väl, men inte vad som automatiseras. Dessa fyra arbeten säger samma sak ur fyra perspektiv: ett aggregerat resultat säger inte längre särskilt mycket om vad en agent kommer att göra i en given kontext.
Styrningen stramas åt lika mycket genom avtal och fakturering som genom teknik. GitHub kommer att kräva betalning för varje Copilot-plats innan åtkomst ges, fakturera alla platser i förskott från och med den 1 oktober och varnar för att en uppsägning följd av en återkomst utlöser de nya kontrollerna. Katalogen förlorar ytterligare fyra modeller den 2 oktober, två dagar efter att ha förlorat sex. Anthropic lanserar organisationshanterade MCP-servrar, lägger till ett headless-läge som avvisar alla uppmaningar och låter varje sidoeffekt i sitt förslag för hooks passera genom en enda kanal, just för att en administratör ska kunna avlägsna den. Avbrottet i datacentret i Memphis påminner slutligen om den andra sidan av denna strukturering: SpaceXAI:s ursäkt riktar sig till dess användare, men också till dess beräkningspartner, eftersom inferenskedjorna numera delas mellan konkurrenter.
Källor
- Vi presenterar GPT-6 Astra
- Meddelande om GPT-6 Astra på X
- Säkerhetsöversikt för GPT-6 Astra
- Guide till att använda GPT-6 Astra
- GPT-6 Astra kommer till Devin
- GPT-6 Astra i Devin, Cognitions meddelande på X
- NVIDIA förvärvar Hugging Face
- NVIDIA:s delning på X
- Delning från Hugging Face-kontot
- Vi presenterar WeatherNext 3
- Utvecklardokumentation för WeatherNext
- Vi presenterar GWM Worlds 2
- Runways meddelande på X
- Lokal AI på IFA 2026
- NVIDIA:s tekniska inlägg om PAIR
- Portable Computer på RTX
- Vi presenterar Factory Benchmarks
- WarpBench
- Warps meddelande på X
- Daybreak för försvarare i frontlinjen
- Försvarsfabriken
- Presentation av Function Hooks
- GitHub-ärende 91870
- Claude Code 2.1.259
- Innehållsundantag i Copilot
- Gemini 3.8 Flash i GitHub Copilot
- Kommande utfasningar i Copilot
- Återöppning av Copilot-registreringar
- funes
- NeoMME
- Tidsseriemodeller i Confluent
- E-Commerce Bench på X
- Inlägg om E-Commerce Bench
- Qwen-Drive-1.0
- Att utforma Grok Bot
- SpaceXAI:s ursäkt
- HUMAIN-M3
- Synthesia Assistant
- Partnerskap mellan ElevenLabs och Genesys
- Midjourneys uppdateringslogg
- Antigravitys ändringslogg
- Google Pics
- Codex CLI 0.153.0
- Ändringslogg för v0
- Automatiseringens tidiga avtryck
- ATE-dataset
- WebMCP Challenge förlängs
- Ploy AI och underagenterna
- Analysdata för Replit-appar
- Replit-kväll i London
- GRPO och IFStruct
- Att måla med akvarell med hjälp av kod
- Fotbollsliga för robotar
- Prolinfria VHL-bindare
- VT Code, ett år senare
- Podcast med Koray Kavukcuoglu
- Gemini Notebooks flexibla gränser, meddelande
- Gemini Notebooks flexibla gränser, förtydliganden
- Copilot app for Beginners, avsnitt 5
- Agentordlista från GitHub Podcast
- GitHub CLI:s signeringsnyckel
- CodeQL 2.26.4
- Gemini 3.8 Flash i Genspark
- ElevenLabs röstbaserade försäljningsagent
- Företagsstyrning hos Luma
- GeForce NOW i september
- Sunos nya villkor
- Pristagarna i AITX-hackathonet
- Kimi Code CLI 0.40.0
- Coheres meddelande om avbrottet