ai-powered-markdown-translatorArtikel översatt från franska till svenska med gpt-5.6-sol.
Måndagen den 21 september tillhör dagen xAI: Grok 4.7 lanseras och finns samma dag i Cursor och GitHub Copilot, utan någon fördröjning mellan tillkännagivandet av modellen och dess ankomst till verktygen. OpenAI väljer samma dag för att avslöja att en intern modell som tränats sedan den 28 augusti har löst fler än hundra öppna matematikproblem, och för att inrätta en rådgivande grupp av matematiker efter ett uttalande undertecknat av 27 Fieldsmedaljörer. Google öppnar för förbeställningar av Googlebook, ElevenLabs placerar en redigeringsagent i centrum för sin videoredigerare och Hugging Face ger ut sitt tokeniseringsbibliotek på nytt, nu 3 till 30 gånger snabbare.
Grok 4.7 lanseras av xAI och kommer samma dag till Cursor och GitHub Copilot
21 september — xAI lanserar Grok 4.7, företagets mest kapabla modell för kod och kunskapsarbete. Basmodellen är större än den i Grok 4.6 och dess fas med förstärkningsinlärning (reinforcement learning) har förlängts med en blandning av uppgifter viktad mot problem som tar flera timmar. xAI förväntar sig en modell som bättre granskar sitt eget arbete och hanterar långa kontexter bättre.
Siffrorna tecknar en blandad profil snarare än en bild av dominans. Priset förblir däremot oförändrat: 2 dollar per miljon tokens för input och 6 för output, som för Grok 4.6, vilket är hälften av inputpriset för GPT-5.6 Sol och en femtedel av priset för Fable 5.1. Det är detta förhållande mellan pris och prestanda som argumentet bygger på.
| Publicerat mått | Grok 4.7 (xHigh) | Grok 4.6 (High) | GPT-5.6 Sol (Max) | Fable 5.1 (Max) |
|---|---|---|---|---|
| CursorBench 4.0 | 46,3 % | 40,4 % | 41,7 % | 51,8 % |
| Terminal-Bench 4.0 | 38,0 % | 20,3 % | 37,3 % | 57,9 % |
| EEBench (elektroteknik) | 64,0 % | 53,0 % | 39,4 % | 56,4 % |
| Inputpris (dollar/M tokens) | 2 | 2 | 4 | 10 |
| Outputpris (dollar/M tokens) | 6 | 6 | 20 | 50 |
API:t exponerar grok-4.7 med ett kontextfönster på 500 000 tokens och fyra nivåer av resonemangsansträngning, från low till xhigh; priset fördubblas för promptar över 200 000 tokens. xAI framhäver också en helt ny uppsättning skyddsräcken: förstaplatsen i LatchBios benchmark för biosäkerhet med 62,4 %, och 3,3 % riskfyllda cyberpromptar med dubbla användningsområden som släpptes igenom i HackerBench v0.3.
Införandet sker omedelbart hos två integratörer. Cursor erbjuder modellen från första dagen — en följd av SpaceX:s förvärv av Anysphere, som slutfördes den 14 augusti. Modellen förblir xAI:s: inlägget som publicerades samma dag på Cursors blogg består av en enda mening och hänvisar till det fullständiga tillkännagivandet på x.ai. Det är xAI som lyfter fram CursorBench 4.0, Cursors testsvit för långvariga uppgifter, där Grok 4.7 når 46,3 % till oförändrat pris. GitHub Copilot inför den i sin tur på alla sina plattformar, från VS Code till Xcode, för abonnemangen Pro till Enterprise. Faktureringen där förtjänar uppmärksamhet: Grok 4.7 omfattas inte av systemet med multiplikatorer för förfrågningar utan faktureras efter användning enligt leverantörens offentliga pris. Eftersom en ny modell aktiveras som standard krävs en åtgärd i modellpolicyn för att kontrollera utgifterna; det räcker inte att bara avstå från att göra något.
🔗 Grok 4.7 — xAI 🔗 Grok 4.7 finns nu i GitHub Copilot
OpenAI inrättar en rådgivande grupp av matematiker och avslöjar fler än hundra lösta öppna problem
21 september — OpenAI meddelar att företaget samarbetar med en oberoende rådgivande grupp bestående av nio matematiker, bildad av dem själva och med hemvist vid Institute for Advanced Study i Princeton. Sammanhanget väger tyngre än tillkännagivandet.
On August 28, we began training a new internal model. In addition to resolving the Navier–Stokes Millennium Prize problem, this model has now resolved more than 100 long-standing open problems across most areas of mathematics.
🇸🇪 Den 28 augusti började vi träna en ny intern modell. Utöver att lösa millennieproblemet Navier–Stokes har modellen nu löst fler än 100 sedan länge öppna problem inom de flesta matematiska områden. — OpenAI, Rådgivande grupp för matematik och artificiell intelligens
Modellen har inte namngivits offentligt, och OpenAI skriver att takten i dessa framsteg överraskade företagets egna matematiker. Accelerationen framkallade en direkt reaktion: den 11 september publicerades ett uttalande med titeln ”A Severe Misalignment of AI in Mathematics”, med ett DOI på Zenodo och underskrifter från 27 Fieldsmedaljörer, däribland Terence Tao, Peter Scholze och Cédric Villani. Deras argument är inte att modellerna har fel. Att lösa ett stort problem har alltid signalerat en ny förståelse, som därefter bearbetas av forskarsamhället tills den kan läras ut; undertecknarna befarar att en massproduktion av sanna eller falska påståenden förstör denna grogrund i stället för att ge den näring, och att dessa förhastade tillkännagivanden inte ger tid för en korrekt framställning.
Upplägget vilar tydligt på oberoende: gruppen kan lämna oombedda råd, offentligt kommentera OpenAI:s påverkan på matematiken och ändra sin sammansättning utan företagets godkännande, och medlemmarna får ingen ersättning av företaget. Kvar står meningen som OpenAI placerar i slutet av samma stycke: gruppen ska inte ge företaget råd om takten i dess interna framsteg. Omfattningen täcker alltså spridningen av resultaten, inte framtagningen av dem — allt utom det som utlöste protesten. Martin Hairer finns för sin del med på båda listorna, både som undertecknare av uttalandet och som medlem i gruppen.
🔗 En allvarlig felinriktning av AI inom matematiken
Googlebook, Googles serie bärbara datorer utformad kring Gemini
21 september — Google öppnar för förbeställningar av Googlebook, som företaget presenterar som en egen kategori: Androids teknikstack, desktopfundament som ärvts från ChromeOS, allt utformat kring Gemini. Fem modeller lanseras samtidigt, tillverkade av Acer, ASUS, Dell, HP och Lenovo, från 899 dollar. Leveranserna börjar den 4 oktober i USA och den 5 oktober i Kanada, Storbritannien, Irland, Frankrike, Tyskland och Australien.
| Tillkännagiven egenskap | Värde |
|---|---|
| Startpris | 899 dollar |
| Processorer | Intel Core Ultra Series 3 eller Snapdragon X Elite |
| NPU | mer än 45 TOPS |
| Arbetsminne | 16 GB som standard, upp till 32 GB |
| Batteritid | upp till 14 timmars video, 16 timmars webbsurfning |
| Programvarusupport | uppdateringar i upp till 10 år |
Tre Gemini-funktioner är unika för datorn. Magic Pointer, som aktiveras genom att skaka markören, tar Gemini till det element som visas på skärmen — för att analysera ett misstänkt e-postmeddelande eller kombinera flera bilder — och Google preciserar att funktionen endast aktiveras på begäran och kan stängas av. Rambler omvandlar osammanhängande diktering till strukturerad text med rubriker och uppgiftslistor, även när användaren byter språk mitt i en mening. Create My Widget genererar desktopwidgetar från en beskrivning på naturligt språk.
För utvecklare levereras varje dator med Antigravity, Googles plattform för utvecklingsagenter, och med en isolerad Linux-miljö med en fullständig terminal — dokumentationen nämner uttryckligen möjligheten att köra Claude Code eller Antigravity CLI där. Isoleringen bygger på en Level 5-certifierad pKVM-hypervisor, som Google presenterar som den första i kategorin, kompletterad med Titan som hårdvarubaserad tillitsrot. Kontinuiteten med Android-telefonen står för resten: användaren kan fortsätta en uppgift som påbörjats på mobilen och strömma mobilappar i ett desktopfönster. Varje Googlebook inkluderar 12 månader Google AI Pro med 5 TB lagring, 3 månader YouTube Premium och Photoshop samt ett år GeForce NOW.
ElevenLabs placerar en redigeringsagent i Studio 4.0
21 september — ElevenLabs lanserar Studio 4.0 i ElevenCreative, en uppdatering av företagets videoredigerare. Den bärande idén ryms i en mening: allt sker på samma plats. Generering av video, bilder, röster, musik och ljudeffekter startas inifrån själva projektet, alla ElevenCreative-modeller kan anropas utan att lämna redigeraren, och redigering, undertextning och sedan export följer på varandra i samma gränssnitt. En tagning kan bearbetas på nytt utan att hela genereringen behöver göras om, och undertexter hanteras som vilket annat klipp som helst på tidslinjen (timeline).
Den mest genomgripande nyheten är Studio Agent, en medredigerare som finns i varje projekt.
Studio Agent is your AI co-editor, built into every project. Describe the change you want and it makes the edit. Step in and make cuts whenever you like, then hand the timeline back to the agent.
🇸🇪 Studio Agent är din AI-medredigerare, inbyggd i varje projekt. Beskriv ändringen du vill göra, så utför den redigeringen. Ta över och gör dina klipp när du vill, och lämna sedan tillbaka tidslinjen till agenten. — @ElevenLabs på X
Det är denna växelverkan som skiljer verktyget från en ogenomskinlig generering: redigeraren tar över när den vill och lämnar sedan tillbaka tidslinjen. Den har dessutom byggts om för projekt med flera scener och spår — reklamkampanjer, handledningar och serier av kortformat — med zoomning till bildrutenivå, fästning av klipp och flyttning av en grupp klipp utan att resten tappar synkroniseringen. Teamkommentarer placeras på ett specifikt klipp eller en specifik tillgång i stället för att spridas ut i separata trådar.
Värt att notera för uppföljningen: vid tidpunkten för genomgången fanns tillkännagivandet endast på X, i en tråd med sex inlägg. ElevenLabs blogg slutade vid inlägget från den 10 september och dokumentationens ändringslogg vid posten från den 14 september.
Hugging Face lanserar tokenizers v1, 3 till 30 gånger snabbare med identiska ID:n
21 september — Hugging Face lanserar release candidate-versionen av tokenizers v1, Rust-biblioteket som omvandlar text till talföljder innan en modell läser den. Utgångspunkten är enkel: tokenisering har aldrig varit flaskhalsen i maskininlärningskedjor, men balansen förskjuts i takt med att modellerna blir snabbare, och en GPU som väntar på sin processor är en inaktiv GPU.
| Mätvärde | Uppmätt värde |
|---|---|
| Snabbare kodning jämfört med v0.23, en enda tråd | 3 till 30 gånger |
| Testdator | Apple M4 Max |
| Intervallets lägsta och högsta värde | t5-base och gpt2 |
| Skalning med åtta workers | 76 % av linjär skalning |
| Genererade token-ID:n | identiska med v0.23 |
| Installation av release candidate-versionen | cargo add tokenizers --pre |
Begränsningen som teamet ålägger sig är mer intressant än själva vinsterna: v1 producerar exakt samma token-ID:n som v0.23, API:t, vokabulären och sammanslagningsrangordningarna (merge ranks) förblir oförändrade, och biblioteket förblir generellt i stället för att specialiseras på BPE. Uppdateringen kräver därför inget annat än att ändra den installerade versionen.
Sex ändringar står för huvuddelen av arbetet, och den mest ovanliga kallas bitcannon. Det reguljära uttrycket som delar upp texten i förtokens är en fast parameter som levereras med tokenizern: det finns ingen anledning att låta en generell motor tolka det vid varje kodning. Hugging Face skriver därför uppdelningsfunktionen för hand och låter den arbeta med bitströmmar i SIMD, där 64 byte behandlas per registeroperation. Nackdelen accepteras: endast igenkända mönster (GPT-2, cl100k, o200k, Tekken, DeepSeek) drar nytta av detta, medan övriga behåller regex-vägen — vilket förklarar skillnaden mellan 3 och 30. Därtill kommer en sammanslagningsloop utan allokering eller förgrening, en trådlokal ordcache och inbyggd parallellism. C- och C++-bindningar enbart för inferens, avsedda för ExecuTorch och llama.cpp, utlovas före 1.0.0.
🔗 tokenizers v1: kodning, avkodning och skalning, uppmätt
Devin Cloud kommer till terminalen, med SSH-åtkomst till agentens dator
21 september — Cognition öppnar Devin Cloud för terminalen: devin --cloud, eller /cloud från en pågående session, skapar, styr och återupptar en molnsession utan att lämna CLI:t. Mekanismen bygger på ett symmetriskt kommando: /handoff överför den aktuella uppgiften till Devins virtuella dator — Mac, Linux eller Windows — och tar, när det körs från molnet, den motsatta vägen genom att hämta pull request-grenen. Molnsessionerna överlever terminalen som startade dem.
And for the first time, SSH into Devin’s dedicated VM, then /handoff the work back to your own device.
🇸🇪 Och för första gången kan du ansluta via SSH till Devins dedikerade virtuella dator och sedan hämta tillbaka arbetet till din egen enhet med /handoff. — @cognition på X
devin ssh ger fullständig åtkomst till miljön som agenten har byggt upp åt sig: ändra koden, starta en utvecklingsserver, vidarebefordra portar och hämta filer via scp. Körmiljön upphör att vara en svart låda. SWE-2-sessioner är kostnadsfria i Devin Cloud fram till den 8 oktober.
Qwen Code v0.24.3 instrumenterar sitt Web Shell och bevarar sina sessioner i JDBC
21 september — Qwen Code uppgraderas till v0.24.3 dagen efter v0.24.2: trettioett pull requests, inga inkompatibla ändringar. Det mesta av det synliga arbetet rör Web Shell, vars exekveringsresultat inte längre är råtext utan en struktur som separerar kommandot, dess utdata, exekveringsdetaljerna och den förflutna tiden. En trajectory-flik, som är inaktiverad som standard, visar tidsåtgång per tur, tid till första token, antal tokens och varaktigheten för varje verktygsanrop.
Den minst synliga delen är förmodligen den mest grundläggande. Runtime-miljön får JDBC-persistens för sina bindningar och sessioner, vilket gör det möjligt att dela tillstånd mellan flera broker-processer och behålla ägarskapet för en session efter en omstart. Runtime-verktygen dirigeras dessutom via bwrap med en policy för en oföränderlig workspace — den direkta fortsättningen på den sandbox som infördes dagen innan och vars inställning fortfarande inte exponeras. Samma dag inkluderar TypeScript SDK v0.1.14 denna CLI och Qwen Code Desktop v0.24.3 följer efter.
🔗 Versionsinformation för Qwen Code v0.24.3
Hugging Face lanserar relore, ett repository-minne för kodagenter
21 september — Hugging Face släpper relore under licensen Apache-2.0, ett verktyg som ger en kodagent minne av ett repository. Utgångspunkten är en incident: för Transformers-ärende #48630, som öppnades den 8 september, hade två korrigeringar redan föreslagits när företagets continuous integration-agent stod i begrepp att skriva en tredje. Informationen fanns i sin helhet på GitHub, men var utspridd över ärenden, pull requests och kommentarer som inte var synliga från det ursprungliga ärendet.
relore indexerar denna historik genom att registrera vem som sade vad: ett beslut av en maintainer väger inte lika tungt som en bidragsgivares hypotes, och maskingenererat innehåll utesluts som standard. En arbetsklon underhålls bredvid indexet, tillhandahålls via samma HTTP API, och förfrågningarna behandlas lokalt — endast ingestion kontaktar GitHub. Verbkommandona följer: inflight listar trådarna som påstår sig avsluta ett ärende, search --trust authoritative hittade PR #39847 som orsakade regressionen, och why utgår från en kodrad för att hitta granskningskommentarerna kring den. Under ett fälttest rapporterade agenten att defs gav den en bättre överblick över en fil än att läsa hela filen, för 5 % av antalet tokens.
🔗 relore, repository-minne för kodagenter
Perplexity eftertränar Computer på användarnas fel och lägger till video
21 september — Perplexity Research beskriver hur företaget eftertränar modellen som driver dess Computer-agent — GLM 5.2, vilket artikeln avslöjar i förbifarten — utifrån användarnas verkliga sessioner. Syntetiska miljöer producerar kontrollerade uppgifter som är enkla att verifiera; verkliga sessioner ger två signaler som de inte producerar: användarens korrigeringar och fel som verktygen returnerar. Sessioner som innehåller personuppgifter och sessioner från användare som har avböjt träning utesluts före all sampling.
Varje tur får därefter en av tre behandlingar: imitation med korsentropi för felfria turer i lyckade sessioner, korrigering med Kullback–Leibler-divergens för felaktiga turer med en giltig ledtråd, eller att helt enkelt behållas i kontexten. Samma uppsättning vikter fungerar som lärare och elev, men endast läraren ser ledtråden. Tre automatiska bedömare föreslår vilka turer som är ansvariga och minst två måste vara överens, eftersom den sista turen före klagomålet bara är den verkliga orsaken i ungefär hälften av fallen.
| Frekvens av verktygsfel | Uppmätt värde |
|---|---|
| Offline, ursprungliga GLM 5.2 | 2,79 % |
| Offline, endast rejection sampling | 1,35 % |
| Offline, med självdestillation | 0,87 % |
| Online, mellan två checkpoints | 2,24 % följt av 1,77 %, alltså 21,2 % lägre relativt |
Författarna är tydliga med vad dessa siffror inte visar: de checkpoints som jämfördes offline tränades inte på samma data, resultaten per uppgift är fortfarande blandade och användarnas missnöje förändras inte signifikant, 2,58 % jämfört med 2,54 %, i A/B-tester med omkring hundratusen användare per grupp.
Samma dag får Computer videogenerering, som anförtros åt två tredjepartsmodeller: MiniMax H3 och ByteDance Seedance 2.5. Oavsett om det gäller ett kampanjklipp, en produktdemonstration eller visuellt innehåll för sociala medier visas den färdiga videon i samma tråd som texten och bilderna som skapats för samma begäran. Tillgängligt för Pro- och Max-prenumeranter, utan omnämnande av kostnadsfri åtkomst eller exponering via API.
🔗 Att lära av verkliga misstag 🔗 Perplexity Computer och videomodellerna
Gemini Notebook gör Live Chat och Interactive Learning Overviews allmänt tillgängliga
21 september — Gemini Notebook passerade två milstolpar i utrullningen samma dag. Live Chat når 100 % av Ultra-prenumeranterna på mobila enheter: röstsamtal i realtid med ett notebook, på omkring 100 språk, med stöd av Googles senaste ljudmodeller och med stegvis vägledning som är nästan helt handsfree. Några timmar senare lämnar Interactive Learning Overviews sin gradvisa utrullning och blir tillgängliga för alla användare, utan krav på prenumeration; under Reports samlar de källsammanfattningar och studioartefakter i ett och samma interaktiva utrymme.
De två funktionerna hade presenterats den 15 september i tillkännagivandet av de nya studieverktygen. Meddelandena den 21 september lägger inte till några funktioner: de bekräftar faktisk tillgänglighet, fullständig för den första och öppen för alla för den andra.
🔗 Live Chat utrullat till 100 % 🔗 Interactive Learning Overviews öppna för alla
Google.org satsar 4 miljoner dollar på AI-utbildning för lärare
21 september — Google.org anslår 4 miljoner dollar till Digital Promise, vilket tillkännagavs i New York i samband med FN:s generalförsamling. Finansieringen förlänger Google AI Educator Series, en kostnadsfri utbildning som tillkännagavs tidigare under året och riktar sig till de 6 miljoner lärarna inom grundskola, gymnasium och högre utbildning i USA. Den har utformats tillsammans med ISTE enligt en modell där lärare utbildar andra lärare, fokuserar på färdigheter som kan överföras mellan olika verktyg snarare än på en viss produkt och genomförs som moduler i egen takt som valideras med digitala märken.
Digital Promise arbetar inom tre områden: att anpassa utbildningen till delstatliga utbildningsmyndigheter och skoldistrikt, att samarbeta med nätverk av community colleges för lärare inom grundutbildningen samt att under två år genomföra en studie av vad som verkligen hjälper lärare inom högre utbildning, vars resultat kommer att publiceras i en kostnadsfri offentlig guide.
🔗 Google.org och Digital Promise
Runway utökar sina Workflows med compositing, transparens och djupkartor
21 september — Runway utökar sina Workflows, de sekvenser av operationer som sätts samman i dess applikation, med fem byggstenar inriktade på efterproduktion: Compositing, Alpha, HDR, Depth Map och RGB Depth. Argumentet sammanfattas i en enda rad i tillkännagivandet — att bygga en större del av sin produktionskedja (pipeline) på samma plats, utan att behöva gå över till ett annat verktyg mellan två steg. Compositing och hanteringen av alpha-kanalen är avsedda för att sammanfoga flera bildlager; djupkartorna, i sina två former, används som en geometrisk signal för att styra effekter som beror på avståndet till kameran. Tillkännagivandet gjordes på X med en 31 sekunder lång demonstration, utan något motsvarande inlägg på Runways nyhetssida vid tidpunkten för genomgången.
NVIDIA lanserar DSX Ready, ett kvalificeringsprogram för strömförsörjning och kylning av AI-fabriker
21 september — NVIDIA lanserar DSX Ready, ett program som kvalificerar partnerprodukter utifrån kraven i företagets referensarkitektur DSX för AI-fabriker. Utgångspunkten är jordnära: strömförsörjning, kylning, vatten, platsen och elnätet avgör i dag vad en konstruktör faktiskt kan driftsätta, och utrustning som är dåligt anpassad till den övriga konstruktionen omvandlar inte beräkningskapacitet till användbar produktion.
| Kvalificerad kategori | Partner vid lanseringen | Kvalificeringsprocess |
|---|---|---|
| Batteribaserad energilagring | Hitachi Energy, LG Energy Solution, Tesla | Testning av partnern, granskning och godkännande av NVIDIA |
| Distributionsenheter för kylning | LG Electronics, LiquidStack, Vertiv | Självkvalificeringssvit |
NVIDIA anger en uttrycklig gräns för vad märkningen innebär: en godkänd kvalificering ersätter inte teknisk projektering på platsnivå och medför ingen garanti för platsens stabilitet. Fler kategorier inom infrastruktur och mjukvara ska läggas till successivt.
NVIDIA behandlar agentsäkerhet som ett ingenjörsproblem, lager för lager
21 september — NVIDIA publicerar ett ställningstagande om säkerheten i agentbaserade system: det är ett ingenjörsproblem och kräver därför definierade krav, tillämpbara kontroller, utsedda ansvariga och bevis på att skydden håller. Stacken delas upp i tre nivåer — modellerna tillhandahåller kapaciteten, harnesses organiserar kontext, verktyg och arbetsflöden, och runtime-miljön tillhandahåller infrastrukturen där åtgärderna utförs — där varje nivå har sina egna kontroller.
Exemplet är talande: en agent uppdaterar en kundpost, stöter på skadliga instruktioner i ett bifogat dokument och försöker exportera uppgifterna till en obehörig destination. NVIDIA förväntar sig då en nätverkspolicy som blockerar överföringen och skyddade loggar som bevarar det försökta verktygsanropet, auktoriseringsbeslutet och resultatet. Rätten att uppdatera en post omfattar inte rätten att exportera den, och en agent kan begära åtkomst utan att någonsin kunna bevilja sig själv den. På verktygssidan tillämpar OpenShell policyerna utom räckhåll för agenten; Cisco lägger DefenseClaw ovanpå och JFrog verifierar de skills som en agent får åtkomst till.
Samma dag tillämpar ett andra inlägg samma resonemang på fysisk AI och kopplar det till Halos-grunden; det finns bland kortnotiserna nedan, tillsammans med sina två marknadsprognoser.
Earth-2 assimilerar lokala observationer för att uppdatera väderprognoser
21 september — NVIDIA publicerar en handledning om Earth-2:s verktyg för AI-baserad dataassimilation, avsedda för sektorer som redan har egna mätningar: vind- och solparker, lokala radar- och sensorsystem samt satellitobservationer. Den första tekniken, SDA, tillämpas på diffusionsmodeller som CorrDiff och StormCast: vid varje avbrusningssteg jämför den mellanresultatet med observationerna och styr nästa steg, utan omträning.
| Uppmätt teknik | Omfattning och upplösning | Rapporterad förbättring i exemplet |
|---|---|---|
| CorrDiff-SDA | Europa, från 0,25 grader till 2,2 km | RMSE för vind minskade med 54 % vid undanhållna stationer |
| StormCast-SDA | Kontinentala USA, 3 km, initierad med HRRR | RMSE för vind minskade med 7,2 % över sex tidssteg |
| HealDA | Globalt, HEALPix-rutnät med 1 grads upplösning | Globalt atmosfärstillstånd uppskattat på några sekunder |
Fördelen är i första hand operativ: numeriska analyser kräver betydande beräkningstid och produceras vid fasta tidpunkter, medan SDA integrerar observationer kontinuerligt och fyller luckan fram till den aktuella tidpunkten. HealDA behandlar å sin sida varje flöde som ett punktmoln i rum och tid, aggregerat på målgridet och därefter bearbetat av ett vision transformer-baserat stomnätverk (backbone).
Multiverse Computing beskär block som ett Ising-glas och vinner 23 MMLU-poäng
21 september — Att ta bort hela transformer-block är ett av de billigaste sätten att accelerera en stor språkmodell, och ett av de mest brutala: modellen blir bokstavligen kortare, men om fel block tas bort kollapsar den. Multiverse Computing hävdar att frågan är felställd. Befintliga metoder bedömer varje block isolerat — magnitude, sensitivity, block influence — vilket författarna beskriver som ett medelfält, trots att effekten av att ta bort ett block beror på vilka andra block som tas bort samtidigt.
Urvalet blir därmed ett begränsat binärt optimeringsproblem som avbildas på ett Ising-glas: ett oordnat spinsystem med all-till-all-interaktioner och ett fast antal uppåtriktade spins. Den praktiska nyttan kan sammanfattas i en mening: systemets energi är ett billigt surrogat för det resultat som den beskurna modellen kommer att få, vilket gör det möjligt att rangordna ett mycket stort antal kandidatuppsättningar utan att utvärdera någon av dem på benchmarks. Vid 50 % komprimering av Llama-3.3-70B-Instruct uppger författarna en förbättring på nästan 23 procentenheter på MMLU jämfört med den bästa konkurrerande metoden.
🔗 Beskärning av LLM:er som en fysiker
Kortfattat
NVIDIA publicerade sju blogginlägg och meddelanden den 21 september: tre behandlas ovan, de fyra övriga finns här, utan några tekniska tillkännagivanden.
- NVIDIA efterlyser säkerhet i varje lager för fysisk AI — ett ställningstagande som stöds av två marknadsprognoser: 49 miljoner autonoma fordon på nivå 3 till 5 installerade senast 2035 enligt ABI Research och omkring 60 miljoner industrirobotar driftsatta mellan 2026 och 2035 enligt Omdia. Fyra säkerhetskrav kopplas till plattformen NVIDIA Halos. 🔗 källa
- NVIDIA lyfter fram uppskalningen av Egyptens AI-ekosystem — mottagning på Grand Egyptian Museum med ett inledningsanförande av Paolo Guglielmini, vice vd för EMEA. Ingressen framhåller framför allt att AI-fabriker tas i drift i Sydafrika, Marocko och Nigeria. 🔗 källa
- NVIDIA listar fem företag som tillämpar AI på koldioxidsnål energi — en översikt publicerad inför New York Climate Week, från accelererad utveckling av fusion till återanvändning av återvunna batterier från elfordon. ThinkLabs AI bygger där digitala tvillingar och agenter på CUDA för att korta ledtiderna för nätanslutning. 🔗 källa
- NVIDIA tillkännager vinnarna av Golden Tickets till GTC Berlin — sex vinnare utsedda av en jury inför konferensen den 20–22 oktober 2026. Inget tekniskt innehåll. 🔗 källa
- Qwen-Image-2.1 stöds från dag ett av vLLM, SGLang, ComfyUI och Hugging Face — SGLang-Diffusion kör modellen på ett enda RTX 4090 med 24 GB och avlastning till processorn, för en generering i 1024 gånger 1024 på 18,7 sekunder med 22,7 GiB använt. vLLM beskriver den som en diffusion transformer med 7,1 miljarder parametrar, kopplad till Qwen3-VL-8B. 🔗 källa
- OpenAI Academy lägger till fyra utbildningsspår — Build with AI, Lead AI Adoption, AI for Educators och AI for College Students ansluter till Apply AI at Work. Varje kurs avslutas med en bedömning som ger ett märke; utvecklarspåret skiljer mellan att styra Codex och att bygga på API:et. 🔗 källa
- Runway anordnar ett hackathon i San Francisco kring sitt API — ett endagsevenemang den 30 september på Masonic, i anslutning till Runway AI Summit, för att bygga en agent, en applikation eller ett kreativt arbetsflöde, utan presentationsunderlag eller godkännandeprocess. 🔗 källa
- HeyGen lyfter fram Code2Video, ett benchmark utvecklat med Google DeepMind och Kaggle — mätningen gäller en annan fråga än själva kodskrivandet: huruvida koden skapar en video som är värd att titta på. Publicerat som kommentar till ett inlägg om den agentbaserade videostacken som bygger på kodgenerering. 🔗 källa
- Suno visar ljudeffekter som tillämpas med en enkel beskrivning — en minutlång demonstration, från varm mättnad till ett mer experimentellt uttryck. Inget funktionsnamn, ingen berörd abonnemangsnivå och inget tillhörande blogginlägg: en produktvisning snarare än en lansering. 🔗 källa
- Live-demonstration av Gemini för shopping på Discord — sessionen är annonserad till tisdagen den 22 september kl. 11 PT på den officiella Discord-servern och handlar om att planera ett köp, jämföra alternativ och söka utifrån ett foto. Ingen ny funktion. 🔗 källa
- Together AI och Ollama tillkännager en session om öppna kodagenter — Parth Sareen från Ollama och Zain Hasan från Together AI leder en session om att produktionssätta kodagenter baserade på öppna modeller. Varken datum eller plats anges i meddelandet. 🔗 källa
- Två avbrutna träningskörningar av Boris-2 släpps som öppna vikter — den första stannade på en loss på 3,100 vid 30 miljarder tokens på grund av en inkompatibilitet mellan gradienterna i Muon och AdamW; den andra avbröts vid omkring 7 miljarder tokens. En redogörelse för misslyckanden som är mer lärorik än modellerna. 🔗 källa
- Ett förregistrerat protokoll mot riktningsbias hos bedömningsmodeller — hypotesen är att felen i berättande text lutar åt att uttryckligen ange en känsla snarare än att koda in den. Protokollet publiceras före all datainsamling, med det resultat som skulle leda till att konstruktionen förkastas och en intressekonflikt som författaren redovisar. 🔗 källa
- En reproduktion av Jev med öppna byggstenar missar med 0,6 poäng — en användare som uppger att hen inte programmerar låter Claude Code ägna en dag åt experiment för att återskapa Jev på öppna stackar som enbart körs på processor. Åtta misslyckade metoder, som användaren anser vara mer lärorika än den som fungerade. 🔗 källa
- Jevini skiljer utformningen från verkställandet av beslutet — en stor resonemangsmodell utformar en versionshanterad graf över typade bedömningar, som en liten beslutsmodell verkställer för varje ny situation. Marknadsföringsinnehåll från leverantören, vilket bör behandlas därefter. 🔗 källa
- Cohere håller sig till varumärkeskommunikation, utan produktnyheter — ett meddelande från den 20 september fortsätter kampanjen AI for Empowerment genom att omformulera den avsikt som tillskrivs medgrundaren Aidan Gomez, och två visuella inlägg från den 21 berättar om företagets medverkan på studenthackathonet Hack The North i Waterloo. Ingen modell, ingen funktion och inget pris. 🔗 kampanj · 🔗 hackathon
Vad det innebär
Dag noll blir normen för distribution. Grok 4.7 väntar inte: modellen finns i Cursor och GitHub Copilot samma dag som den tillkännages, och Qwen-Image-2.1 stöddes av vLLM, SGLang, ComfyUI och Hugging Face redan vid lanseringen. Tiden mellan publiceringen av en modell och dess tillgänglighet i vardagsverktygen, som tidigare räknades i veckor, går mot noll — hos Cursor eftersom leverantören och laboratoriet sedan den 14 augusti tillhör samma koncern, på andra håll eftersom integrationen förbereds före tillkännagivandet. Den intressanta frågan är inte längre när en modell blir tillgänglig, utan vad den kommer att kosta när den väl är det.
Det är just detta som Copilots faktureringsmodell förändrar. Där lämnar Grok 4.7 systemet med multiplikatorer för förfrågningar och debiteras i stället efter användning enligt xAI:s offentliga prislista. I kombination med automatisk aktivering av nya modeller flyttar detta ett kostnadsbeslut till plattformsadministrationen: att inte göra något innebär att öppna en utgiftspost som följer en tredjepartsleverantörs prislista. Från xAI:s sida är argumentet symmetriskt — samma 2 dollar för indata som Grok 4.6, verkliga förbättringar på Terminal-Bench, men en placering bakom Fable 5.1 på långa koduppgifter: det som säljs här är pris–prestanda, inte en förstaplats.
När det gäller agenter berättar tre vitt skilda tillkännagivanden om samma förändring: exekveringsmiljön upphör att vara en svart låda. devin ssh öppnar agentens virtuella maskin för en interaktiv session, relore ger agenten minne av tidigare beslut i ett kodförråd i stället för enbart kodens nuvarande tillstånd, Perplexity eftertränar sin modell på exakt de interaktioner där den misslyckats hos sina användare, och Qwen Code dirigerar sina verktyg via bwrap. NVIDIA ger den teoretiska ramen för denna utveckling genom att slå fast att en agents säkerhet avgörs lager för lager, utom agentens räckhåll, med loggar som fungerar som bevis. Den inspekterbara agenten och den begränsade agenten är två sidor av samma behov.
Kvar står frågan som OpenAI:s tillkännagivande väcker utan att behandla. En intern modell som löser fler än hundra öppna problem på mindre än en månad har lett till ett institutionellt svar — en oberoende, oavlönad rådgivande grupp som är fri i sina yttranden — vars mandat uttryckligen utesluter takten i de interna framstegen, alltså själva föremålet för protesten från de 27 Fieldsmedaljörerna. Kontrasten mot resten av dagen är lärorik: samtidigt som takten för spektakulära resultat diskuteras får ett tokeniseringsbibliotek en hastighetsökning med en faktor på 3 till 30 samtidigt som det garanterar identiska identifierare, och en komprimeringsmetod lånar från spinglas för att vinna 23 MMLU-poäng vid 50 % komprimering. Det arbetet skapar inga rubriker, men det är det som avgör vad morgondagens inferens kommer att kosta.
Källor
- Grok 4.7 — xAI
- @SpaceXAI på X, tillkännagivande av Grok 4.7
- Grok 4.7 är nu tillgänglig i GitHub Copilot
- Rådgivande grupp för matematik och artificiell intelligens
- En allvarlig felanpassning av AI inom matematiken
- Förbeställningar av Googlebook
- ElevenLabs på X, Studio 4.0
- ElevenLabs på X, Studio Agent
- tokenizers v1: kodning, avkodning och skalning, uppmätt
- Devin Cloud i din terminal
- Cognition på X, devin ssh
- Versionsinformation för Qwen Code v0.24.3
- relore, minne för kodförråd åt kodagenter
- Att lära av misstag i verkligheten
- Perplexity på X, videomodeller i Computer
- Gemini Notebook på X, Live Chat
- Gemini Notebook på X, Interactive Learning Overviews
- Google.org och Digital Promise
- Runway på X, utökade Workflows
- NVIDIA DSX Ready
- Säkra agentstacken
- NVIDIA, säkerhet för fysisk AI och plattformen Halos
- Dataassimilering i Earth-2
- Beskärning av LLM:er som en fysiker
- NVIDIA, Egyptens AI-ekosystem
- NVIDIA, fem företag och koldioxidsnål energi
- NVIDIA AI på X, Golden Tickets till GTC Berlin
- Alibaba Qwen på X, stöd för Qwen-Image-2.1
- OpenAI Academy utökas med nya utbildningsspår
- Runway på X, API-hackathon
- HeyGen på X, benchmark Code2Video
- Suno på X, ljudeffekter beskrivna med naturligt språk
- Gemini App på X, shoppingdemonstration
- Together AI på X, session med Ollama
- Boris-2-0907 och Boris-2-0917
- Sammanfattningsbias: ett förregistrerat test av ett riktningsfel hos LLM-bedömare
- Jag jämförde Jev med öppna stackar som enbart körs på processor
- Konstruktion av beslutskretsar
- Cohere på X, kampanjen AI for Empowerment
- Cohere på X, Hack The North