ai-powered-markdown-translatorArtikel översatt från franska till svenska med gpt-5.6-sol.
NVIDIA Research släpper Sol-H3, en inferensstack som minskar tiden för att generera fem sekunders video till mindre än klippets uppspelningstid, under Apache 2.0-licensen. Samma dag publicerar en utvecklare två modellserier på Hugging Face som är optimerade för processorer, med löften som inte har mätts, medan ett indiskt team öppnar en korpus med brusigt tal där varje tidsstämpel genomgår en dokumenterad verifieringskedja. Google Research utökar dessutom sina försök i Asien med flygrutter som undviker kondensstrimmor.
Sol-H3 genererar fem sekunders video på 1,653 sekunder, snabbare än den kan spelas upp
7 september — Efficient AI-teamet på NVIDIA Research publicerar tillsammans med sitt laboratorium i Singapore Sol-H3, en komplett inferensstack för videomodellen MiniMax-H3. Resultatet kan sammanfattas i en enda mening: fem sekunders video i 1344×768 med 24 bilder per sekund och stereoljud genererat i samma körning, framställd på 1,653 sekunder i ett system med åtta B300 Blackwell-acceleratorer. Modellen skapar alltså klippet snabbare än en tittare hinner se det.
Jämförelsen gäller fullständiga profiler, inte bara ett byte av attention-kärna. Referensprofilen Base H3 Dense använder 50 schemaläggningssteg, vilket motsvarar 49 framåtpasseringar genom DiT-nätverket; Sol-H3 använder endast fyra.
| Maskinvarukonfiguration | Genererad längd | Base H3, 50 steg | Sol-H3, 4 steg | Acceleration |
|---|---|---|---|---|
| 8× B300 | 5 s | 18,250 s | 1,653 s | 11,04× |
| 8× B300 | 10 s | 50,660 s | 3,732 s | 13,57× |
| 8× B300 | 15 s | 99,513 s | 6,612 s | 15,05× |
| 4× B300 | 5 s | 35,328 s | 2,918 s | 12,11× |
| 4× B300 | 15 s | 194,930 s | 12,542 s | 15,54× |
| 1× B300 | 5 s | 129,898 s | 13,745 s | 9,45× |
Accelerationen når som mest 15,54×, ett maximum som uppnås med fyra B300 för femton sekunders video. Protokollet är ovanligt tydligt: medianvärden från tre körningar efter uppvärmning, med identisk prompt och seed; tidtagningen omfattar textkodning, DiT-avbrusning och VAE-avkodning, men inte modellinläsning eller den slutliga MP4-kodningen.
Stacken förenar två komponenter som utvecklats separat: Sol-Engine för videoinferensens runtime och Sol-Attn för gles attention (sparse attention) som tillämpas dynamiskt utan omträning. Därtill kommer sammanslagna kärnor, kommunikation mellan GPU:er i INT8 för QKV-projektionerna och i FP8 för utdata, parallelliserad VAE-avkodning i batcher samt cachning av AdaLN-parametrarna. Förberedelsen av gles attention sjunker från 1,206 till 0,285 millisekunder, VAE-avkodningen från 7,55 till 0,602 sekunder, och omkring 24 GB minne frigörs per GPU.
Två beslut gör publiceringen användbar även utanför demonstrationen: koden släpps under Apache 2.0-licensen och varje redan tränad LoRA med få steg (few-step) för MiniMax-H3 kan användas med samma runtime. Öppen API-åtkomst via Reactor från första dagen gör att man slipper binda upp åtta B300 för att prova.
For us, the bigger milestone is crossing from “fast generation” into “faster than playback.” That opens the path toward continuous 24 FPS generation and truly interactive video systems.
🇸🇪 För oss är den verkliga milstolpen övergången från ”snabb generering” till ”snabbare än uppspelningen”. Det banar väg för kontinuerlig generering i 24 FPS och verkligt interaktiva videosystem. — @xieenze_jr på X
🔗 Projektsidan för Sol-H3, NVIDIA Research
🔗 API-åtkomst från första dagen via Reactor
En öppen korpus tidsstämplar 106 892 verkliga ljud på 58 indiska språk
7 september — ARTPARK-teamet vid Indian Institute of Science publicerar Vaani Noise Event Timestamp Dataset, ett lager av mänskligt skapade annoteringar ovanpå korpusen med spontant tal Project Vaani. Varje bakgrundsljud har försetts med en typ samt start- och sluttid, med millisekundprecision.
| Egenskap hos korpusen | Värde |
|---|---|
| Totalt annoterat ljud | mer än 122 timmar |
| Tidsstämplade ljudhändelser | 106 892, i 7 kategorier |
| Talsegment och talare | 72 756 segment, 38 541 röster |
| Språklig och geografisk täckning | 58 språk, 30 delstater |
| Verifierad datamängd och rå datamängd | cirka 22 h och cirka 100 h |
Det metodologiskt viktiga är följande: tal och brus spelades in tillsammans med vanliga telefoner, utan att syntetiskt brus infogades eller blandades in i efterhand. Icke-verbala mänskliga ljud, hostningar och skratt förekommer i omkring 38 procent av segmenten men varar mindre än en halv sekund; djur och trafik är ovanligare och betydligt mer långvariga och står tillsammans för den största andelen av den sammanlagda brustiden. Varje tidsstämpel genomgår annotering, konsekvenskontroll, en andra intern verifiering och därefter en oberoende granskning av en slumpmässigt utvald tiondel av korpusen: om en enda del underkänns görs hela omgången om.
🔗 ARTPARK-IISc:s inlägg på Hugging Face
CMS Manhattan publicerar två modellserier för processorer utan stödjande benchmark
6 september — Utvecklaren CMS Manhattan publicerar två utgåvor med öppna vikter på Hugging Face, avsedda för inferens på processorer snarare än grafikkort. Båda inläggen har publicerats av modellernas utvecklare, och allt som följer presenteras som sådant.
Den första, JiRack Ultra-serien, består av fyra modeller med ternära 1,58-bitarsvikter i BitNet-stil, enligt utvecklaren baserade på arkitekturen DeepSeek-R1-Distill-Qwen-32B. Det mest intressanta är inte kvantiseringen utan tokenizern, som utökats med särskilda tokens för routing, verktygsanrop, taggar för robotstyrning och medier, med sikte på agentsystem och inbyggd robotik. Den andra, JiRackDeltaNet_27b, utgår från en Qwen 3.8 med 27 miljarder parametrar som migrerats till en DeltaNet-arkitektur. Den växlar mellan fullständig attention och Gated DeltaNet-lager besläktade med state space-modeller, med en uppgiven kontextlängd på 262 144 tokens.
| Modellserie | Bas enligt utvecklaren | Format för publicerade vikter | Licens och paketering |
|---|---|---|---|
| JiRack Ultra, fyra storlekar | DeepSeek-R1-Distill-Qwen-32B | ternära 1,58-bitarsvikter, GGUF Q2_K till Q4_K_M | vikter på Hub, Docker-images och prenumerationsbaserat gränssnitt |
| JiRack DeltaNet 27B | Qwen 3.8 27B migrerad till DeltaNet | vanliga llama.cpp-GGUF framställda från FP16 | vikter under MIT-licens, Docker-image och gränssnitt för 12 dollar per användare och år |
Två förbehåll är viktiga för läsaren. Trots märkningarna ternary och bitnet i DeltaNet-repositoriet motsvarar den publicerade GGUF-serien vanliga llama.cpp-kvantiseringar och inte en separat ternär checkpoint, vilket inlägget självt medger. Och påståendet om kvalitet nära Opus 4.6 Max, som används som rubrik för det andra inlägget, stöds inte av några benchmarkresultat: det som saknas är just ett publicerat jämförande mått för att kunna bedöma modellerna utifrån något annat än deras dokumentation.
🔗 JiRack Ultra-serien på Hugging Face
🔗 JiRack DeltaNet 27B på Hugging Face
Varför RL-miljöer fungerar i dag men inte gjorde det 2016
7 september — Sergio Paniego publicerar en tillbakablick på Hugging Faces blogg med utgångspunkt i en förbryllande observation: beskrivningen av OpenAI Universe, som publicerades i december 2016, skulle ordagrant kunna förekomma i ett blogginlägg från ett ledande laboratorium i dag. Repositoriet är ändå arkiverat.
Tidslinjen går från Arcade Learning Environment 2012 till OpenAI Gym 2016 och dess minimala vokabulär, reset() och step(), som sedan dess har förts vidare till Gymnasium under Farama Foundation. Därefter följer den domänspecifika vågen, från World of Bits till WebArena och vidare till SWE-bench och Terminal-Bench: en uppgift börjar ofta som ett benchmark innan den blir en träningsmiljö.
Analysens kärna består av fem delar som saknades 2016: ingen förtränad modell värdig att fungera som utgångspunkt, en uppgift som låg utom räckhåll, ett gränssnitt utformat efter människan snarare än maskinen, inget recept för glesa belöningar och en oförmåga att orkestrera tusentals kortlivade sandlådor. GRPO och verifierbara belöningar tillhandahåller i dag den fjärde delen. Artikeln avslutas med OpenEnv, ett standardgränssnitt som tillkännagavs i oktober 2025 av Metas PyTorch-team och Hugging Face, samt en marknad för miljöer där Prime Intellect och Mechanize ingår.
Google låter fler än 80 av Cathay Pacifics flygningar följa en rutt som undviker kondensstrimmor
7 september — Google Research utökar sina försök att undvika kondensstrimmor till Asien-Stillahavsområdet, med Cathay Pacific som regionens första kommersiella flygbolagspartner. Lösningen är enkel på papperet: att justera höjden något för att kringgå kalla och fuktiga områden där kondensstrimmor består som värmehållande täcken.
| Mått från den första fasen | Värde |
|---|---|
| Utvalda flygningar i Cathay Pacifics nätverk | mer än 100 |
| Flygningar som faktiskt följde en undvikanderutt | mer än 80 |
| Uppskattad minskning av kondensstrimmornas värmeeffekt | cirka 40 % |
| Hongkong–Singapore-korridorens andel av vinsterna | mer än 50 % |
| Kondensstrimmornas andel av flygets klimatpåverkan | cirka en tredjedel |
Systemet kombinerar prognoser från Googles modeller, satellitbilder och avancerade väderdata. Prognoserna skickas till cockpit via Wi-Fi ombord och flygbolagets elektroniska färdplan (Electronic Flight Folder) utan att störa de vanliga rutinerna, och justeringarna håller sig inom fastställda säkerhetsparametrar. En utökad andra fas inleds med Contrails.org som partner.
Contrail mitigation remains one of the most immediately available, scalable, and cost-effective ways to reduce aviation’s climate footprint, and it can get started now, with today’s aircrafts and fuel.
🇸🇪 Att minska kondensstrimmorna är fortfarande ett av de mest omedelbart tillgängliga, mest skalbara och mest kostnadseffektiva sätten att minska flygets klimatavtryck, och det kan börja redan nu med dagens flygplan och bränslen. — Kemal Armada och Max Vogler, Google Research
Genspark lägger till Muse Spark 1.3 i tre av sina produkter
7 september — Genspark integrerar Metas modell Muse Spark 1.3 i AI Chat, Code Agent och Claw fem dagar efter att den tillkännagavs. Plattformen återger de två siffror som Meta angav för att motivera valet: 20 procent färre verktygsanrop och 25 procent lägre tokenförbrukning, två mätvärden som direkt påverkar kostnaden för en agent som körs i en loop med långvariga uppgifter.
Takten är den verkliga signalen. På sex dagar har Genspark integrerat fyra modeller från olika leverantörer: Claude Fable 5.1 den 2 september, Gemini 3.8 Flash den 3:e, GPT-6 Astra den 5:e och Muse Spark 1.3 den 7:e. Plattformen positionerar sig mindre som en modell och mer som ett orkestreringslager som införlivar resultaten från alla laboratorier inom några dagar efter publiceringen.
🔗 Gensparks tillkännagivande på X
Kortnotiser
- Replit öppnar sitt första internationella kontor i London — företaget gör det till centrum för sin europeiska verksamhet, tillsammans med Londons borgmästare Sadiq Khan, den brittiska regeringen och London & Partners, och tillkännager ett pilotprogram för kompetensutveckling med TLMA för unga Londonbor som varken arbetar eller studerar. 🔗 Inlägg
- Tolquane, ett Python-bibliotek för komponerbar parallellism — samma graf körs utan kodändringar med trådar, processer, async, distribuerat eller sekventiellt, med 5,6 gånger referenshastigheten på Python 3.14t utan globalt lås jämfört med 0,9 gånger med trådar och GIL. Icke-blockering är en designregel, med ett felmeddelande som namnger de blockerade noderna. 🔗 Blogginlägg
- En särskild åtgärd för att installera en agentfärdighet — firmware Aiden dirigerar nu en URL för en färdighet till en enda åtgärd som förbereder, validerar och sedan publicerar atomärt. Reproduktionen på en verklig agent reducerar ett spår med flera verktyg till ett enda anrop. 🔗 Blogginlägg
- Together AI ställer GLM-5.3 Flash mot GPT-5.6 Terra vad gäller kostnad per uppgift — samma poäng på Artificial Analysis intelligensindex men 82 procent lägre kostnad per uppgift enligt leverantören, som varken publicerar beräkningsmetoden eller något detaljerat blogginlägg och själv tillhandahåller den jämförda modellen. 🔗 Inlägg
- Ett manifest för ett brasilianskt AI-ekosystem — en portugisisk text som använder det naturliga ekosystemet som metafor för landets AI-community, utan modell, dataset eller mätvärde. Nämns för fullständighetens skull. 🔗 Blogginlägg
- Google DeepMind väljer ut 16 organisationer till sin accelerator AI for the Planet i Asien-Stillahavsområdet — den första omgången inleddes med ett intensivt läger (bootcamp) i Singapore, följt av tre månaders tillgång till modellerna AnthroKrishi, ForestCast, AlphaEarth Foundations, SpeciesNet och Perch, fördelade på naturskydd, hållbart jordbruk och koldioxidlösningar. 🔗 Blogginlägg
- GitHub lyfter åter fram canvases i sin Copilot-app — en återlansering av en artikel från den 17 augusti som presenterar canvas som en gemensam och beständig yta där arbetsläget förblir synligt, med en sällan publicerad siffra: 2 000 till 3 000 AI Credits för att bygga vart och ett av de två exemplen. 🔗 Inlägg
- GitHub lanserar en aliasgenerator för GitHub Universe — en marknadsförande communityaktivitet inför evenemanget i oktober 2026, utan koppling till AI eller någon produktfunktion. 🔗 Inlägg
- Synthesia beskriver sina tre forskningsinriktningar för ECCV 2026 — ljudstyrda generativa avatarer, röstforskning tillämpad på taligenkänning och interaktiva avatarer, under parollen människocentrerad världsmodell. 🔗 Inlägg
- Mati Staniszewski bedömer att det samtalsbaserade Turingtestet ligger sex till tolv månader bort — medgrundaren och vd:n för ElevenLabs säger detta i podcasten GDIY, där intervjun erbjuds dubbad till franska genom företagets ljudtjänst. 🔗 Inlägg
- QwenCloud publicerar en rapport från Qwen Conference Thailand 2026 — närmare 400 kunder och utvecklare i Bangkok den 4 september, samt en heltäckande demonstration där agenten själv är kunden, från registrering till betalning och fakturering utan mänsklig inblandning. 🔗 Inlägg
- Cohere delar ett CNN-reportage om Toronto som globalt AI-nav — kommunikation utan något produktbesked, som hänvisar till stadens tredjeplats i världen för tekniktalanger enligt CBRE, över 2 miljarder dollar som avsatts genom Kanadas nationella strategi och ett ökat inflöde av kundförfrågningar som Cohere uppger har följt efter exportkontrollerna för Anthropics modeller. 🔗 Inlägg
Vad det innebär
Tröskeln som Sol-H3 har passerat är inte bara ännu ett rekord i en lista. Så länge ett klipp tar längre tid att producera än att titta på förblir videogenerering ett batcharbete: man startar, väntar och tittar. Att komma under denna tröskel öppnar en annan användningskategori, där bilden skapas medan man tittar på den. Det viktiga för en praktiker är att vinsten inte kommer från en ny modell: modellen är densamma, bara inferensstacken har förändrats. Faktorn 15 låg alltså i exekveringstekniken, inte i vikterna, och den publiceras under Apache 2.0 med kompatibilitet för befintliga LoRA.
Dagen visar två olika sätt att publicera öppna vikter. På ena sidan finns två egenpublicerade blogginlägg vars kvalitetsanspråk inte stöds av några jämförbara mätningar, med repositoryetiketter som inte motsvarar det format som faktiskt levereras, samt en jämförelse av kostnaden per uppgift som presenterats av leverantören för den vinnande modellen utan någon publicerad metod. På den andra sidan finns en talkorpus där varje tidsstämpel passerar genom en granskningskedja och där teamet uttryckligen skiljer mellan 22 verifierade timmar och 100 timmar som inte är verifierade. I ett offentligt repository där vem som helst kan publicera blir noggrann verifiering den enda användbara signalen, och den kostar mer att producera än en slagkraftig rubrik.
Tillbakablicken på RL-miljöer och Gensparks integrationstakt berättar om samma förskjutning, i två olika skalor. Den första förklarar varför en idé från 2016 fungerar i dag: det var inte algoritmerna som saknades utan infrastrukturen runt dem, från utgångsmodellen till tillfälliga sandlådor. Den andra visar vad denna infrastruktur blir när den väl finns tillgänglig, när en plattform kopplar in fyra modeller från fyra leverantörer på sex dagar. I båda fallen flyttar värdet från modellen till lagret runt den, och detta lager standardiseras, med OpenEnv på ena sidan och orkestrerare för flera modeller på den andra.
Sedan återstår det som inte hör till modellkapplöpningen. Försöket med Cathay Pacific gäller befintliga flygplan och bränslen: det enda som läggs till är en prognos som levereras vid rätt tidpunkt i cockpit, för en uppskattad minskning på omkring 40 procent på de berörda flygningarna. Vaani-korpusen omfattar 58 indiska språk, varav flera tidigare helt saknade resurser med tal i bullriga miljöer, och DeepMinds accelerator för Asien-Stillahavsområdet tillhandahåller specialiserade modeller till sexton fältteam. Inget av dessa tre arbeten har något benchmark att slå. Deras begränsning finns på annat håll, i den data som måste samlas in och den driftsättning som måste lyckas, och det är också där skillnaden mellan en demonstration och en mätbar effekt avgörs.
Källor
- Sol-H3, tillkännagivande av Enze Xie på X
- Sol-H3:s projektsida, NVIDIA Research
- API-åtkomst till Sol-H3 via Reactor
- Vaani Noise Event Timestamp Dataset, ARTPARK-IISc
- JiRack Ultra-serien, CMS Manhattan
- JiRack DeltaNet 27B, CMS Manhattan
- RL-miljöernas historia, Hugging Face
- Undvikande av kondensstrimmor på ultralångdistansflygningar, Google Research
- Muse Spark 1.3 i Genspark
- Replit öppnar sitt Londonkontor
- Tolquane, komponerbar parallellism i Python
- Direktinstallation av färdigheter i firmware Aiden
- Together AI jämför GLM-5.3 Flash och GPT-5.6 Terra
- Manifest för ett brasilianskt AI-ekosystem
- Acceleratorn AI for the Planet i Asien-Stillahavsområdet, Google DeepMind
- Canvases i Copilot-appen
- Aliasgenerator för GitHub Universe
- Synthesia på ECCV 2026
- Mati Staniszewski i podcasten GDIY
- Rapport från Qwen Conference Thailand 2026
- Cohere delar CNN:s reportage om Toronto