Zoeken

Sol-H3 genereert video sneller dan de afspeelduur, CMS Manhattan richt zich op de processor, een corpus voorziet 106.892 geluiden in 58 talen van tijdstempels

Artikel gegenereerd door kunstmatige intelligentie
Sol-H3 genereert video sneller dan de afspeelduur, CMS Manhattan richt zich op de processor, een corpus voorziet 106.892 geluiden in 58 talen van tijdstempels

ai-powered-markdown-translator

Artikel vertaald van het Frans naar het Nederlands met gpt-5.6-sol.

Bekijk project op GitHub ↗

NVIDIA Research brengt Sol-H3 uit, een inference-stack die vijf seconden video genereert in minder tijd dan het afspelen van de clip duurt, onder de Apache 2.0-licentie. Diezelfde dag publiceert een aanbieder op Hugging Face twee modellijnen die zijn toegesneden op de processor, met beloften die door geen enkele meting worden onderbouwd, terwijl een Indiaas team een corpus met spraak in lawaai beschikbaar stelt waarin elke tijdstempel een gedocumenteerde verificatieketen doorloopt. Google Research breidt daarnaast zijn proeven met vliegroutes die condensstrepen vermijden uit naar Azië.


Sol-H3 genereert vijf seconden video in 1,653 seconde, sneller dan de afspeelduur

7 september — Het Efficient AI-team van NVIDIA Research brengt samen met zijn laboratorium in Singapore Sol-H3 uit, een volledige inference-stack voor het videomodel MiniMax-H3. Het resultaat laat zich in één zin samenvatten: vijf seconden video in 1344×768 met 24 beelden per seconde, inclusief stereogeluid dat in dezelfde doorgang wordt gegenereerd, geproduceerd in 1,653 seconde op een systeem met acht B300 Blackwell-accelerators. Het model maakt de clip dus sneller dan een kijker hem kan bekijken.

De vergelijking betreft volledige profielen, niet slechts een wijziging van de attention-kernel. Het referentieprofiel, Base H3 Dense, gebruikt 50 scheduler-stappen, oftewel 49 forward passes van het DiT-netwerk; Sol-H3 gebruikt er slechts vier.

HardwareconfiguratieGegenereerde duurBase H3, 50 stappenSol-H3, 4 stappenVersnelling
8× B3005 s18,250 s1,653 s11,04×
8× B30010 s50,660 s3,732 s13,57×
8× B30015 s99,513 s6,612 s15,05×
4× B3005 s35,328 s2,918 s12,11×
4× B30015 s194,930 s12,542 s15,54×
1× B3005 s129,898 s13,745 s9,45×

De versnelling piekt op 15,54×, een maximum dat wordt bereikt met vier B300’s voor vijftien seconden video. Het protocol is ongewoon expliciet: medianen van drie uitvoeringen na een opwarmfase, met dezelfde prompt en seed; de timer omvat de tekstencoding, DiT-denoising en VAE-decoding, maar niet het laden van het model en de uiteindelijke MP4-encoding.

De stack verenigt twee afzonderlijk ontwikkelde bouwstenen: Sol-Engine voor de video-inference-runtime en Sol-Attn voor sparse attention, die direct wordt toegepast zonder hertraining. Daarbij komen fused kernels, inter-GPU-communicatie in INT8 voor de QKV-projecties en in FP8 voor de outputs, parallelle en gebatchte VAE-decoding en caching van de AdaLN-parameters. De voorbereiding van sparse attention daalt van 1,206 naar 0,285 milliseconde, de VAE-decoding van 7,55 naar 0,602 seconde, en per GPU komt ongeveer 24 GB geheugen vrij.

Twee beslissingen maken de publicatie bruikbaar buiten de demonstratie: de code verschijnt onder de Apache 2.0-licentie en elke reeds voor MiniMax-H3 getrainde LoRA met weinig stappen (few-step) werkt met dezelfde runtime. Dankzij open API-toegang via Reactor vanaf de eerste dag hoeven acht B300’s niet te worden gereserveerd om het uit te proberen.

For us, the bigger milestone is crossing from “fast generation” into “faster than playback.” That opens the path toward continuous 24 FPS generation and truly interactive video systems.

🇳🇱 Voor ons is de echte mijlpaal de overgang van ‘snelle generatie’ naar ‘sneller dan de afspeelduur’. Dit maakt de weg vrij voor continue generatie met 24 FPS en werkelijk interactieve videosystemen.@xieenze_jr op X

🔗 Sol-H3-projectpagina, NVIDIA Research

🔗 API-toegang vanaf de eerste dag via Reactor


Een open corpus voorziet 106.892 echte geluiden in 58 Indiase talen van tijdstempels

7 september — Het ARTPARK-team van het Indian Institute of Science publiceert de Vaani Noise Event Timestamp Dataset, een laag met menselijke annotaties boven op het corpus met spontane spraak Project Vaani. Elk achtergrondgeluid is daarin voorzien van een type en begin- en eindtijdstippen, tot op de milliseconde nauwkeurig.

Eigenschap van het corpusWaarde
Totaal geannoteerde audiomeer dan 122 uur
Geluidsgebeurtenissen met tijdstempel106 892, in 7 categorieën
Spraaksegmenten en sprekers72 756 segmenten, 38 541 stemmen
Taalkundige en geografische dekking58 talen, 30 deelstaten
Geverifieerde set en ruwe setongeveer 22 u en ongeveer 100 u

Het methodologische kernpunt is dit: spraak en geluid zijn samen opgenomen met gewone telefoons, zonder toevoeging van synthetisch geluid of mixage achteraf. Niet-vocale menselijke geluiden, hoesten en lachen komen in ongeveer 38 procent van de segmenten voor, maar duren minder dan een halve seconde; dieren en verkeer zijn zeldzamer en veel langduriger en nemen samen het grootste deel van de totale geluidsduur voor hun rekening. Elke tijdstempel doorloopt annotatie, een consistentiecontrole, een interne hercontrole en vervolgens een onafhankelijke audit van een willekeurig geselecteerde tiende van het corpus: als slechts één onderdeel niet slaagt, wordt de hele batch opnieuw uitgevoerd.

🔗 Blogbericht van ARTPARK-IISc op Hugging Face


CMS Manhattan publiceert twee modellijnen voor processors, zonder ondersteunende benchmark

6 september — Aanbieder CMS Manhattan publiceert op Hugging Face twee releases met open weights die bedoeld zijn voor inference op processors in plaats van grafische kaarten. Beide berichten zijn door de modelaanbieder zelf gepubliceerd, en alles wat volgt wordt ook als zodanig gepresenteerd.

De eerste, de JiRack Ultra-serie, omvat vier modellen met ternaire 1,58-bitgewichten in BitNet-stijl, volgens de aanbieder afgeleid van de DeepSeek-R1-Distill-Qwen-32B-architectuur. Het interessantste element is niet de quantization, maar de tokenizer, die is uitgebreid met speciale tokens voor routing, tool calls, robotische besturingstags en media, waarmee wordt gemikt op agentic systems en embedded robotics. De tweede, JiRackDeltaNet_27b, is gebaseerd op een Qwen 3.8 met 27 miljard parameters die is gemigreerd naar een DeltaNet-architectuur, waarin full attention en Gated DeltaNet-lagen verwant aan state-space models elkaar afwisselen, met een aangekondigde context van 262.144 tokens.

ModellijnDoor de aanbieder opgegeven basisIndeling van de gepubliceerde gewichtenLicentie en packaging
JiRack Ultra, vier groottesDeepSeek-R1-Distill-Qwen-32Bternaire 1,58-bitgewichten, GGUF Q2_K tot Q4_K_Mgewichten op de Hub, Docker-images en interface op abonnementsbasis
JiRack DeltaNet 27BQwen 3.8 27B gemigreerd naar DeltaNetreguliere llama.cpp-GGUF’s geproduceerd vanuit FP16gewichten onder MIT-licentie, Docker-image en interface voor 12 dollar per gebruiker per jaar

Twee kanttekeningen zijn belangrijk voor de lezer. Ondanks de labels ternary en bitnet in de DeltaNet-repository komt de gepubliceerde GGUF-lijn overeen met reguliere llama.cpp-quantizations en niet met een afzonderlijk ternair checkpoint, wat het bericht zelf erkent. En de belofte van een kwaliteit die dicht bij Opus 4.6 Max ligt, waarmee het tweede bericht kopt, wordt door geen enkel benchmarkresultaat onderbouwd: precies dat ontbreekt, een gepubliceerde vergelijkende meting, om deze modellen op iets anders dan hun documentatie te kunnen beoordelen.

🔗 JiRack Ultra-serie op Hugging Face

🔗 JiRack DeltaNet 27B op Hugging Face


Waarom RL-omgevingen vandaag wel werken en in 2016 niet

7 september — Sergio Paniego publiceert op de blog van Hugging Face een terugblik die begint met een opvallende observatie: de beschrijving van OpenAI Universe, gepubliceerd in december 2016, zou vandaag vrijwel ongewijzigd in een blogbericht van een toonaangevend laboratorium kunnen staan. Toch is de repository gearchiveerd.

De tijdlijn loopt van de Arcade Learning Environment in 2012 tot OpenAI Gym in 2016 en zijn minimale vocabulaire, reset() en step(), dat sindsdien als Gymnasium is voortgezet onder de Farama Foundation. Daarna volgt de domeinspecifieke golf, van World of Bits via WebArena tot SWE-bench en Terminal-Bench: een taak begint vaak als benchmark voordat ze een trainingsomgeving wordt.

De kern van de analyse bestaat uit vijf onderdelen die in 2016 ontbraken: geen pre-trained model dat als degelijk vertrekpunt kon dienen, een taak die buiten bereik lag, een interface die op de mens in plaats van op de machine was afgestemd, geen recept voor sparse rewards en de onmogelijkheid om duizenden wegwerp-sandboxes te orkestreren. GRPO en verifiable rewards leveren vandaag het vierde onderdeel. Het artikel sluit af met OpenEnv, een standaardinterface die in oktober 2025 werd aangekondigd door het PyTorch-team van Meta en Hugging Face, en met een markt voor omgevingen waarop onder meer Prime Intellect en Mechanize actief zijn.

🔗 Terugblik op RL-omgevingen


Google laat meer dan 80 vluchten van Cathay Pacific een route volgen die condensstrepen vermijdt

7 september — Google Research breidt zijn proeven om condensstrepen te vermijden uit naar de regio Azië-Pacific, met Cathay Pacific als eerste commerciële luchtvaartpartner in de regio. Op papier is de aanpak eenvoudig: de hoogte licht aanpassen om koude en vochtige zones te omzeilen waar condensstrepen blijven hangen als warmtevasthoudende sluiers.

Maatstaf uit de eerste faseWaarde
Beoogde vluchten binnen het netwerk van Cathay Pacificmeer dan 100
Vluchten die daadwerkelijk een vermijdingsroute volgdenmeer dan 80
Geschatte afname van het opwarmende effect van condensstrepenongeveer 40 %
Aandeel van de corridor Hongkong-Singapore in de winstmeer dan 50 %
Aandeel van condensstrepen in de klimaatimpact van de luchtvaartongeveer een derde

Het systeem combineert voorspellingen van Googles modellen, satellietbeelden en geavanceerde meteorologische gegevens. De voorspellingen bereiken de cockpit via de wifi aan boord en de elektronische vluchtmap van de maatschappij (Electronic Flight Folder), zonder de gebruikelijke procedures te onderbreken, en de aanpassingen blijven binnen de vastgestelde veiligheidsparameters. Een uitgebreide tweede fase gaat van start, met Contrails.org als partner.

Contrail mitigation remains one of the most immediately available, scalable, and cost-effective ways to reduce aviation’s climate footprint, and it can get started now, with today’s aircrafts and fuel.

🇳🇱 Het beperken van condensstrepen blijft een van de meest direct beschikbare, breed toepasbare en kosteneffectieve manieren om de klimaatvoetafdruk van de luchtvaart te verkleinen, en het kan nu al beginnen, met de vliegtuigen en brandstoffen van vandaag. — Kemal Armada en Max Vogler, Google Research

🔗 Blogbericht van Google Research


Genspark voegt Muse Spark 1.3 toe aan drie van zijn producten

7 september — Genspark integreert Muse Spark 1.3, het model van Meta, in AI Chat, Code Agent en Claw, vijf dagen na de aankondiging ervan. Het platform neemt de twee cijfers over die Meta ter onderbouwing van de keuze aanvoert: 20 procent minder tool calls en 25 procent minder tokenverbruik, twee maatstaven die rechtstreeks van invloed zijn op de kosten van een agent die langdurige taken in een lus uitvoert.

Het tempo is het echte signaal. In zes dagen heeft Genspark vier modellen van verschillende aanbieders geïntegreerd: Claude Fable 5.1 op 2 september, Gemini 3.8 Flash op 3 september, GPT-6 Astra op 5 september en Muse Spark 1.3 op 7 september. Het platform positioneert zich minder als een model en meer als een orchestration-laag die de releases van alle laboratoria binnen enkele dagen na publicatie opneemt.

🔗 Aankondiging van Genspark op X


Kort nieuws

  • Replit opent zijn eerste internationale kantoor in Londen — het bedrijf maakt er het centrum van zijn Europese activiteiten van, samen met de Londense burgemeester Sadiq Khan, de Britse regering en London & Partners, en kondigt met TLMA een proefproject voor bijscholing aan voor jonge Londenaren zonder werk of opleiding. 🔗 Publicatie
  • Tolquane, een Python-bibliotheek voor samenstelbaar parallellisme — dezelfde graaf wordt zonder codewijzigingen uitgevoerd met threads, processen, async, gedistribueerd of sequentieel, met 5,6 keer de referentiesnelheid op Python 3.14t zonder global lock, tegenover 0,9 keer met threads en de GIL. Niet-blokkeren geldt daarbij als ontwerpregel, met een foutmelding die de geblokkeerde nodes benoemt. 🔗 Blogpost
  • Een speciale action om een agent skill te installeren — de Aiden-firmware stuurt een skill-URL voortaan naar één action die de skill voorbereidt, valideert en vervolgens atomair publiceert. Reproductie op een echte agent brengt een trace met meerdere tools terug tot één enkele call. 🔗 Blogpost
  • Together AI zet GLM-5.3 Flash tegenover GPT-5.6 Terra wat betreft kosten per taak — dezelfde score op de intelligentie-index van Artificial Analysis, maar volgens de host 82 procent goedkoper per taak; die publiceert noch de berekeningsmethode noch een uitvoerige blogpost en biedt zelf het vergeleken model aan. 🔗 Publicatie
  • Een manifest voor een Braziliaans AI-ecosysteem — een Portugese tekst die de metafoor van het natuurlijke ecosysteem doortrekt naar de AI-gemeenschap van het land, zonder model, dataset of meting. Vermeld voor de volledigheid. 🔗 Blogpost
  • Google DeepMind selecteert 16 organisaties voor zijn AI for the Planet-accelerator in Azië-Pacific — de eerste lichting begint met een intensieve bootcamp in Singapore en krijgt daarna drie maanden toegang tot de modellen AnthroKrishi, ForestCast, AlphaEarth Foundations, SpeciesNet en Perch, verdeeld over natuurbescherming, duurzame landbouw en koolstofoplossingen. 🔗 Blogpost
  • GitHub brengt de canvases van zijn Copilot-app opnieuw onder de aandacht — een herlancering van een artikel van 17 augustus waarin het canvas wordt voorgesteld als een gedeeld en duurzaam werkvlak waarop de status van het werk zichtbaar blijft, met een zelden gepubliceerd cijfer: 2.000 tot 3.000 AI Credits om elk van de twee genoemde voorbeelden te bouwen. 🔗 Publicatie
  • GitHub lanceert een aliasgenerator voor GitHub Universe — een promotionele communityactiviteit in aanloop naar de editie van oktober 2026, zonder verband met AI of een productfunctie. 🔗 Publicatie
  • Synthesia licht zijn drie onderzoekslijnen voor ECCV 2026 toe — door audio aangestuurde generatieve avatars, toegepast spraakonderzoek voor spraakherkenning en interactieve avatars, onder de noemer van een mensgericht wereldmodel. 🔗 Publicatie
  • Mati Staniszewski verwacht de conversationele Turingtest binnen zes tot twaalf maanden — de medeoprichter en CEO van ElevenLabs zegt dit in de GDIY-podcast, waarvan het interview door de audiodienst van het bedrijf met een Franse nasynchronisatie wordt aangeboden. 🔗 Publicatie
  • QwenCloud publiceert het verslag van de Qwen Conference Thailand 2026 — bijna 400 klanten en ontwikkelaars kwamen op 4 september bijeen in Bangkok, met een end-to-enddemonstratie waarin de agent zelf de klant is, van registratie tot betaling en facturering zonder menselijke tussenkomst. 🔗 Publicatie
  • Cohere deelt een reportage van CNN over Toronto als wereldwijd AI-centrum — communicatie zonder productaankondiging, die verwijst naar de derde plaats wereldwijd van de stad voor technologisch talent volgens CBRE, naar meer dan 2 miljard dollar die via de Canadese nationale strategie is toegezegd, en naar een door Cohere gemelde toestroom van klantaanvragen na de exportcontroles op de modellen van Anthropic. 🔗 Publicatie

Wat dit betekent

De door Sol-H3 overschreden drempel is niet zomaar nog een record in een lijst. Zolang het produceren van een clip meer tijd kost dan het bekijken ervan, blijft videogeneratie batchwerk: starten, wachten, bekijken. Onder die drempel komen opent een andere gebruikscategorie, waarbij het beeld wordt gemaakt terwijl het wordt bekeken. Voor een professional is het belangrijke detail dat de winst niet van een nieuw model komt: het model is hetzelfde, alleen de inferentiestack verandert. De factor 15 zat dus in de uitvoeringsengineering, niet in de gewichten, en die wordt onder Apache 2.0 gepubliceerd met compatibiliteit met bestaande LoRA’s.

De dag laat twee manieren zien om open gewichten te publiceren. Aan de ene kant staan twee zelfgepubliceerde blogposts waarvan de kwaliteitsclaims door geen enkele vergelijkbare meting worden ondersteund, met repositorylabels die niet overeenkomen met het daadwerkelijk geleverde formaat, en een vergelijking van de kosten per taak die zonder gepubliceerde methode wordt aangekondigd door de host van het winnende model. Aan de andere kant staat een spraakcorpus waarin elke tijdstempel een auditketen doorloopt en waarbij het team expliciet onderscheid maakt tussen 22 geverifieerde uren en 100 ongeverifieerde uren. In een publieke repository waarin iedereen kan publiceren, wordt verificatiediscipline het enige bruikbare signaal, en die kost meer om te produceren dan een pakkende titel.

De terugblik op RL-omgevingen en het integratietempo van Genspark vertellen op twee verschillende schalen over dezelfde verschuiving. De eerste legt uit waarom een idee uit 2016 nu werkt: het waren niet de algoritmen die ontbraken, maar de omliggende infrastructuur, van het basismodel tot wegwerpbare sandboxes. De tweede laat zien wat er met die infrastructuur gebeurt zodra die beschikbaar is, wanneer een platform in zes dagen vier modellen van vier aanbieders aansluit. In beide gevallen verschuift de waarde van het model naar de omringende laag, en die laag wordt gestandaardiseerd, met OpenEnv aan de ene kant en multi-modelorchestrators aan de andere.

Dan blijft nog over wat buiten de wedloop tussen modellen valt. De proef met Cathay Pacific draait om bestaande vliegtuigen en brandstoffen: het enige wat wordt toegevoegd, is een voorspelling die op het juiste moment in de cockpit wordt geleverd, voor een geschatte vermindering van ongeveer 40 procent op de betrokken vluchten. Het Vaani-corpus bestrijkt 58 Indiase talen, waarvan er verscheidene nog geen spraakbronnen met achtergrondgeluid hadden, en de Azië-Pacific-accelerator van DeepMind verstrekt gespecialiseerde modellen aan zestien teams in het veld. Deze drie projecten hoeven geen benchmark te verslaan. Hun uitdaging ligt elders: in de gegevens die moeten worden verzameld en de implementatie die moet slagen. Ook daar wordt het verschil gemaakt tussen een demonstratie en een meetbaar effect.


Bronnen