NVIDIA Research publie Sol-H3, une pile d’inférence qui fait descendre la génération de cinq secondes de vidéo sous la durée de lecture du clip, sous licence Apache 2.0. Le même jour, un éditeur publie sur Hugging Face deux lignes de modèles taillées pour le processeur, avec des promesses que rien ne mesure, tandis qu’une équipe indienne ouvre un corpus de parole bruitée dont chaque horodatage traverse une chaîne de vérification documentée. Google Research étend par ailleurs à l’Asie ses essais de routes aériennes qui évitent les traînées de condensation.
Sol-H3 génère cinq secondes de vidéo en 1,653 seconde, plus vite que leur lecture
7 septembre — L’équipe Efficient AI de NVIDIA Research, avec son laboratoire de Singapour, publie Sol-H3, une pile d’inférence complète pour le modèle vidéo MiniMax-H3. Le résultat tient en une phrase : cinq secondes de vidéo en 1344×768 à 24 images par seconde, audio stéréo généré dans la même passe, produites en 1,653 seconde sur un système à huit accélérateurs B300 Blackwell. Le modèle fabrique donc le clip plus vite qu’un spectateur ne le regarde.
La comparaison porte sur des profils complets, pas sur un simple changement de noyau d’attention. Le profil de référence, Base H3 Dense, consomme 50 étapes d’ordonnanceur, soit 49 passes avant du réseau DiT ; Sol-H3 n’en utilise que quatre.
| Configuration matérielle | Durée générée | Base H3, 50 étapes | Sol-H3, 4 étapes | Accélération |
|---|---|---|---|---|
| 8× B300 | 5 s | 18,250 s | 1,653 s | 11,04× |
| 8× B300 | 10 s | 50,660 s | 3,732 s | 13,57× |
| 8× B300 | 15 s | 99,513 s | 6,612 s | 15,05× |
| 4× B300 | 5 s | 35,328 s | 2,918 s | 12,11× |
| 4× B300 | 15 s | 194,930 s | 12,542 s | 15,54× |
| 1× B300 | 5 s | 129,898 s | 13,745 s | 9,45× |
L’accélération culmine à 15,54×, un maximum atteint sur quatre B300 pour quinze secondes de vidéo. Le protocole est inhabituellement explicite : médianes de trois exécutions après chauffe, à prompt et graine identiques ; le chronomètre couvre l’encodage du texte, le débruitage DiT et le décodage VAE, mais exclut le chargement du modèle et l’encodage MP4 final.
La pile réunit deux briques développées séparément : Sol-Engine pour le runtime d’inférence vidéo, Sol-Attn pour l’attention parcimonieuse (sparse attention) appliquée à la volée, sans réentraînement. S’y ajoutent des noyaux fusionnés, une communication inter-GPU en INT8 sur les projections QKV et en FP8 sur les sorties, un décodage VAE parallélisé et traité par lots, et la mise en cache des paramètres AdaLN. La préparation de l’attention parcimonieuse tombe de 1,206 à 0,285 milliseconde, le décodage VAE de 7,55 à 0,602 seconde, et environ 24 Go de mémoire sont libérés par GPU.
Deux décisions rendent la publication utilisable au-delà de la démonstration : le code sort sous licence Apache 2.0, et tout LoRA à peu d’étapes (few-step) déjà entraîné pour MiniMax-H3 se branche sur le même runtime. Un accès API ouvert avec Reactor dès le premier jour évite d’immobiliser huit B300 pour essayer.
For us, the bigger milestone is crossing from “fast generation” into “faster than playback.” That opens the path toward continuous 24 FPS generation and truly interactive video systems.
🇫🇷 Pour nous, le vrai jalon est le passage de la « génération rapide » à « plus rapide que la lecture ». Cela ouvre la voie vers la génération continue à 24 FPS et des systèmes vidéo réellement interactifs. — @xieenze_jr sur X
🔗 Page projet Sol-H3, NVIDIA Research
🔗 Accès API dès le premier jour via Reactor
Un corpus ouvert horodate 106 892 bruits réels dans 58 langues indiennes
7 septembre — L’équipe ARTPARK de l’Indian Institute of Science publie le Vaani Noise Event Timestamp Dataset, une couche d’annotation humaine posée sur le corpus de parole spontanée Project Vaani. Chaque bruit de fond y porte son type et ses instants de début et de fin, à la milliseconde près.
| Propriété du corpus | Valeur |
|---|---|
| Audio annoté au total | plus de 122 heures |
| Événements de bruit horodatés | 106 892, en 7 catégories |
| Segments de parole et locuteurs | 72 756 segments, 38 541 voix |
| Couverture linguistique et géographique | 58 langues, 30 États |
| Ensemble vérifié et ensemble brut | environ 22 h et environ 100 h |
Le point de méthode est là : parole et bruit ont été captés ensemble, sur des téléphones ordinaires, sans insertion de bruit synthétique ni mixage a posteriori. Les sons humains non vocaux, toux et rires, apparaissent dans environ 38 pour cent des segments mais durent moins d’une demi-seconde ; animaux et trafic sont plus rares et bien plus longs, et pèsent ensemble la plus grande part du temps de bruit. Chaque horodatage traverse une annotation, une vérification de cohérence, une re-vérification interne, puis un audit indépendant sur un dixième du corpus tiré au hasard : si un seul échoue, le lot entier est refait.
🔗 Billet ARTPARK-IISc sur Hugging Face
CMS Manhattan publie deux lignes de modèles pour processeur, sans benchmark à l’appui
6 septembre — L’éditeur CMS Manhattan met en ligne sur Hugging Face deux publications de poids ouverts destinées à l’inférence sur processeur plutôt que sur carte graphique. Les deux billets sont auto-publiés par l’éditeur des modèles, et tout ce qui suit est présenté comme tel.
La première, la série JiRack Ultra, réunit quatre modèles à poids ternaires 1,58 bit de style BitNet, dérivés selon l’éditeur de l’architecture DeepSeek-R1-Distill-Qwen-32B. L’élément le plus intéressant n’est pas la quantification mais le tokenizer, étendu avec des jetons dédiés au routage, à l’appel d’outils, aux balises de contrôle robotique et aux médias, ce qui vise les systèmes agentiques et la robotique embarquée. La seconde, JiRackDeltaNet_27b, reprend un Qwen 3.8 de 27 milliards de paramètres migré sur une architecture DeltaNet, qui alterne attention complète et couches Gated DeltaNet apparentées aux modèles à espace d’états, pour un contexte annoncé à 262 144 tokens.
| Ligne de modèles | Base annoncée par l’éditeur | Format des poids publiés | Licence et packaging |
|---|---|---|---|
| JiRack Ultra, quatre tailles | DeepSeek-R1-Distill-Qwen-32B | poids ternaires 1,58 bit, GGUF Q2_K à Q4_K_M | poids sur le Hub, images Docker et interface sur abonnement |
| JiRack DeltaNet 27B | Qwen 3.8 27B migré sur DeltaNet | GGUF llama.cpp ordinaires produites depuis le FP16 | poids sous licence MIT, image Docker et interface à 12 dollars par utilisateur et par an |
Deux réserves comptent pour le lecteur. Malgré les étiquettes ternary et bitnet du dépôt DeltaNet, la ligne GGUF publiée correspond à des quantifications llama.cpp ordinaires et non à un point de contrôle ternaire distinct, ce que le billet reconnaît lui-même. Et la promesse de qualité proche d’Opus 4.6 Max qui sert de titre au second billet n’est étayée par aucun résultat de benchmark : il manque exactement cela, une mesure comparative publiée, pour juger ces modèles autrement que sur leur documentation.
🔗 Série JiRack Ultra sur Hugging Face
🔗 JiRack DeltaNet 27B sur Hugging Face
Pourquoi les environnements RL fonctionnent aujourd’hui et pas en 2016
7 septembre — Sergio Paniego publie sur le blog de Hugging Face une rétrospective qui part d’une observation troublante : la description d’OpenAI Universe, publiée en décembre 2016, pourrait figurer telle quelle dans un billet de laboratoire de pointe aujourd’hui. Le dépôt est pourtant archivé.
La chronologie va de l’Arcade Learning Environment en 2012 à OpenAI Gym en 2016 et son vocabulaire minimal, reset() et step(), passé depuis à Gymnasium sous la Farama Foundation. Suit la vague par domaine, de World of Bits à WebArena puis SWE-bench et Terminal-Bench : une tâche commence souvent comme benchmark avant de devenir un terrain d’entraînement.
Le cœur de l’analyse tient en cinq pièces manquantes en 2016 : pas de modèle pré-entraîné digne de servir de point de départ, une tâche hors de portée, une interface calquée sur l’humain plutôt que sur la machine, aucune recette pour les récompenses éparses, et l’impossibilité d’orchestrer des milliers de bacs à sable jetables. GRPO et les récompenses vérifiables fournissent aujourd’hui la quatrième. L’article se clôt sur OpenEnv, interface standard annoncée en octobre 2025 par l’équipe PyTorch de Meta et Hugging Face, et sur un marché des environnements où figurent Prime Intellect et Mechanize.
🔗 Rétrospective sur les environnements RL
Google fait suivre à plus de 80 vols de Cathay Pacific une route qui évite les traînées
7 septembre — Google Research étend à l’Asie-Pacifique ses essais d’évitement des traînées de condensation, avec Cathay Pacific comme premier partenaire aérien commercial de la région. La parade est simple sur le papier : ajuster légèrement l’altitude pour contourner les zones froides et humides où les traînées persistent en nappes qui retiennent la chaleur.
| Mesure de la première phase | Valeur |
|---|---|
| Vols ciblés sur le réseau Cathay Pacific | plus de 100 |
| Vols ayant effectivement suivi une route d’évitement | plus de 80 |
| Réduction estimée de l’impact réchauffant des traînées | environ 40 % |
| Part du corridor Hong Kong-Singapour dans les gains | plus de 50 % |
| Part des traînées dans l’impact climatique de l’aviation | environ un tiers |
Le dispositif combine prédictions produites par les modèles de Google, imagerie satellite et données météorologiques avancées. Les prévisions remontent au poste de pilotage par le Wi-Fi de bord et par le carnet de vol électronique de la compagnie (Electronic Flight Folder), sans interrompre les procédures habituelles, et les ajustements restent dans les paramètres de sécurité établis. Une deuxième phase élargie s’ouvre, avec Contrails.org comme partenaire.
Contrail mitigation remains one of the most immediately available, scalable, and cost-effective ways to reduce aviation’s climate footprint, and it can get started now, with today’s aircrafts and fuel.
🇫🇷 L’atténuation des traînées de condensation reste l’un des moyens les plus immédiatement disponibles, les plus généralisables et les plus économiques de réduire l’empreinte climatique de l’aviation, et elle peut démarrer dès maintenant, avec les avions et les carburants d’aujourd’hui. — Kemal Armada et Max Vogler, Google Research
Genspark ajoute Muse Spark 1.3 à trois de ses produits
7 septembre — Genspark branche Muse Spark 1.3, le modèle de Meta, dans AI Chat, Code Agent et Claw, cinq jours après son annonce. La plateforme reprend les deux chiffres avancés par Meta pour justifier le choix, 20 pour cent d’appels d’outils en moins et 25 pour cent de dépense en tokens en moins, deux métriques qui pèsent directement sur le coût d’un agent tournant en boucle sur des tâches longues.
Le rythme est le vrai signal. En six jours, Genspark a intégré quatre modèles de fournisseurs différents : Claude Fable 5.1 le 2 septembre, Gemini 3.8 Flash le 3, GPT-6 Astra le 5, et Muse Spark 1.3 le 7. La plateforme se positionne moins comme un modèle que comme une couche d’orchestration qui absorbe les sorties de tous les laboratoires dans les jours suivant leur publication.
Brèves
- Replit ouvre son premier bureau international à Londres — l’entreprise en fait le centre de ses opérations européennes, aux côtés du maire de Londres Sadiq Khan, du gouvernement britannique et de London & Partners, et annonce un pilote de montée en compétences avec TLMA pour les jeunes Londoniens sans emploi ni formation. 🔗 Publication
- Tolquane, une bibliothèque Python de parallélisme composable — un même graphe s’exécute sans changer de code en threads, en processus, en async, en distribué ou en séquentiel, à 5,6 fois la vitesse de référence sur Python 3.14t sans verrou global contre 0,9 fois en threads avec le GIL. L’absence de blocage y est posée en règle de conception, avec une erreur qui nomme les nœuds bloqués. 🔗 Billet
- Une action dédiée pour installer une compétence d’agent — le firmware Aiden route désormais une URL de compétence vers une action unique qui prépare, valide puis publie de façon atomique. La reproduction sur agent réel ramène une trace multi-outils à un seul appel. 🔗 Billet
- Together AI oppose GLM-5.3 Flash à GPT-5.6 Terra sur le coût par tâche — score identique sur l’indice d’intelligence d’Artificial Analysis mais 82 pour cent de moins par tâche selon l’hébergeur, qui ne publie ni méthode de calcul ni billet détaillé et sert lui-même le modèle comparé. 🔗 Publication
- Un manifeste pour un écosystème IA brésilien — texte en portugais filant la métaphore de l’écosystème naturel pour la communauté IA du pays, sans modèle, sans jeu de données et sans mesure. Signalé pour complétude. 🔗 Billet
- Google DeepMind retient 16 organisations pour son accélérateur AI for the Planet en Asie-Pacifique — première promotion, lancée par un stage intensif (bootcamp) à Singapour puis trois mois d’accès aux modèles AnthroKrishi, ForestCast, AlphaEarth Foundations, SpeciesNet et Perch, répartis en protection de la nature, agriculture durable et solutions carbone. 🔗 Billet
- GitHub remet en avant les canvases de son application Copilot — relance d’un article du 17 août présentant le canvas comme une surface partagée et durable où l’état du travail reste visible, avec un chiffre rarement publié : de 2 000 à 3 000 AI Credits pour construire chacun des deux exemples cités. 🔗 Publication
- GitHub ouvre un générateur d’alias pour GitHub Universe — animation communautaire promotionnelle avant l’édition d’octobre 2026, sans lien avec l’IA ni avec une fonctionnalité produit. 🔗 Publication
- Synthesia détaille ses trois axes de recherche pour ECCV 2026 — avatars génératifs pilotés par l’audio, recherche voix appliquée à la reconnaissance vocale et avatars interactifs, sous la bannière du modèle de monde centré sur l’humain. 🔗 Publication
- Mati Staniszewski situe le test de Turing conversationnel à six ou douze mois — le cofondateur et directeur général d’ElevenLabs le déclare dans le podcast GDIY, dont l’entretien est proposé doublé en français par le service audio de l’entreprise. 🔗 Publication
- QwenCloud publie le compte rendu de la Qwen Conference Thailand 2026 — près de 400 clients et développeurs à Bangkok le 4 septembre, et une démonstration de bout en bout où l’agent est lui-même le client, de l’inscription au paiement et à la facturation sans intervention humaine. 🔗 Publication
- Cohere relaie un reportage de CNN sur Toronto comme pôle mondial de l’IA — communication sans annonce produit, qui renvoie au troisième rang mondial de la ville pour les talents technologiques selon CBRE, à plus de 2 milliards de dollars engagés par la stratégie nationale canadienne, et à un afflux de demandes clients déclaré par Cohere après les contrôles à l’exportation sur les modèles d’Anthropic. 🔗 Publication
Ce que ça signifie
Le seuil franchi par Sol-H3 n’est pas un record de plus dans une liste. Tant qu’un clip demande plus de temps à produire qu’à regarder, la génération vidéo reste un travail par lots : on lance, on attend, on visionne. Descendre sous ce seuil ouvre une autre catégorie d’usage, celle où l’image se fabrique pendant qu’on la regarde. Le détail qui compte pour un praticien est que le gain ne vient pas d’un nouveau modèle : le modèle est le même, seule la pile d’inférence change. Le facteur 15 se trouvait donc dans l’ingénierie d’exécution, pas dans les poids, et il est publié sous Apache 2.0 avec compatibilité des LoRA existants.
La journée oppose deux façons de publier des poids ouverts. D’un côté, deux billets auto-publiés dont les affirmations de qualité ne s’appuient sur aucune mesure comparable, avec des étiquettes de dépôt qui ne correspondent pas au format réellement livré, et une comparaison de coût par tâche annoncée par l’hébergeur du modèle gagnant sans méthode publiée. De l’autre, un corpus de parole où chaque horodatage traverse une chaîne d’audit et où l’équipe sépare explicitement 22 heures vérifiées de 100 heures qui ne le sont pas. Sur un dépôt public où n’importe qui publie, la discipline de vérification devient le seul signal exploitable, et elle coûte plus cher à produire qu’un titre accrocheur.
La rétrospective sur les environnements RL et le rythme d’intégration de Genspark racontent le même déplacement, à deux échelles. La première explique pourquoi une idée de 2016 fonctionne aujourd’hui : ce ne sont pas les algorithmes qui manquaient mais l’infrastructure autour, du modèle de départ aux bacs à sable jetables. La seconde montre ce que devient cette infrastructure une fois disponible, quand une plateforme branche quatre modèles de quatre fournisseurs en six jours. Dans les deux cas, la valeur migre du modèle vers la couche qui l’entoure, et cette couche se standardise, avec OpenEnv d’un côté et les orchestrateurs multi-modèles de l’autre.
Reste ce qui ne relève pas de la course aux modèles. L’essai avec Cathay Pacific porte sur des avions et des carburants existants : la seule chose ajoutée est une prévision livrée au bon moment dans le poste de pilotage, pour environ 40 pour cent de réduction estimée sur les vols concernés. Le corpus Vaani couvre 58 langues indiennes dont plusieurs ne disposaient d’aucune ressource de parole bruitée, et l’accélérateur Asie-Pacifique de DeepMind distribue des modèles spécialisés à seize équipes de terrain. Ces trois travaux n’ont pas de benchmark à battre. Leur contrainte est ailleurs, dans la donnée à collecter et le déploiement à réussir, et c’est aussi là que l’écart entre une démonstration et un effet mesurable se joue.
Sources
- Sol-H3, annonce de Enze Xie sur X
- Page projet Sol-H3, NVIDIA Research
- Accès API Sol-H3 via Reactor
- Vaani Noise Event Timestamp Dataset, ARTPARK-IISc
- Série JiRack Ultra, CMS Manhattan
- JiRack DeltaNet 27B, CMS Manhattan
- Histoire des environnements RL, Hugging Face
- Évitement des traînées sur les vols ultra-long-courriers, Google Research
- Muse Spark 1.3 dans Genspark
- Replit ouvre son bureau de Londres
- Tolquane, parallélisme composable en Python
- Installation directe des compétences dans le firmware Aiden
- Together AI compare GLM-5.3 Flash et GPT-5.6 Terra
- Manifeste pour un écosystème IA brésilien
- Accélérateur AI for the Planet en Asie-Pacifique, Google DeepMind
- Les canvases de l’application Copilot
- Générateur d’alias pour GitHub Universe
- Synthesia à ECCV 2026
- Mati Staniszewski dans le podcast GDIY
- Compte rendu de la Qwen Conference Thailand 2026
- Cohere relaie le reportage de CNN sur Toronto