Rechercher

NVIDIA lève 500 milliards de dollars pour son infrastructure IA, Alibaba publie Qwen3.8-2.4T-A95B en poids ouverts, Zed lance Delta

Article généré par intelligence artificielle
NVIDIA lève 500 milliards de dollars pour son infrastructure IA, Alibaba publie Qwen3.8-2.4T-A95B en poids ouverts, Zed lance Delta

Le 12 août 2026, NVIDIA annonce des partenariats de financement dépassant 500 milliards de dollars pour bâtir l’infrastructure IA de la prochaine décennie, tandis qu’Alibaba publie les poids ouverts de Qwen3.8-2.4T-A95B, son modèle de raisonnement à 2 400 milliards de paramètres. Zed dévoile Delta, un environnement multijoueur pour coder avec des agents, Google DeepMind lance SL2T pour traduire la langue des signes en texte sur Pixel 11, et Suno signe un partenariat mondial avec BMG. Au menu également : nouveaux modèles ouverts chez Cohere et Liquid AI, avancées côté outils de développement (Devin, Replit, GitHub Copilot) et une étude OpenAI sur l’adoption de l’IA agentique en entreprise.


NVIDIA mobilise plus de 500 milliards de dollars pour l’infrastructure IA

12 août — NVIDIA annonce des partenariats avec six grands acteurs de la finance et de l’investissement — Apollo, BlackRock, Blackstone, Brookfield, Goldman Sachs et KKR — pour mettre en place des plateformes de financement indépendantes destinées à mobiliser plus de 500 milliards de dollars de capital tiers. L’objectif : soutenir sur la durée la construction des « AI factories », les datacenters massifs dédiés à l’entraînement et à l’inférence des modèles.

NVIDIA présente ce mouvement comme un tournant structurel pour l’industrie : le financement du déploiement de capacités de calcul IA ne reposerait plus uniquement sur les bilans des entreprises technologiques elles-mêmes, mais s’appuierait désormais sur des véhicules de financement dédiés, portés par des institutions financières de premier plan plutôt que par les seules grandes entreprises du secteur.

Cette annonce s’inscrit dans la continuité d’autres initiatives NVIDIA sur l’infrastructure détaillées ces derniers jours : l’architecture d’alimentation 800 volts en courant continu pour les futures générations d’accélérateurs, et le programme NSF de hubs régionaux dédiés à l’IA aux États-Unis. Elle confirme l’ampleur des besoins en capital pour soutenir la demande de calcul, à un moment où la course à l’infrastructure IA s’accélère chez tous les grands fournisseurs de cloud.

🔗 Billet officiel NVIDIA


Alibaba publie les poids ouverts de Qwen3.8-2.4T-A95B, modèle de raisonnement à 2 400 milliards de paramètres

12 août — Alibaba publie les poids ouverts de Qwen3.8-2.4T-A95B, le modèle phare annoncé en intention début août sous le nom Qwen3.8-Max. Il s’agit ici de la sortie effective des poids : un modèle Mixture-of-Experts à granularité fine totalisant 2 400 milliards de paramètres, dont 95 milliards actifs par token, conçu pour des charges de raisonnement et agentiques exigeantes.

L’architecture alterne couches d’attention complète et attention linéaire : les premières assurent l’interaction token-à-token, les secondes s’appuient sur un état récurrent borné pour maîtriser la mémoire à mesure que le contexte grandit. Le modèle supporte une fenêtre de contexte allant jusqu’à 1 million de tokens, avec une longueur de sortie jusqu’à 128K tokens, et embarque un contrôle de profondeur de raisonnement configurable (low/high/xhigh) pour arbitrer entre coût de calcul et qualité de réponse selon la tâche.

NVIDIA, qui détaille le déploiement dans un billet technique dédié, rapporte un débit natif dépassant 4 000 tokens par seconde et par GPU sur un GB300 NVL72 (72 GPU Blackwell Ultra) en précision FP8, avec des optimisations NVFP4 prévues à venir.

Indicateur mesuréValeur mesurée
Paramètres totaux / actifs2 400 milliards / 95 milliards
Fenêtre de contextejusqu’à 1 million de tokens
Débit par GPUplus de 4 000 tokens/s (GB300 NVL72, FP8)
Débit par utilisateurplus de 350 tokens/s
Disponibilité des poidsHugging Face, ModelScope

Les poids sont disponibles sur Hugging Face et ModelScope, avec un déploiement pris en charge par SGLang, vLLM, NVIDIA Dynamo et NVIDIA NIM ; le fine-tuning est possible via NVIDIA NeMo AutoModel (LoRA et SFT).

🔗 Annonce NVIDIA sur X · Billet technique NVIDIA


Zed lance Delta, environnement multijoueur pour coder avec des agents

12 août — Zed dévoile Delta, un environnement multijoueur pour coder avec des agents et relire ce qu’ils produisent. Le produit s’appuie sur DeltaDB, la base de données présentée en accès anticipé début juillet sous l’appellation « Google Docs pour le code ». Delta en constitue la première application concrète, avec les premières invitations à une bêta privée envoyées à partir du 12 août.

Dans Delta, la conversation avec l’agent devient elle-même un document : le curseur fonctionne partout dans le fil, avec les mêmes raccourcis clavier que dans l’éditeur de code. Pour répondre à un point précis, il suffit de placer le curseur dessus et de commencer à écrire, sans que rien ne soit hors de portée dans le thread.

La relecture se fait à l’endroit même où le travail a eu lieu : l’agent qui a écrit le code reste présent dans le fil, ce qui permet de lui poser directement une question plutôt que de reconstituer son intention à partir d’un diff. Un thread se partage en un clic, et les coéquipiers y participent comme des acteurs à part entière — ils peuvent explorer l’historique, co-éditer des prompts, ou reprendre le travail plusieurs jours plus tard sans se demander si le dernier code a bien été commité.

Delta is built on DeltaDB, which keeps your code and conversation in sync for everyone in the thread, in real-time. It works with the git repo you already have. Every edit and conversation is captured between your commits.

🇫🇷 Delta s’appuie sur DeltaDB, qui garde le code et la conversation synchronisés en temps réel pour tout le monde dans le thread. Ça fonctionne avec le dépôt git que vous avez déjà. Chaque édition et chaque conversation sont capturées entre vos commits.@zeddotdev sur X

Zed élargit les invitations progressivement dans les semaines à venir ; les inscriptions à la liste d’attente sont ouvertes.

🔗 Annonce sur X


SL2T : Google DeepMind traduit la langue des signes en texte sur Pixel 11

12 août — Google DeepMind présente SL2T (sign-language-to-text), un modèle qui convertit la langue des signes directement en texte écrit. La fonctionnalité arrive sur Android : les utilisateurs peuvent désormais signer directement dans Gboard et Live Transcribe au lieu de taper, pour la recherche web, la rédaction de messages ou les requêtes envoyées à Gemini.

Techniquement, le système repose sur un modèle MediaPipe Holistic exécuté on-device, qui suit les positions du corps (mains, bras, torse, tête, visage) plutôt que d’enregistrer la vidéo brute — la vidéo d’origine est immédiatement supprimée, seules les coordonnées géométriques des poses sont envoyées aux serveurs pour la traduction. Ce choix protège la vie privée tout en permettant une traduction directe des coordonnées vers le texte, sans passer par des annotations intermédiaires qui limitaient jusqu’ici la précision des systèmes existants.

Le modèle a été entraîné sur plus de 100 000 heures de données couvrant plus de 50 langues des signes, dont environ 25 % en langue des signes américaine (ASL). Sur le benchmark FLEURS-ASL, SL2T atteint un score zero-shot de 70 BLEURT, que Google DeepMind qualifie de significativement supérieur à tout score précédemment rapporté.

Le développement a impliqué la communauté sourde à chaque étape via un comité consultatif dédié, qui a co-rédigé un rapport d’impact conjoint détaillant les capacités et les limites du système. La fonctionnalité démarre avec l’ASL vers l’anglais sur Pixel 11, avec d’autres appareils et langues des signes prévus à l’avenir.

SL2T is state-of-the-art on academic benchmarks, plus it’s optimized for real-world use like one-handed signing while holding a phone. To protect privacy, it tracks body poses on-device, while our servers translate them into text.

🇫🇷 SL2T est à l’état de l’art sur les benchmarks académiques, et il est optimisé pour un usage réel comme signer d’une seule main en tenant son téléphone. Pour protéger la vie privée, il suit les poses du corps sur l’appareil, tandis que nos serveurs traduisent ces données en texte.@GoogleDeepMind sur X

🔗 Annonce officielle Google DeepMind


Suno annonce un partenariat mondial avec BMG

12 août — Suno annonce un partenariat mondial avec BMG (Bertelsmann Music Group), l’une des principales maisons de disques et sociétés d’édition musicale au monde. L’entreprise qualifie l’accord de « landmark » (jalon) pour la construction d’un écosystème créatif associant artistes et auteurs-compositeurs plutôt que de les contourner.

Ce partenariat s’inscrit dans un contexte particulier : Suno a fait l’objet de poursuites en 2024-2025 de la part des trois majors du disque — Universal Music Group, Warner Music Group et Sony Music — pour utilisation non autorisée d’enregistrements protégés dans l’entraînement de ses modèles. Un accord avec BMG marque donc un revirement stratégique vers des relations de licence négociées avec l’industrie musicale plutôt qu’un rapport de force judiciaire, une tendance déjà amorcée côté vidéo par l’accord entre Runway et Bertelsmann en juillet — dont BMG fait justement partie.

Le communiqué ne détaille pas les termes financiers ni le périmètre exact de l’accord (catalogue disponible pour l’entraînement, rémunération des ayants droit, outils proposés aux artistes BMG). Ces éléments restent à préciser via les communications officielles à venir de Suno et de BMG.

🔗 Annonce sur X


Outils de développement agentique : Devin, Replit, VS Code et JetBrains

Plusieurs outils de développement assistés par IA avancent en parallèle ce 12 août, entre nouveaux modèles disponibles, contrôle d’infrastructure et standardisation des plugins agents.

Grok 4.6 disponible dans Devin, Cognition le classe derrière Opus 5 et Fable 5

Cognition ajoute Grok 4.6 (xAI, annoncé le même jour) comme modèle disponible dans Devin. L’équipe le positionne comme une amélioration significative par rapport à Grok 4.5, le classant devant GPT-5.6 Sol et juste derrière Opus 5 et Fable 5 dans son propre classement interne. Cognition met en avant une force particulière sur l’exploration de code approfondie et l’analyse de cause racine avant toute modification — un point utile pour les tâches de debugging complexes où Devin doit comprendre un système avant d’y toucher.

🔗 Annonce sur X

Replit permet de choisir la région d’hébergement des workspaces (Pro/Enterprise)

Replit ouvre aux clients Pro et Enterprise le choix de la région d’hébergement pour les nouveaux workspaces, entre Amérique du Nord, Europe et Asie. L’objectif est double : réduire la latence perçue lors du développement et donner du contrôle sur la localisation des données et des previews d’applications publiées, un point souvent requis en contexte entreprise (conformité, proximité utilisateurs). La fonctionnalité s’ajoute à la possibilité déjà existante de choisir la région des applications publiées, et devient disponible immédiatement pour les comptes éligibles.

🔗 Annonce sur X

Agent Plugins 1.0 arrive dans VS Code, Copilot CLI et l’app Copilot

Le standard ouvert Agent Plugins 1.0, publié le 6 août avec AWS, Anysphere (Cursor), Microsoft, OpenAI et Vercel — et depuis rejoint par Google comme mainteneur — arrive désormais dans VS Code, Copilot CLI et l’app Copilot. Un plugin packagé une seule fois (compétences agent + serveurs MCP) devient installable depuis le marketplace Awesome Copilot et fonctionne sans modification à travers plusieurs clients compatibles, sans migration obligatoire pour les plugins Copilot existants. Pour les entreprises, la gouvernance passe par managed-settings.json, disponible sur les plans Copilot Business et Enterprise.

🔗 Changelog GitHub

Copilot pour JetBrains gagne la mémoire persistante et l’accès à Ollama en local

GitHub Copilot pour JetBrains reçoit une mise à jour large : la mémoire persistante permet désormais de conserver et rappeler des informations utiles d’une session de chat agent à l’autre, évitant de répéter le contexte du projet ou ses préférences. Autre ajout notable, Ollama devient un fournisseur BYOK (Bring Your Own Key), donnant accès à des modèles exécutés en local directement dans le sélecteur de modèle de JetBrains. Les entreprises gagnent aussi des contrôles serveur sur la disponibilité des plugins, l’accès MCP et le comportement de contournement des permissions.

🔗 Changelog GitHub


Modèles ouverts et IA embarquée

Côté modèles, plusieurs laboratoires publient coup sur coup des versions ouvertes optimisées pour l’inférence locale et la compréhension de documents.

Hugging Face : Transformers.js dépasse 10 millions de téléchargements mensuels

Clément Delangue, PDG de Hugging Face, annonce que Transformers.js, la bibliothèque permettant d’exécuter des modèles IA directement dans le navigateur, franchit le cap des 10 millions de téléchargements mensuels — une croissance proche de 10x en seulement six mois, développée en interne depuis trois ans. Delangue relie cette croissance à une tendance plus large : le déplacement d’une part croissante des charges de travail IA vers le local, pour des raisons de coût, de confidentialité et de résilience face aux pénuries de calcul. Le message ne contient pas de détails techniques supplémentaires : c’est une annonce de traction sur un projet existant.

🔗 Tweet officiel

Ai2 : OlmoEarth Studio permet désormais l’export d’embeddings personnalisés

Ai2 (Allen Institute for AI) ajoute à OlmoEarth Studio le calcul et l’export de vecteurs d’embeddings d’observation de la Terre, en trois variantes : Nano (128 dimensions, 1,4 million de paramètres), Tiny (192 dimensions, 6,2 millions) et Base (768 dimensions, 89 millions). Les vecteurs, stockés en Cloud-Optimized GeoTIFF, sont directement utilisables dans les outils SIG standards (QGIS, GDAL, rasterio). Les cas d’usage démontrés incluent la recherche par similarité, la segmentation few-shot — une carte d’occupation des sols entraînée sur 60 pixels annotés atteint un F1 pondéré de 0,84 — et la détection de changement temporel. Modèles et code sont publiés sur Hugging Face et GitHub.

🔗 Billet Hugging Face

Liquid AI : LFM2.5-VL-3B, modèle vision-langage pour l’edge

Liquid AI publie LFM2.5-VL-3B, un modèle vision-langage de 3,1 milliards de paramètres optimisé pour l’inférence sur appareil. Il associe un encodeur visuel SigLIP2 400M à un backbone texte de 2,6 milliards de paramètres, entraîné sur environ 34 000 milliards de tokens. Sur les benchmarks, il obtient 81,0 % sur MMBench (contre 80,0 % pour la version précédente), 87,9 % sur l’ancrage RefCOCO et 91,1 % sur DocVQA. Côté vitesse : 228 tokens/seconde sur CPU (M5 Max) et 20 tokens/seconde sur mobile (Galaxy S26 Ultra), pour une empreinte mémoire d’environ 3 Go. Le modèle est disponible sur Hugging Face avec intégrations llama.cpp, MLX, vLLM et SGLang.

🔗 Billet Hugging Face

Cohere lance North Micro Vision, son plus petit modèle vision-langage

Cohere élargit sa famille de modèles North avec North Micro Vision, son plus petit modèle vision-langage à ce jour. Ce modèle de 2,4 milliards de paramètres est conçu pour la compréhension de documents sophistiqués et publié en open source sous licence Apache 2.0, avec les poids disponibles sur Hugging Face. Malgré sa taille réduite, il embarque le traitement visuel en résolution native, des conversations multi-tours combinant image et texte, le raisonnement spatial et la compréhension d’images multilingue. Cohere affirme qu’il surpasse Gemma 4 E2B et Ministral 3 3B sur un large éventail de benchmarks de compréhension visuelle, sans communiquer de chiffres précis dans l’annonce.

🔗 Annonce sur X


Assistants connectés : Gemini et Runway élargissent leurs intégrations

Gemini ajoute 14 nouvelles applications connectées

Google élargit la liste des applications connectables directement à Gemini depuis les paramètres : 14 nouveaux services rejoignent le catalogue, dont Zoho Bigin, Granola, Wix, GetYourGuide, Ticketmaster, OpenTable, Pandora, iHeartRadio, Thumbtack, Zocdoc et Otter.ai. Une fois le service connecté, il suffit de demander à Gemini, par exemple, « Trouve un rendez-vous chez l’ophtalmo près du travail sur Zocdoc » pour que l’assistant interagisse directement avec le service. Le déploiement se fait progressivement sur les prochaines semaines, poursuivant la stratégie de Google visant à faire de Gemini un point d’entrée unique vers de multiples services tiers.

🔗 Annonce officielle Google

Runway connecte Agent à Figma, Dropbox et Notion

Runway ajoute des connecteurs Figma, Dropbox et Notion à Agent, son assistant de production intégré à la plateforme, pour éviter que les actifs créatifs restent cloisonnés dans des outils séparés. Agent peut désormais synchroniser directement designs, fichiers et documents depuis ces plateformes tierces vers un espace de travail unique. Cette fonctionnalité est disponible sur tous les plans payants, dans la continuité de la stratégie de Runway consistant à faire d’Agent un hub central de production média connecté à l’écosystème d’outils existant des équipes créatives.

🔗 Annonce sur X


Étude OpenAI sur l’adoption de l’IA agentique en entreprise

OpenAI publie deux études complémentaires sur l’usage entreprise de l’IA : « Enterprise Signals », panorama pratique de l’IA agentique chez ses clients, et un working paper compagnon sur la diffusion de l’adoption selon les entreprises, les métiers et les niveaux de séniorité. Le constat central : l’usage bascule de l’assistance vers l’exécution. En juin, Codex a généré 64 % du volume combiné de tokens produits par Codex et ChatGPT chez les clients entreprise. L’écart se creuse entre les entreprises les plus avancées et les autres : les « frontier firms » (top 10 % en usage mensuel) génèrent désormais 8,3 fois plus de tokens de sortie par utilisateur actif que les entreprises typiques, contre un rapport de 2,6 en janvier. Depuis février, les utilisateurs hebdomadaires de Codex en entreprise ont été multipliés par 108 dans le juridique et par 41 dans la vente, contre un facteur 5 en ingénierie.

🔗 Étude complète OpenAI


Brèves

  • Grok 4.6 disponible dans v0 (Vercel) — le même jour que son annonce par xAI, v0 ajoute Grok 4.6 à son sélecteur de modèles pour la génération d’applications. 🔗 Tweet
  • Open_MOSS publie des versions FP8/NF4 de MOSS-VL — versions quantifiées de MOSS-VL-Instruct et MOSS-VL-Realtime pour l’inférence locale avec seulement 24 Go de VRAM. 🔗 Tweet
  • Google AI Studio propose un visualiseur 3D pour l’éclipse solaire totale du 12 août — suivi en temps réel de l’ombre de la Lune sur le globe, avec simulation du ciel local depuis Reykjavík ou Valencia. 🔗 Tweet
  • GitHub Enterprise Server 3.22 en release candidate — Copilot CLI en environnement déconnecté, Enterprise Teams en disponibilité générale, contrôles affinés pour le secret scanning et les rulesets. 🔗 Changelog
  • Rule insights disponible au niveau organisation (préversion publique) — le tableau de bord d’audit des rulesets s’étend au-delà du niveau repository, avec export CSV. 🔗 Changelog
  • Migration automatique des règles de protection de branche vers les rulesets — un bouton « Convert to ruleset » traduit automatiquement une règle classique en ruleset équivalent. 🔗 Changelog
  • Seedance 2.5 arrive dans l’agent vidéo IA de Genspark — génération de 30 secondes en un seul passage, jusqu’à 30 images et 10 clips vidéo/audio en référence. 🔗 Tweet
  • Genspark chez Grant Thornton — génération de propositions accélérée — le cabinet génère des réponses à appels d’offres à partir d’un seul prompt, avec relecture humaine systématique. 🔗 Tweet
  • GitHub Monthly Enterprise Roundup — édition août 2026 — le roundup met en avant le passage de l’IA de la complétion de code à des workflows d’ingénierie gouvernés de bout en bout. 🔗 Tweet
  • LTX-2.5 disponible sur Runway — le world model ouvert de Lightricks, publié le 11 août, rejoint le catalogue de modèles de Runway. 🔗 Tweet
  • FLUX 3 disponible sur Luma — le premier modèle multimodal unifié de Black Forest Labs (image, vidéo, audio) arrive sur Luma, avec génération vidéo à audio natif. 🔗 Tweet
  • Nemotron 3.5 Lightning disponible dans l’API Agent de Perplexity — le modèle ouvert 30B MoE de NVIDIA rejoint la couche d’exécution à haut volume des agents Perplexity. 🔗 Tweet
  • Qwen-Image-3.0 disponible sur OpenArt — le modèle de génération d’images d’Alibaba étend sa distribution à une nouvelle plateforme tierce. 🔗 Tweet
  • Qwen3.8-Max grimpe au 4ᵉ rang sur le Legal Research Bench — le modèle passe de la 22ᵉ à la 4ᵉ place sur ce classement spécialisé en recherche juridique. 🔗 Tweet
  • Les modèles Daybreak (cybersécurité) disponibles via Amazon Bedrock — Daybreak Blue et Daybreak Red d’OpenAI accessibles aux défenseurs autorisés directement depuis la console Bedrock. 🔗 OpenAI

Ce que ça signifie

Le financement de l’infrastructure IA change d’échelle : les 500 milliards de dollars mobilisés par NVIDIA auprès d’acteurs financiers traditionnels (Apollo, BlackRock, Goldman Sachs, KKR…) marquent le passage d’un modèle financé par les seuls bilans technologiques à des véhicules de capital dédiés. Ce mouvement macro-économique se combine à une réalité plus concrète : Qwen3.8-2.4T-A95B, publié le même jour, tourne nativement à plus de 4 000 tokens par seconde et par GPU sur l’infrastructure NVIDIA GB300 — l’appétit en capital et la demande de calcul se nourrissent mutuellement, chaque nouveau modèle massif justifiant un peu plus les investissements annoncés.

L’ouverture des poids continue de s’étendre à toutes les échelles : du modèle frontière de 2 400 milliards de paramètres d’Alibaba au petit vision-langage de 2,4 milliards de Cohere, en passant par LFM2.5-VL-3B de Liquid AI conçu pour tourner sur mobile. Cette diversification par la taille — et pas seulement par la performance — confirme la traction mesurée par Hugging Face : Transformers.js a été téléchargé 10 millions de fois par mois, soit près de 10 fois plus qu’il y a six mois, preuve que l’inférence locale sort du stade expérimental pour devenir une option de production à part entière.

Les outils de développement assistés par IA convergent vers des formats de collaboration plus riches. Zed transforme l’échange avec l’agent en document partagé et versionné avec Delta, GitHub standardise les plugins agents à travers VS Code, Copilot CLI et JetBrains via Agent Plugins 1.0, et Devin comme v0 intègrent Grok 4.6 le jour même de sa sortie chez xAI. Le point commun : ces outils cessent d’être de simples assistants isolés pour devenir des couches d’infrastructure interopérables, où le choix du modèle sous-jacent et la mémoire entre sessions comptent autant que la génération de code elle-même.

Enfin, l’IA s’intègre plus profondément dans des usages quotidiens et des relations industrielles négociées plutôt qu’imposées. SL2T de Google DeepMind traduit la langue des signes directement sur Pixel 11 avec une architecture pensée pour la confidentialité, Gemini et Runway élargissent leurs connecteurs vers des dizaines de services tiers, et Suno signe avec BMG un accord de licence qui tranche avec les poursuites judiciaires de 2024-2025 — un signal que l’industrie musicale négocie désormais avec les modèles génératifs plutôt que de les combattre systématiquement. Du côté entreprise, l’étude OpenAI confirme que cette bascule vers l’exécution agentique se creuse déjà fortement entre les organisations les plus avancées et les autres.


Sources