Le 11 août 2026, l’application Gemini dépasse le milliard d’utilisateurs mensuels, devenant le produit à la croissance la plus rapide de l’histoire de Google. NVIDIA publie Nemotron 3.5 Lightning et sa bibliothèque de routage NeMo Switchyard, Mistral ouvre sa plateforme aux modèles tiers et fédère une coalition de calcul européenne, et Alibaba dévoile Wan-Animate-2, mise à niveau majeure de son modèle d’animation open source. Au menu également : publicités ChatGPT étendues à cinq nouveaux marchés, nouveaux outils pour développeurs et une longue liste d’annonces en génération média.
Gemini franchit le milliard d’utilisateurs mensuels
L’application Gemini a officiellement dépassé le milliard d’utilisateurs mensuels actifs, ce qui en fait, selon Google, le produit à la croissance la plus rapide de toute l’histoire de l’entreprise. L’annonce a été relayée à la fois par le compte officiel @GeminiApp et par Josh Woodward, qui dirige les équipes Gemini et Labs chez Google.
Google accompagne l’annonce d’un bilan chiffré sur les usages qui ont porté cette croissance :
| Usage mesuré | Donnée |
|---|---|
| Interactions vocales | 63 % des utilisateurs passent par la voix |
| Sessions Gemini Live | 1 sur 5 utilise la caméra en direct ou le partage d’écran |
| Demandes scolaires | 38 % incluent une pièce jointe (fichier) |
| Génération d’images | Plus de 150 millions d’images produites chaque jour |
| Automatisation Android | Actions automatisées dans plus de 40 applications |
| Utilisateurs iOS | Plus de 100 millions d’utilisateurs actifs sur appareils Apple |
Ces chiffres illustrent une diversification des usages au-delà du simple chat texte : voix, caméra, partage d’écran, génération multimédia et automatisation inter-applications (réservation de restaurant, commande de VTC) apparaissent comme des moteurs importants de l’adoption.
🚀One billion for Gemini! Our goal remains to make it the most personal, proactive, and powerful assistant.
🇫🇷 🚀 Un milliard pour Gemini ! Notre objectif reste de faire de lui l’assistant le plus personnel, proactif et puissant. — @GeminiApp sur X
🔗 Annonce officielle sur le blog Google
NVIDIA lance Nemotron 3.5 Lightning et NeMo Switchyard pour les agents à fort volume
NVIDIA élargit sa famille de modèles ouverts Nemotron 3 avec Nemotron 3.5 Lightning, un MoE hybride de 30 milliards de paramètres (3 milliards actifs) conçu pour l’exécution des tâches agentiques à fort volume — appel d’outils, validation de résultats, délégation de tâches — plutôt que le raisonnement complexe. Disponible en NVFP4 et BF16 avec un contexte jusqu’à 1 million de tokens, le modèle revendique jusqu’à 4 fois le débit de sortie de modèles comparables et 30 % de gain de temps sur la complétion de tâches. Sur PinchBench, il atteint 86 % de précision en complétant 10 000 tâches 35 % plus vite que Qwen3.6 35B à précision équivalente.
Le modèle est distribué avec poids, données d’entraînement et recettes, disponible sur Hugging Face, ModelScope, OpenRouter et build.nvidia.com. Together AI est partenaire de lancement dès le premier jour (day-0), avec une capacité réservée via son offre Dedicated Model Inference pour les charges de travail agentiques à fort volume.
En parallèle, NVIDIA publie NeMo Switchyard, une bibliothèque open source qui route chaque requête vers le modèle le plus adapté (qualité, latence, coût) sans réécriture de l’application — réservant les modèles frontière au raisonnement complexe et Lightning à l’exécution spécialisée. NVIDIA revendique un coût de complétion des tâches ramené à près d’un tiers de celui d’Opus 4.8 seul. Des partenaires concrets sont cités : Boomi route 59 % de son trafic vers un modèle fine-tuné plus rapide, Cognition réduit son coût moyen de 28 %, et Ramp combine modèle et routage pour 59 % de coût et 32 % de temps d’exécution en moins.
🔗 Billet officiel NVIDIA · Annonce du modèle sur X
Alibaba dévoile Wan-Animate-2, mise à niveau majeure de son animation de personnage open source
Alibaba (équipe Wan) publie Wan-Animate-2, décrit comme une mise à niveau majeure de son modèle open source d’animation de personnage. Quatre capacités sont mises en avant : une animation haute fidélité qui retranscrit mouvements et micro-expressions à travers humains, dessins animés, robots et animaux ; l’animation multi-personnages, où chaque personnage conserve son identité et son mouvement propres dans une même scène ; un contrôle de caméra piloté par texte (par exemple « vue du dessus »), découplé de la vidéo source ; et une génération en streaming temps réel, produisant des séquences de longueur arbitraire chunk par chunk sans accumulation d’erreur observable.
Sur le plan technique, Alibaba abandonne les squelettes de pose explicites au profit de la vidéo de référence elle-même comme a priori de mouvement, avec une architecture Dual-Branch DiT (Diffusion Transformer), un encodage temporel Time-Align RoPE et une attention creuse (Sparse-Ref Attention) pour limiter le calcul sans perte de qualité. Le contrôle de caméra s’appuie sur une LoRA entraînée sur environ 50 000 échantillons multi-vues Unreal Engine.
Le modèle est open source, disponible dès maintenant sur ModelScope, Hugging Face et GitHub, avec démo en ligne. Selon la campagne « Local AI » d’août de NVIDIA, ses 14 milliards de paramètres génèrent 16 à 26 fois plus vite sur systèmes RTX que les alternatives — confirmation de son optimisation pour un déploiement local sur matériel grand public.
🔗 Détails techniques et chiffres NVIDIA · Annonce sur X
Mistral lance l’inférence régionale, ouvre sa plateforme à GLM-5.2 et fédère une coalition de calcul européenne
Mistral se positionne comme le seul laboratoire d’IA européen à combiner choix régional d’inférence et garanties de service. L’entreprise, déjà engagée dans une course tarifaire et technique face à OpenAI, Google et les acteurs chinois, mise ici sur un positionnement distinct : la souveraineté et la prévisibilité de service, plutôt que la seule course aux benchmarks. Deux nouveautés côté plateforme :
| Fonctionnalité | Statut | Description |
|---|---|---|
| Mistral Regional Endpoints | Disponible | Choix Europe ou États-Unis pour l’exécution de l’inférence |
| Mistral Priority Tier | Aperçu public | SLA de disponibilité et limites de débit personnalisées |
Autre volet notable : la plateforme Mistral s’ouvre à des modèles tiers, en commençant par GLM-5.2 de Z.ai, qui bénéficiera des mêmes contrôles régionaux et engagements de service que les modèles Mistral — une première convergence entre les deux acteurs, jusque-là concurrents directs sur le segment des modèles ouverts abordables.
Enfin, Mistral lance les European Compute Units (ECU), un mécanisme convertissant des engagements pluriannuels d’entreprises en accès à son infrastructure de calcul, avec pour objectif 1 GW de capacité d’ici 2030 — soit l’équivalent de la puissance consommée par une grande ville. Les partenaires fondateurs annoncés sont ASML (Christophe Fouquet, CEO), CMA CGM (Rodolphe Saadé, Chairman et CEO), Amadeus (Luis Maroto, CEO) et Caisse des Dépôts (Olivier Sichel, CEO) — un mélange d’industriels, de transport et de finance publique qui illustre l’ambition de bâtir une filière de calcul européenne indépendante des hyperscalers américains.
OpenAI lance les publicités ChatGPT au Royaume-Uni, au Mexique, au Brésil, au Japon et en Corée du Sud
OpenAI franchit une nouvelle étape dans le déploiement de la publicité au sein de ChatGPT. Lancé en test aux États-Unis en février 2026 pour les offres Free et Go, puis étendu au Canada, à l’Australie et à la Nouvelle-Zélande en mars, le programme publicitaire est désormais officiellement lancé dans cinq nouveaux marchés : Royaume-Uni, Mexique, Brésil, Japon et Corée du Sud. Les offres Plus, Pro, Business, Enterprise et Education restent sans publicité, et d’autres marchés sont visés d’ici la fin de l’année.
Le principe reste inchangé : les publicités n’influencent jamais les réponses de ChatGPT, elles restent clairement labellisées comme sponsorisées et visuellement séparées de la réponse organique. Le ciblage repose sur le sujet de la conversation en cours et l’historique des interactions publicitaires passées, sans jamais donner aux annonceurs accès aux conversations ou aux données personnelles — ils ne reçoivent que des statistiques agrégées (vues, clics).
Côté contrôle utilisateur, ChatGPT permet de masquer une publicité, de consulter pourquoi elle a été affichée, de supprimer ses données publicitaires en un geste, et de gérer la personnalisation à tout moment. Aucune publicité n’est montrée aux comptes mineurs identifiés ou présumés, ni à proximité de sujets sensibles (santé, santé mentale, politique). Selon OpenAI, le pilote n’a montré aucun impact mesuré sur la confiance des utilisateurs, ce qui a motivé cette extension progressive.
Écosystème open source et inférence
webAI Intelligence Lab publie TwiL-LM3, modèle de raisonnement 3B qui dépasse GPT-OSS-120B
Le laboratoire webAI Intelligence Lab (Austin) publie TwiL-LM3, son premier modèle de raisonnement formel en open source. Avec seulement 3 milliards de paramètres, il revendique de dépasser GPT-OSS-120B d’OpenAI sur 4 des 5 benchmarks de raisonnement formel testés — soit environ 40 fois moins de paramètres pour une inférence 2,6 fois plus rapide. Entraîné sur des données vérifiées et propriétaires plutôt que du contenu web collecté automatiquement, le modèle cible l’informatique en périphérie (edge) : il est annoncé capable de tourner d’un Raspberry Pi à un iPhone, sans dépendre du cloud.
Meta prépare une version à poids ouverts de Muse Spark 1.2
Dans le fil annonçant Muse Glimmer, Alexandr Wang (Meta Superintelligence Labs) indique que Meta publiera prochainement une version à poids ouverts de Muse Spark 1.2 — jusqu’ici le modèle propriétaire qui propulse l’agent de code en terminal Muse Code. Aucune date précise n’est donnée, mais l’annonce confirme une inflexion de Meta vers davantage de poids ouverts sur toute sa gamme Muse, dans la continuité de l’ouverture immédiate des poids de Muse Glimmer sous licence Apache 2.0.
Zuckerberg publie un texte sur la philosophie IA de Meta
Le même jour, Mark Zuckerberg publie un texte affirmant que « tout le monde devrait avoir accès à la superintelligence », détaillant la philosophie et les valeurs de Meta pour construire un avenir positif de l’IA. Le message accompagne le lancement de Muse Glimmer, positionnant l’ouverture des poids comme un choix de fond plutôt qu’un simple argument marketing, et s’inscrit dans une communication plus large de Meta sur sa stratégie de poids ouverts cette semaine-là.
Lightricks présente LTX-2.5, mise à jour majeure de son world model ouvert
Lightricks publie LTX-2.5, nouvelle version de son « world model » déjà utilisé pour le cinéma, la robotique et des flux de travail temps réel. La mise à jour promet une fidélité pixel supérieure, des scènes multi-plans qui restent cohérentes d’une coupe à l’autre, et un socle pré-entraîné pensé pour être affiné (fine-tuned) selon différents domaines, via un nouveau rendu baptisé Diffusion Fidelity Rendering. L’équipe présente LTX-2.5 comme une fondation ouverte plutôt qu’un outil loué.
IBM Research publie ALTK-Evolve, une mémoire agentique moins gourmande en tokens qu’ACE
IBM Research publie ALTK-Evolve, un système permettant à des agents IA d’apprendre de leurs échecs passés sans réentraînement, en calibrant la quantité de consignes réinjectées selon la capacité du modèle utilisé — contrairement à ACE (Agentic Context Engineering), qui livre l’intégralité de son « playbook » à chaque étape. Sur le benchmark AppWorld avec DeepSeek-V3.2, ALTK-Evolve atteint 89,3 % de tâches complétées pour 263K tokens par tâche, contre 80,4 % et 634K tokens pour ACE. Avec gpt-oss-120b, il obtient une précision égale ou meilleure pour environ 40 % du coût d’inférence d’ACE.
Together AI, IBM et NVIDIA s’associent pour l’inférence entreprise sur IBM Cloud
Together AI annonce un partenariat avec IBM et NVIDIA pour apporter de l’inférence IA de niveau entreprise sur IBM Cloud, via un cluster dédié de GPU NVIDIA B300 avec réseau Spectrum-X — une première du genre sur cette plateforme, alimentée par la plateforme d’inférence de production de Together AI. L’offre cible les entreprises déjà clientes d’IBM Cloud souhaitant déployer des charges de travail IA sans migrer vers un autre fournisseur cloud.
Outillage développeur : Amp, Replit, GitHub Copilot et Manus
Amp lance les plugins et skills globaux pour les orbs
Amp (Sourcegraph) introduit un système centralisé de plugins et skills hébergés par Amp, disponible partout où Amp tourne, en particulier dans les orbs. Deux niveaux coexistent : un niveau personnel, bac à sable expérimental avec rechargement à chaud (live reloading) dans le même fil de discussion, et un niveau espace de travail, géré par les administrateurs et chargé par défaut pour toute l’équipe. Les éléments personnels peuvent être partagés vers l’espace de travail, et le versioning est géré nativement (mise à jour vers la dernière version, détection des skills obsolètes).
Replit MCP bêta : créer, charger, rechercher et publier une app via MCP
Replit renforce sa bêta MCP (Model Context Protocol) avec de nouvelles capacités : créer, charger, rechercher et publier une application directement via MCP, sans passer par l’interface web. L’objectif affiché est de permettre de construire du logiciel réel sur Replit depuis n’importe quel client MCP compatible — éditeur, agent autonome ou outil tiers — plutôt que de rester cantonné à l’interface de Replit elle-même. Cette extension confirme la stratégie de Replit d’exposer sa plateforme comme une brique programmable pour les workflows agentiques.
MAI-Code-1.1-Flash arrive dans GitHub Copilot, MAI-Code-1-Flash déprécié
Le dernier modèle de code compact de Microsoft, MAI-Code-1.1-Flash, se déploie dans GitHub Copilot avec support vision natif, et des améliorations en qualité de code, suivi d’instructions et usage d’outils. Il coûte 73 % moins cher que MAI-Code-1-Flash, avec un multiplicateur de requête premium de 0,25× pour les abonnés annuels. Sélectionné automatiquement sur Free et Étudiant, disponible en sélection manuelle sur Pro, Pro+, Max, Business et Enterprise. En parallèle, GitHub annonce la dépréciation de MAI-Code-1-Flash le 10 septembre 2026.
Manus va redevenir une entreprise indépendante
Manus annonce redevenir une entreprise indépendante. Pour se conformer aux exigences réglementaires de certaines juridictions, une partie des utilisateurs devra sauvegarder ses données avant le 23 août 2026 (7h59, heure de Singapour), puis lancer une restauration à partir du 25 août 2026 (8h00, heure de Singapour). Les utilisateurs concernés seront prévenus par e-mail et notification in-app ; aucune facturation n’est prévue pendant la transition, avec des bonus de bienvenue à la clé.
Génération média : Wan CLI, Motif 3, Luma Scenes et alimentation 800 VDC
Wan CLI : Alibaba permet de piloter Wan directement depuis les agents
Alibaba publie le Wan CLI, un nouvel outil en ligne de commande qui permet d’appeler la plateforme Wan directement depuis des agents pour générer images et vidéos de façon programmatique. Les crédits consommés restent entièrement synchronisés avec le compte Wan Video de l’utilisateur, évitant une double gestion de facturation entre interface web et usage automatisé. L’installation se fait en récupérant une commande depuis le panneau Wan puis en la collant dans son agent, avec un tutoriel vidéo fourni pour la prise en main.
Motif 3 : premier modèle frontière coréen entraîné sur GPU NVIDIA B200
La startup coréenne Motif Technologies lance Motif 3 Base et Motif 3, ses premiers modèles visant la course aux LLM frontière, développés avec le soutien du ministère coréen de la Science et entraînés sur GPU NVIDIA B200. Motif 3 est construit sur Motif 3 Base via post-entraînement utilisant NVIDIA NeMo-RL. En collaboration avec NVIDIA, l’équipe publie aussi une version NVFP4 (précision réduite optimisée NVIDIA). L’ensemble sera disponible sur Hugging Face avec rapport technique, et NVIDIA a salué ce lancement comme un exemple de la dynamique de l’écosystème IA coréen.
Luma Scenes : production vidéo par scènes, propulsée par Uni-1
Luma AI lance Luma Scenes, un outil qui permet d’affiner, chronométrer et valider chaque scène individuellement avant le rendu final — répondant au problème classique consistant à produire de nombreuses variantes pour n’en retenir qu’une seule utilisable, au risque qu’une scène ratée compromette toute une production. L’outil prolonge Luma Layers (édition par calques, fin juillet), confirmant l’orientation de Luma vers le contrôle granulaire plutôt que la génération en un clic, avec un flux de travail plus proche du montage traditionnel.
Ideogram Ad Resizer : un design, tous les formats publicitaires
Ideogram lance Ad Resizer : à partir d’un design unique et des emplacements publicitaires visés, l’outil génère automatiquement un jeu complet de formats prêts pour campagne (Instagram, Facebook, YouTube, télévision connectée, affichage, print), y compris des ratios extrêmes difficiles à recadrer manuellement. Disponible immédiatement dans l’application et via l’API, pour intégration dans des pipelines de production publicitaire automatisés — un cas d’usage marketing concret pour les équipes créatives multicanal.
HeyGen for Real Estate : lancement officiel avec trois formats vidéo pour agents immobiliers
HeyGen lance officiellement HeyGen for Real Estate, avec trois formats vidéo pensés pour les agents immobiliers qui apparaissent eux-mêmes à l’écran sans caméra ni montage — objectif : leur permettre de publier plusieurs fois par jour sans sacrifier la présence visuelle qu’exige ce secteur. Offre incitative : les inscrits au plan Creator dans les 12 heures suivant l’annonce reçoivent l’accès White Glove gratuit pendant 30 jours (États-Unis uniquement). HeyGen évoque une extension possible à d’autres petites entreprises au-delà de l’immobilier.
NVIDIA détaille l’architecture d’alimentation 800 VDC des futures « AI factories »
NVIDIA, avec Google et Microsoft, détaille via l’Open Compute Project une architecture d’alimentation en courant continu 800 volts, qui réduit les étapes de conversion électrique entre le réseau et les GPU pour soutenir la densité de calcul des futures générations d’accélérateurs. Plus de 80 fabricants travaillent déjà sur des produits conformes. Déploiement en plusieurs étapes : architecture hybride « Power Rack » dès le second semestre 2026, « Row Power Center » en 2027, puis installations natives 800 VDC dans la décennie à venir.
Qwen, Z.ai et OpenAI : nouveaux modèles et synchronisation d’agents
Qwen3.8-27B : poids ouverts annoncés pour cette semaine
Alibaba Qwen confirme que les poids ouverts de Qwen3.8-27B seront publiés cette semaine, une nouvelle taille dans la famille Qwen3.8 après le modèle phare Qwen3.8-Max déjà couvert début août. L’équipe présente ce nouveau modèle comme supérieur à Qwen3.6-27B en codage agentique, une performance déjà bien reçue par la communauté de développeurs qui attendait cette taille intermédiaire depuis plusieurs semaines.
Z.ai : ZCode atteint 1 million d’utilisateurs, reset des limites du GLM Coding Plan
Z.ai annonce que ZCode, son outil de codage basé sur les modèles GLM, dépasse le million d’utilisateurs. En remerciement, l’entreprise réinitialise les limites d’usage de tous les abonnés du GLM Coding Plan, et déploie une mise à jour censée mieux transformer les capacités de raisonnement à long horizon en travail effectivement terminé, avec un taux de succès de cache de 98 %, offrant environ 1,8 fois plus d’usage pour les abonnés.
ChatGPT desktop app disponible en préversion sur Linux, avec Codex
OpenAI étend son application desktop à Linux, jusqu’ici réservée à macOS et Windows. La préversion couvre quatre distributions majeures — Ubuntu 24.04/26.04 LTS, Debian 13 et Fedora 43/44 — avec paquets .deb/.rpm en x64 et ARM64. L’app regroupe ChatGPT, ChatGPT Work et Codex dans une même interface native, avec accès aux projets et workflows de navigateur pris en charge, sans changer d’environnement de travail.
Codex et ChatGPT Work importent le travail d’autres agents IA
Nouvelle fonctionnalité pour ChatGPT Work et Codex : garder son travail existant, réalisé avec d’autres agents IA, synchronisé avec l’écosystème OpenAI. Concrètement, les utilisateurs peuvent importer projets, conversations, skills et plugins, consulter un historique d’import, et activer une synchronisation automatique dans les réglages. Disponible dès maintenant dans l’application desktop ChatGPT, pour réduire la friction du changement d’outil plutôt que de recommencer à zéro avec une configuration entièrement nouvelle.
Brèves
- Bug de facturation Fable résolu, 196 remboursements — Anthropic confirme la résolution complète d’un bug de cache de configuration qui affichait à tort des dépassements ; 196 utilisateurs remboursés et crédités en compensation. 🔗 Tweet
- v0 (Vercel) refond sa barre latérale — conversations groupées par projet, indicateurs de statut temps réel, cartes d’aperçu au survol. 🔗 Tweet
- Amp augmente la taille disque des orbs à 60 Go — contre 40 Go auparavant, sans surcoût pour les nouveaux orbs. 🔗 Tweet
- DeepSeek V4 Flash 0731 disponible au fine-tuning sur Together AI — spécialisation via SFT ou DPO puis déploiement en production. 🔗 Tweet
- Together AI détaille un second volet sur l’autoscaling de son inférence dédiée — trois politiques testées sous la même charge, une seule s’est réellement adaptée. 🔗 Tweet
- Hugging Face lance l’Open Model Series — nouvelle série vidéo pédagogique sur les modèles ouverts et leur usage local. 🔗 Tweet
- FC Barcelone rejoint le partenariat Google Pixel / Gemini — nouveaux partenaires officiels du club, après un partenariat similaire avec le Bayern Munich. 🔗 Tweet
- Rapport d’usage Copilot : détail des tokens par modèle — tokens d’entrée, de sortie et de cache désormais visibles derrière les crédits IA consommés. 🔗 Changelog
- GitHub met en avant l’agent Rubber Duck de Copilot — dans un article de carrière sur les compétences des développeurs juniors ; l’agent utilise un second modèle pour critiquer le code généré. 🔗 Tweet
- Perplexity Computer : GitHub, connecteur le plus utilisé — majoritairement par des non-développeurs (4 sur 5). 🔗 Tweet
- Suno Studio 2.0 (teaser) — nouvelle version de l’environnement de production musicale de Suno, sans détails supplémentaires. 🔗 Tweet
- ElevenLabs Summit à New York le 11 novembre — journée de conférences réunissant des dirigeants tech et business ; candidatures ouvertes. 🔗 Tweet
- FLUX 3 Video confirme le rang #2 mondial — Black Forest Labs prolonge l’accès gratuit au playground jusqu’au 16 août et tease 4K et édition vidéo. 🔗 Tweet
- Seedance 2.5 sur Runway ajoute 50 références de personnages — et des clips synchronisés sur une piste musicale. 🔗 Tweet
- P-Image-Ideogram disponible sur Runway — génère une image en aussi peu que 0,6 seconde, avec quatre modes de qualité. 🔗 Tweet
- Kimi K3 disponible sur Databricks — nouveau canal de distribution pour le modèle de Moonshot AI. 🔗 Tweet
- Zapier transforme son marketing avec ChatGPT Work — réduction des abandons dans l’entonnoir de leads, reporting automatisé. 🔗 OpenAI
- Virgin Atlantic optimise ses parcours clients avec ChatGPT Work — recherche et planification produit accélérées. 🔗 OpenAI
- Cohere — Aidan Gomez détaille la stratégie open source et souveraine — modèles personnalisables, abordables et sécurisés comme fil conducteur. 🔗 Tweet
Ce que ça signifie
L’échelle d’usage de l’IA grand public change de registre : avec un milliard d’utilisateurs mensuels, Gemini rejoint le cercle très restreint des produits Google les plus massifs, porté par des usages qui dépassent largement le chat texte (voix, caméra, automatisation). En miroir, OpenAI étend ses publicités ChatGPT à cinq nouveaux marchés — un signe que la monétisation à grande échelle des assistants conversationnels devient une priorité stratégique une fois la base d’utilisateurs suffisamment large et fidèle.
Côté infrastructure, la journée illustre une bascule vers l’exécution agentique spécialisée plutôt que le seul raisonnement frontière. NVIDIA propose avec Nemotron 3.5 Lightning et NeMo Switchyard un modèle économique explicite : réserver les modèles coûteux à la planification complexe et déléguer l’exécution à fort volume à des modèles plus légers et moins chers, avec des gains de coûts mesurés chez plusieurs partenaires. IBM Research (ALTK-Evolve) et Together AI (autoscaling, partenariat IBM Cloud) creusent le même sillon économique de l’inférence, pendant que Mistral structure son propre effort de souveraineté avec les European Compute Units et l’inférence régionale.
L’ouverture des poids continue de s’étendre à de nouveaux acteurs et de nouvelles modalités : Wan-Animate-2 d’Alibaba, TwiL-LM3 de webAI, Qwen3.8-27B à venir, la promesse de Meta sur Muse Spark 1.2, et même un premier modèle frontière coréen (Motif 3) construit sur la pile technique NVIDIA. Cette diversification géographique et modale — texte, animation, raisonnement embarqué — confirme que l’open source n’est plus l’apanage d’un petit nombre de laboratoires occidentaux.
Enfin, l’outillage agentique développeur continue de se professionnaliser : Amp et Replit ajoutent des couches de gestion (plugins globaux, MCP étendu), GitHub muscle son offre de modèles à bas coût, et OpenAI construit des ponts explicites entre écosystèmes concurrents en permettant à Codex et ChatGPT Work d’importer le travail réalisé ailleurs — un pari sur la portabilité plutôt que sur l’enfermement, à l’heure où les développeurs jonglent avec plusieurs agents IA en parallèle.
Sources
- Gemini — un milliard d’utilisateurs
- Gemini — annonce sur X
- NVIDIA — Nemotron 3.5 Lightning et NeMo Switchyard
- Alibaba Wan — Wan-Animate-2
- NVIDIA — chiffres Local AI (Wan-Animate-2)
- Mistral — inférence régionale, GLM-5.2, coalition de calcul
- OpenAI — publicités ChatGPT
- webAI — TwiL-LM3
- Meta — Muse Spark 1.2 (Alexandr Wang)
- Zuckerberg — philosophie IA de Meta
- IBM Research — ALTK-Evolve
- Together AI, IBM, NVIDIA — inférence IBM Cloud
- Amp — plugins et skills globaux
- Replit — MCP bêta
- GitHub — MAI-Code-1.1-Flash
- Manus — entreprise indépendante
- Alibaba Wan — Wan CLI
- Motif Technologies — Motif 3
- Luma AI — Luma Scenes
- Ideogram — Ad Resizer
- HeyGen — for Real Estate
- NVIDIA — architecture 800 VDC
- Alibaba Qwen — Qwen3.8-27B
- Z.ai — ZCode 1 million d’utilisateurs
- OpenAI — ChatGPT desktop app Linux
- OpenAI — import d’agents dans Codex/ChatGPT Work
- Anthropic — bug de facturation Fable résolu
- v0 — refonte de la barre latérale
- Amp — orbs à 60 Go
- Together AI — DeepSeek V4 Flash 0731 fine-tuning
- Together AI — autoscaling inférence dédiée
- Hugging Face — Open Model Series
- FC Barcelone — partenariat Google Pixel / Gemini
- GitHub — rapport d’usage Copilot par modèle
- GitHub — agent Rubber Duck
- Perplexity Computer — connecteur GitHub
- Suno — Suno Studio 2.0
- ElevenLabs — Summit New York
- Black Forest Labs — FLUX 3 Video
- Runway — Seedance 2.5
- Runway — P-Image-Ideogram
- Kimi Moonshot — K3 sur Databricks
- OpenAI — Zapier
- OpenAI — Virgin Atlantic
- Cohere — stratégie open source et souveraine