Le 6 août 2026, OpenAI unifie l’expérience ChatGPT autour d’un GPT-5.6 Sol commun aux modes rapide et raisonnement pour les abonnés payants, avec 68% d’erreurs factuelles en moins, tandis que GPT-5.6 Luna passe en chats illimités gratuits. Le même jour, Kimi K3 arrive en disponibilité générale dans GitHub Copilot, Google DeepMind publie dans Nature WeatherNext, son modèle ouvert qui prédit les cyclones cinq jours à l’avance, et Alibaba ouvre la bêta publique de Wan3.0 pour la génération vidéo de 30 secondes. Meta complète la semaine avec des benchmarks Artificial Analysis plaçant Muse Spark 1.2 quasi à la frontière et un bilan de cinq résultats de niveau or à des Olympiades scientifiques internationales, pendant qu’une quinzaine d’annonces couvrent les outils de code agentique (Amp, Devin, Replit, Warp, Cursor), l’écosystème open-weight (Hugging Face, Sakana, Together AI) et la génération média (ElevenLabs, Suno).
ChatGPT bascule sur GPT-5.6 Sol unifié, GPT-5.6 Luna passe en illimité gratuit
6 août — OpenAI unifie l’expérience de discussion dans ChatGPT autour d’une version mise à jour de GPT-5.6 Sol pour les abonnés payants. Jusqu’ici, les utilisateurs Plus et Pro basculaient manuellement entre un modèle rapide (Instant) et un modèle de raisonnement approfondi. Désormais, GPT-5.6 Sol gère les deux modes dans une seule expérience, avec un curseur d’effort de raisonnement (slider) réglable à la volée — une simplification directe de l’interface, en réponse aux retours des utilisateurs sur la confusion entre les deux anciens modes.
Sur la fiabilité, OpenAI avance un chiffre concret : sur son évaluation de factualité à enjeux élevés (finance, médecine, droit), la nouvelle version de GPT-5.6 Sol produit 68% de réponses en moins contenant des erreurs factuelles, comparée à GPT-5.5 Instant. C’est l’argument central de cette mise à jour, présentée comme un gain de fiabilité plutôt qu’un saut de capacités brutes.
Côté offre gratuite, les utilisateurs Free et Go héritent eux aussi d’un accès élargi à GPT-5.6 Luna : discussions textuelles illimitées à partir du 7 août, et apparition d’un bouton « Think » pour déclencher davantage de raisonnement sur les questions difficiles — une fonctionnalité jusque-là réservée aux offres payantes.
| Élément suivi | Détail chiffré |
|---|---|
| Erreurs factuelles finance/médecine/droit | -68% vs GPT-5.5 Instant |
| GPT-5.6 Sol + curseur (Plus/Pro) | disponible depuis le 6 août |
| Chats illimités GPT-5.6 Luna (Free/Go) | disponible depuis le 7 août |
Un point de périmètre à noter : cette mise à jour concerne uniquement l’expérience Chat de ChatGPT — la version de GPT-5.6 Sol qui alimente ChatGPT Work et Codex n’est pas modifiée par cette annonce.
Kimi K3 disponible en version générale dans GitHub Copilot
6 août — GitHub annonce la disponibilité générale de Kimi K3, le modèle open-weight de Moonshot AI, dans Copilot. Le déploiement est progressif sur les offres Pro, Pro+, Max, Business et Enterprise, et le modèle est accessible depuis l’ensemble des surfaces Copilot : Visual Studio Code, Visual Studio, Copilot CLI, l’agent cloud, l’app GitHub Copilot, github.com, GitHub Mobile, ainsi que les plugins JetBrains, XCode et Eclipse.
📣 @Kimi_Moonshot’s Kimi K3, an open-weight model, is now generally available and rolling out in GitHub Copilot. The model shows frontier-level abilities on agentic coding with highly cost-effective pricing. It is hosted by @FireworksAI_HQ.
🇫🇷 📣 Kimi K3 de @Kimi_Moonshot, un modèle à poids ouverts, est désormais en disponibilité générale et se déploie dans GitHub Copilot. Le modèle affiche des capacités de niveau frontière sur le code agentique, avec une tarification très compétitive. Il est hébergé par @FireworksAI_HQ. — @github sur X
Le modèle est hébergé via Fireworks AI, avec une facturation à l’usage alignée sur les tarifs du fournisseur — le changelog ne détaille ni prix précis ni fenêtre de contexte. Pour les organisations en Business et Enterprise, Kimi K3 est désactivé par défaut : les administrateurs doivent activer explicitement la politique de modèle avant que les équipes puissent y accéder. Cette arrivée s’inscrit dans la stratégie multi-modèles de Copilot, qui avait déjà intégré Kimi K2.7 Code plus tôt en août.
WeatherNext : Google DeepMind prédit les cyclones cinq jours à l’avance, poids ouverts
6 août — Google DeepMind publie dans la revue Nature les résultats de WeatherNext, son modèle d’IA dédié à la prévision des cyclones tropicaux. Le modèle atteint une précision état de l’art pour prédire la trajectoire et l’intensité d’une tempête, offrant en moyenne 24 heures de délai supplémentaire par rapport aux méthodes précédentes pour se préparer.
Predicting cyclones accurately can help save lives - and every hour of lead time counts. Published in @Nature, our AI model WeatherNext achieves state-of-the-art accuracy in forecasting a storm’s track and intensity, giving us a critical extra 24 hours to prepare on average.
🇫🇷 Prédire précisément les cyclones peut sauver des vies — et chaque heure de délai compte. Publié dans @Nature, notre modèle d’IA WeatherNext atteint une précision état de l’art dans la prévision de la trajectoire et de l’intensité d’une tempête, nous donnant en moyenne 24 heures de délai supplémentaire pour nous préparer. — @GoogleDeepMind sur X
Pendant l’ouragan Melissa, WeatherNext a fourni des prédictions précoces de son atterrissage en catégorie 5, avec cinq jours d’avance et un niveau de confiance de 80%. Le modèle, entraîné sur plusieurs années de données atmosphériques mondiales et près de 5 000 cyclones historiques, génère chaque scénario de prévision probabiliste sur 15 jours en moins d’une minute sur une puce TPU. Google DeepMind fournit désormais 1 000 prévisions probabilistes par tempête, accessibles via l’outil WeatherLab.
| Indicateur mesuré | Valeur mesurée |
|---|---|
| Délai de préparation supplémentaire | +24h en moyenne |
| Alerte ouragan Melissa (catégorie 5) | 5 jours à l’avance, confiance 80% |
| Cyclones historiques dans l’entraînement | ~5 000 |
Point notable pour l’écosystème : le code et les poids du modèle sont ouverts sur GitHub, librement disponibles pour la recherche académique comme pour la prévision opérationnelle.
Wan3.0 (Alibaba) entre en bêta publique avec des vidéos natives de 30 secondes
6 août — Alibaba lance la bêta publique de Wan3.0, la nouvelle génération de son modèle de génération vidéo, avec trois axes mis en avant : une génération vidéo native pouvant aller jusqu’à 30 secondes en une seule passe, un rendu visuel qualifié de « reality-grade » (personnages plus expressifs, meilleure cohérence des références d’une scène à l’autre), et une fonction d’Omni-Reference qui étend la compréhension du modèle au-delà du texte, de l’image, de l’audio et de la vidéo : Wan3.0 peut désormais lire des documents structurés (doc, xls, ppt, pdf, etc.) et générer une vidéo directement à partir de leur contenu.
La bêta est disponible dès maintenant sur Alibaba Cloud Model Studio et Qwen Cloud, avec une arrivée prochaine sur l’application Wan réservée aux membres.
| Résolution vidéo | Prix API (par seconde générée) |
|---|---|
| 480p | 0,05 $ |
| 720p | 0,10 $ |
| 1080p | 0,20 $ |
L’accès API complet doit s’ouvrir progressivement dans les prochaines semaines. Ce lancement positionne Wan3.0 face aux annonces récentes de la concurrence sur la génération vidéo longue durée avec contrôle multimodal fin — FLUX 3 Video de Black Forest Labs, Seedance 2.5 de ByteDance, MiniMax H3 — un segment où la capacité à générer des clips de 20 à 30 secondes avec un contrôle de référence riche devient un argument de différenciation central.
Muse Spark 1.2 de Meta s’approche de la frontière, selon Artificial Analysis
5-6 août — Le cabinet d’analyse indépendant Artificial Analysis publie son évaluation complète de Muse Spark 1.2, le modèle de Meta lancé en parallèle de l’agent Muse Code. Sur l’AA Intelligence Index, il obtient un score de 54 (variante xhigh), en hausse de 3 points par rapport à Muse Spark 1.1 (51) et de 11 points par rapport à Muse Spark 1.0 (43, sorti en avril) — sa troisième sortie en quatre mois. Ce score le place à égalité effective avec GPT-5.5 (xhigh, 55) et Grok 4.5 (high, 54), juste derrière les modèles de pointe actuels : Claude Opus 5 (max, 61), Claude Fable 5 (max, 60), GPT-5.6 Sol (max, 59) et Kimi K3 (max, 57).
Le principal progrès porte sur le travail de connaissance agentique, point faible identifié lors du lancement de Muse Spark 1.1 : le score GDPval-AA v2 Elo grimpe de 1371 à 1631, plaçant le modèle 5ᵉ parmi tous les modèles évalués, devant Claude Opus 4.8 (1588).
| Indicateur mesuré | Muse Spark 1.1 | Muse Spark 1.2 |
|---|---|---|
| AA Intelligence Index (xhigh) | 51 | 54 |
| GDPval-AA v2 Elo | 1371 | 1631 |
| Terminal-Bench 2.1 | 78% | 80% |
| Coût par tâche (Intelligence Index) | 0,29 $ | 0,40 $ |
Côté coût, Muse Spark 1.2 reste parmi les modèles les plus efficaces de son niveau d’intelligence, à 0,40 $ par tâche pour une tarification API inchangée (1,25 $ / 4,25 $ par million de tokens en entrée/sortie). Seuls Grok 4.5 et GPT-5.6 Sol (medium) sont moins chers dans son groupe. Sur le Vals Index, Muse Spark 1.2 entre aussi dans le top 5 à seulement 0,69 $ par test — trois fois moins cher que Kimi K3, dix fois moins cher que Claude Fable 5, Opus 5 et GPT-5.6 Sol.
Meta revendique des résultats de niveau or à cinq Olympiades scientifiques internationales
6 août — Meta Superintelligence Labs (MSL) annonce avoir inscrit des versions internes de la famille Muse Spark à cinq compétitions scientifiques internationales de haut niveau en 2026, pour mesurer les progrès réels en raisonnement plutôt que sur des benchmarks synthétiques — un bilan cumulé après une première médaille de physique déjà rapportée en juillet.
To understand whether we’re making genuine progress on reasoning, we entered our AI models in five international STEM Olympiad competitions this year. The results: Asian Physics Olympiad (APhO): Perfect score on the theory exam — gold medal. International Physics Olympiad (IPhO): Perfect score — gold medal. International Mathematical Olympiad (IMO): Gold medal, top 4% of human participants. International Chemistry Olympiad (IChO): Gold-medal level. Romanian Masters of Mathematics (RMM): Gold-medal level.
🇫🇷 Pour savoir si nous progressons réellement en raisonnement, nous avons inscrit nos modèles d’IA à cinq compétitions internationales de sciences cette année. Résultats : Olympiade Asiatique de Physique (APhO) — score parfait à l’épreuve théorique, médaille d’or. Olympiade Internationale de Physique (IPhO) — score parfait, médaille d’or. Olympiade Internationale de Mathématiques (IMO) — médaille d’or, top 4% des participants humains. Olympiade Internationale de Chimie (IChO) — niveau médaille d’or. Romanian Masters of Mathematics (RMM) — niveau médaille d’or. — @shuchaobi sur X
| Compétition scientifique | Résultat obtenu |
|---|---|
| APhO (physique, Asie) | Score parfait à l’épreuve théorique — or |
| IPhO (physique, international) | Score parfait à l’épreuve théorique — or |
| IMO (mathématiques) | Or, top 4% des participants humains |
| IChO (chimie) | Niveau médaille d’or |
| RMM (mathématiques, Roumanie) | Niveau médaille d’or |
Trois de ces compétitions (APhO, IPhO, IMO) étaient des épreuves en direct, corrigées par les juges officiels selon les mêmes barèmes que pour les candidats humains. Meta précise que les modèles utilisés n’avaient accès à aucun outil externe — pas de recherche web, pas d’interpréteur de code, pas de calculatrice — avec une orchestration multi-agents en raisonnement parallèle.
Outils de développement IA : Portals, sandbox distants, routage de modèles
Cinq annonces resserrent l’écart entre développement local et environnements distants ou multi-modèles cette semaine.
Amp lance les Portals — prévisualisation live des apps dans les Orbs
6 août — Amp ajoute les Portals, disponibles dès maintenant dans tous les orbs (l’environnement de développement distant d’Amp), une fonctionnalité qui expose directement dans le navigateur les services HTTP tournant à l’intérieur d’un orb. Jusqu’ici, tester en direct les changements faits par l’agent nécessitait de configurer un VPN ou de jongler avec des ports. Techniquement, l’agent crée ou détecte un fichier .amp/services.yaml et exécute amp orb services ensure pour lancer l’application, exposée ensuite via une connexion HTTPS sécurisée. Les Portals sont accessibles à toute personne ayant accès au thread, ce qui permet à plusieurs membres d’une équipe de voir les mêmes changements en direct, y compris quand l’orb se réveille après une mise en veille.
Devin Outposts tourne désormais sur Vercel Sandbox
5 août — Cognition étend Devin Outposts (lancé fin juillet pour exécuter Devin nativement sur n’importe quel ordinateur) avec une intégration à Vercel Sandbox, disponible dès maintenant. L’agent peut désormais construire et tester une application dans une microVM isolée sur l’infrastructure de Vercel, avec accès à Docker, connexion à des réseaux privés via VPN, et reprise depuis un instantané du système de fichiers qui conserve le dépôt, les dépendances et l’état de build intacts. Cette intégration rapproche Devin Outposts des offres d’environnements cloud éphémères similaires à celles d’Amp (Orbs) ou de Warp, avec l’avantage de s’appuyer sur l’infrastructure Vercel déjà utilisée par de nombreuses équipes front-end.
Replit fait tourner ses scans de sécurité pendant le build, avec Semgrep
5 août — Replit annonce, en partenariat avec Semgrep, que ses scans de sécurité s’exécutent désormais pendant la construction de l’application plutôt qu’uniquement à la fin — une évolution qui répond directement à une demande des utilisateurs. Ces scans sont actifs par défaut et s’intègrent à l’ensemble de fonctionnalités Replit Auto-Protect, qui sécurise automatiquement les applications générées par l’agent. Replit indique que son Agent exécute déjà plus de 100 000 scans par jour, un chiffre qui illustre l’échelle à laquelle l’outil est utilisé pour du vibe coding en production, avec détection et correction de vulnérabilités avant leur mise en ligne.
Warp introduit les routeurs de modèles personnalisés
5 août — Un peu plus d’une semaine après le lancement du Warp Agent CLI, Warp ajoute des routeurs de modèles personnalisés, disponibles dès maintenant pour tous les utilisateurs. Il devient possible de définir ses propres règles de routage en langage naturel (« envoie les tâches simples à Minimax », « envoie les corrections de bugs à Kimi K3 »), chaque requête étant ensuite automatiquement dirigée vers le modèle jugé le plus adapté. Ces routeurs s’ajoutent au routage automatique déjà intégré au CLI et fonctionnent avec des modèles open weight, en BYOK (bring your own key), ou via un abonnement SuperGrok — une réponse directe à la tendance observée chez plusieurs outils concurrents à orchestrer plusieurs modèles selon la tâche plutôt que de miser sur un seul modèle frontière.
Cursor détaille Cursor Router — jusqu’à 68% d’économies sans perte de qualité
6 août — Cursor publie un billet technique détaillant le fonctionnement de Cursor Router, son système de sélection automatique de modèle lancé le 22 juillet — donc pas un lancement, mais un article de fond avec des données inédites. Le routeur fonctionne en deux étapes : « Compass » estime d’abord la complexité de la tâche en prédisant la probabilité de satisfaction utilisateur, puis un classifieur par taxonomie (domaine, type de tâche, modificateurs comme les changements visuels) sélectionne le modèle frontière le plus performant sur cette catégorie précise. Le routeur répartit les requêtes entre Grok (tâches routinières), Sol/GPT-5.6 (planification), Opus (exécution) et Fable (débogage) — Opus 5 a été ajouté après le lancement initial. Cursor avance des chiffres concrets : le mode « Auto Intelligence » offrirait une satisfaction utilisateur supérieure à Fable seul pour un coût inférieur de 68%, et le mode « Auto Balance » dépasserait Opus 4.8 pour 41% de coût en moins.
🔗 Cursor — how Cursor Router works
Écosystème open-weight : inférence, stockage et recherche autonome
Trois annonces consolident l’infrastructure autour des modèles à poids ouverts, côté hébergement comme côté recherche.
Baseten devient fournisseur d’inférence officiel sur Hugging Face
6 août — Baseten, plateforme d’infrastructure IA spécialisée dans l’inférence serverless, rejoint les Inference Providers de Hugging Face. L’intégration permet de lancer de l’inférence hébergée par Baseten directement depuis les pages de modèles du Hub, via l’interface web ou les SDK Python et JavaScript. Le support initial couvre trois modèles open-weight majeurs : DeepSeek V4 Flash, Kimi K3 et GLM-5.2, avec d’autres types de tâches prévus ultérieurement. Les abonnés PRO reçoivent 2 $ de crédits d’inférence mensuels valables sur l’ensemble des fournisseurs, les comptes gratuits disposant de quotas plus limités. L’intégration expose un format d’API compatible OpenAI via le routeur de Hugging Face, ce qui simplifie le changement de fournisseur sans réécrire le code d’appel.
Ai2 étend son partenariat avec Hugging Face — stockage porté à ~2 pétaoctets
5 août — Ai2 (Allen Institute for AI) élargit son partenariat avec Hugging Face pour accélérer la diffusion de ses travaux en science ouverte. Le stockage alloué sur le Hub est presque triplé, passant à environ 2 pétaoctets, et le trafic n’est plus soumis aux limites de débit standard — un gain sensible pour le téléchargement des plus gros jeux de données et des modèles multi-checkpoints. Ai2 précise que ses ressources ont été téléchargées plus de 50 millions de fois depuis le printemps 2024, et que les artefacts liés à son modèle MolmoAct 2 ont dépassé 400 000 téléchargements en trois semaines. Le partenariat couvre l’ensemble du portefeuille Ai2 : les modèles Olmo et Molmo, le modèle d’observation terrestre OlmoEarth, ainsi que plusieurs jeux d’évaluation. Selon Ai2, l’organisation publie chaque année plus de nouveaux artefacts sur le Hub que toute autre structure suivie par Hugging Face, avec plus de 900 modèles et 1 200 jeux de données au compteur.
🔗 Ai2 — partenariat Hugging Face
Sakana Marlin — agent de recherche autonome et lancement de Marlin Insights
6 août — Sakana AI met en avant Sakana Marlin, décrit comme un « Virtual CSO » (directeur scientifique virtuel) capable de raisonner et de mener des recherches de façon autonome pendant plusieurs heures. L’entreprise indique que cette capacité s’appuie sur deux briques de recherche publiées par ses équipes : AB-MCTS, accepté en spotlight à NeurIPS 2025, et AI Scientist, publié dans Nature. Sakana AI a aussi lancé Marlin Insights, une série de projets de recherche produits par Marlin ; le premier numéro analyse l’issue de la crise du détroit d’Ormuz et les raisons pour lesquelles les États-Unis, malgré leur supériorité militaire, peinent à trouver une porte de sortie. Ce lancement illustre la stratégie de Sakana AI consistant à transformer sa recherche fondamentale en produits d’analyse autonome orientés entreprise, dans la continuité de ses déploiements commerciaux récents (Daiwa Securities, Namazu).
GitHub Copilot et l’écosystème : données ouvertes, design réutilisable, commandes slash
Mise à jour Q1 2026 du GitHub Innovation Graph
5 août — GitHub publie la mise à jour trimestrielle (Q1 2026) de son Innovation Graph, projet de données ouvertes qui suit l’activité de développement mondiale. Le fil de tweets met en avant une accélération de l’activité de push Git dans plusieurs pays hors des marchés traditionnels, ainsi qu’une hausse de 16% en glissement trimestriel de la collaboration open source transfrontalière au Q1 2026, avec des progressions notables pour l’Union européenne, l’Inde et Singapour depuis 2020.
| Pays suivi | Git pushes (Q1 2020 → Q1 2026) |
|---|---|
| Inde | 4,4M → 45M |
| Vietnam | 630K → 5,1M |
| Pakistan | 240K → 3,5M |
L’ensemble des jeux de données reste ouvert et téléchargeable, permettant d’explorer plus en détail ces dynamiques par pays et par période.
🔗 Fil @github — Innovation Graph
Genspark Design — système de design réutilisable entre projets
6 août — Genspark lance Genspark Design, une fonctionnalité disponible dès maintenant qui transforme automatiquement un projet déjà construit (couleurs, typographie, composants) en système de design réutilisable pour les projets suivants. L’objectif est d’éviter de recommencer la charte graphique à chaque nouveau projet : une landing page générée ensuite hérite du même style qu’une app existante, sans reprise manuelle. Cette annonce s’ajoute aux efforts récents de Genspark autour de la génération d’interfaces et de suites bureautiques (GenOffice), et vise les utilisateurs qui enchaînent plusieurs projets générés par IA en cherchant une cohérence visuelle sans configuration répétée.
Guide des commandes slash dans l’app GitHub Copilot
6 août — GitHub publie un guide détaillant les six commandes slash disponibles dans l’app GitHub Copilot desktop, accessibles en tapant « / » dans la zone de chat. Elles couvrent tout le cycle de travail : planification, mise à l’épreuve d’une approche, implémentation automatisée, revue croisée par un autre modèle, création d’interfaces interactives et orchestration multi-dépôts — en se distinguant des commandes slash du CLI qui ciblent le terminal plutôt que l’app desktop.
| Commande slash | Fonction assurée |
|---|---|
/plan | Découpe la tâche avant de coder |
/spar | Avocat du diable pour challenger une approche |
/autopilot | Transforme un plan en code |
/rubber-duck | Revue indépendante par un autre modèle |
/orchestrate | Coordonne le travail entre plusieurs dépôts |
🔗 GitHub — guide des commandes slash
Génération média : doublage et transparence audio
ElevenLabs lance Dubbing v2 sur ElevenAPI
6 août — ElevenLabs met en disponibilité générale sur ElevenAPI la version 2 de son moteur de doublage (Dubbing v2), qui existait déjà côté produit, pour permettre aux développeurs d’intégrer le doublage IA directement dans leurs propres applications. Techniquement, Dubbing v2 se conditionne directement sur la performance audio originale plutôt que sur une transcription plate, ce qui préserve le ton, l’émotion et le phrasé de la voix source. Le modèle adapte le phrasé pour une diction naturelle dans plus de 90 langues, avec une traduction « sync-aware » qui aligne automatiquement débuts et fins de réplique sans réglage manuel. Pour les cas d’usage entreprise, un mode d’édition granulaire permet d’importer sa propre transcription et de ne régénérer que les segments modifiés plutôt que le doublage entier — l’ensemble du pipeline (traduction, clonage vocal, doublage, synchronisation) étant exposé via une seule API.
Suno déploie des outils de transparence et met à jour ses règles communautaires
6 août — Suno publie un billet signé par son PDG Mikey Shulman, exposant les principes que l’entreprise dit vouloir suivre pour bâtir « responsablement » l’avenir de la musique générée par IA. Concrètement, l’annonce introduit un déploiement de technologies de watermarking et de fingerprinting audio pour identifier les morceaux générés sur la plateforme, présentées comme résistantes à la falsification sans dégrader l’écoute, ainsi que des restrictions à venir sur le téléchargement visant à limiter la distribution massive vers les plateformes de streaming tout en préservant les usages professionnels et créatifs. L’annonce s’accompagne d’une mise à jour des Community Guidelines qui interdit désormais explicitement la recréation de chansons existantes, l’utilisation de la voix ou de l’image d’une personne sans consentement, et les pratiques de spam ou de contournement automatisé de la modération, avec des sanctions allant de l’avertissement au bannissement définitif.
Agents et plugins : standards ouverts et modèles subagents
Agent Plugins — standard ouvert pour les plugins d’agents
6 août — OpenAI annonce Agent Plugins, un nouveau standard ouvert conçu avec AWS, Cursor, GitHub, VS Code et Vercel pour packager des Agent Skills et des configurations de serveurs MCP dans un format commun. L’objectif est de permettre aux développeurs de construire un plugin une seule fois et de le réutiliser dans plusieurs clients d’agents compatibles, au lieu de dupliquer l’intégration pour chaque outil. Au lancement, les clients compatibles listés sont Codex, ChatGPT, Cursor, GitHub Copilot, Kiro et VS Code — un périmètre large qui couvre à la fois l’écosystème OpenAI et plusieurs concurrents directs sur le terrain des agents de code. Les tweets ne détaillent pas la mécanique technique précise (format de manifeste, processus de publication) ni de date de disponibilité générale au-delà du lancement annoncé.
Perplexity Computer déploie GPT-5.6 Terra et Luna comme modèles subagents
6 août — Perplexity déploie deux nouveaux modèles GPT-5.6 au sein de Computer, sa plateforme de subagents et d’automatisations : Terra et Luna. Terra devient le modèle par défaut pour l’ensemble des subagents de Computer et sert aussi de modèle orchestrateur ; Luna est positionné comme le modèle principal des automatisations planifiées. Selon Perplexity, Terra est conçu pour le travail complexe orienté objectif, un profil adapté au rôle de subagent qui doit décomposer une tâche et l’exécuter de façon autonome. Sur le benchmark WANDR, Terra obtiendrait un score supérieur de 11 points à celui de Claude Sonnet, tout en offrant une réduction de coût d’un ordre de grandeur. Cette introduction de modèles spécialisés par rôle illustre une architecture d’agents de plus en plus différenciée chez Perplexity.
Brèves
- Together AI revendique Kimi K3 quasi deux fois meilleur que Claude Fable 5 sur le benchmark juridique Harvey LAB-AA — Sans détail méthodologique publié, à prendre comme une revendication marketing de fournisseur d’inférence. 🔗 source
- Hugging Face met en avant Cadena, un décompilateur de maillages 3D en CAO éditable — Démo Spaces qui convertit un fichier 3D figé en programme CAO modifiable étape par étape, par exemple pour élargir un trou sans reconstruire le modèle. 🔗 source
- Le CEO de Hugging Face défend une régulation IA par couche — Clément Delangue soutient le nouveau cadre réglementaire américain distinguant poids de modèles, API et applications, qu’il juge protecteur pour l’open source. 🔗 source
- Together AI détaille son architecture multi-datacenters à 99,9% de disponibilité — Trafic réparti en direct sur deux sites simultanément, avec capacité d’absorber la perte complète d’un datacenter sans interruption de service. 🔗 source
- Gemini Omni : génération gratuite de 10 vidéos prolongée jusqu’au 11 août — L’offre, qui devait s’arrêter le 4 août, reste accessible jusqu’au 11 août 2026, 23h59 (heure du Pacifique). 🔗 source
- GenOffice disponible sur Linux — La suite bureautique IA open source de Genspark, déjà sur macOS et Windows, est désormais compilable et disponible sous Linux. 🔗 source
- Flux 3 disponible dans l’agent vidéo IA de Genspark — Intégration de Flux 3 (Black Forest Labs) avec audio natif et dialogue multilingue, pour des clips jusqu’à 20 secondes en 1080p. 🔗 source
- Qwen3.8-Max grimpe dans les classements publics — Alibaba revendique la 5ᵉ place de l’Artificial Analysis Intelligence Index et la 1ʳᵉ place de l’Agentic Index, après une 2ᵉ place sur l’Image-to-WebDev Arena la veille. 🔗 source
- Qwen-Image-3.0-Pro déployé sur Qwen Cloud et fal.ai — Le modèle de génération d’image d’Alibaba, déjà classé 5ᵉ mondial, devient accessible directement sur Qwen Cloud et sur la plateforme tierce fal.ai. 🔗 source
- OpenAI et l’American Psychological Association s’associent sur l’IA et la santé mentale des jeunes — Partenariat pour développer des recommandations et garde-fous fondés sur des preuves autour du bien-être des jeunes utilisateurs. 🔗 source
- OpenAI publie des données Signals sur l’usage mondial de ChatGPT — Nouveaux indicateurs par pays sur l’adoption et les tendances d’usage, sans détail chiffré accessible à cette date. 🔗 source
- Cohere s’associe à l’Université de Waterloo pour un certificat en transformation IA — Le nouveau certificat « AI Transformation & Change Management » doit préparer les étudiants à l’adoption responsable de l’IA en entreprise. 🔗 source
Ce que ça signifie
La semaine illustre une bascule claire : l’intelligence de pointe devient l’option par défaut plutôt qu’un choix payant supplémentaire. OpenAI unifie ChatGPT autour d’un GPT-5.6 Sol qui gère à la fois la rapidité et le raisonnement profond, tout en rendant Luna illimité et gratuit pour les comptes Free et Go. GitHub suit une logique similaire côté développeurs en généralisant Kimi K3, un modèle open-weight, dans Copilot pour l’ensemble de ses offres payantes. Dans les deux cas, la nouveauté n’est pas un saut de capacités brutes mais un changement de distribution : des modèles auparavant réservés aux niveaux premium ou aux intégrations sur mesure deviennent la configuration standard, ce qui déplace la concurrence vers la fiabilité perçue et le coût d’accès plutôt que vers le score brut sur un benchmark.
La mesure de la capacité IA devient elle-même un terrain de compétition structuré. Muse Spark 1.2 de Meta se hisse quasi à la frontière selon Artificial Analysis, à un coût par tâche qui reste parmi les plus bas de sa catégorie, pendant que Meta Superintelligence Labs revendique des résultats de niveau or à cinq Olympiades scientifiques internationales sans usage d’outil — une démonstration publique pensée pour convaincre au-delà des leaderboards habituels. En parallèle, l’infrastructure qui porte ces modèles ouverts se professionnalise : Baseten devient fournisseur d’inférence officiel sur Hugging Face pour DeepSeek V4 Flash, Kimi K3 et GLM-5.2, Ai2 triple quasi son stockage sur le Hub, et Sakana AI transforme sa recherche fondamentale en produit de recherche autonome avec Marlin. Le fil conducteur : la valeur se déplace du modèle isolé vers l’écosystème qui le distribue, l’héberge et le vérifie.
Les outils de code agentique convergent vers une même idée : plus aucun modèle unique ne domine toutes les tâches, donc il faut router intelligemment. Cursor détaille comment son routeur combine estimation de complexité et classification par taxonomie pour réduire les coûts jusqu’à 68% sans perte de satisfaction perçue, Warp introduit des règles de routage en langage naturel, et Amp comme Devin étendent leurs environnements distants (Portals, intégration Vercel Sandbox) pour rapprocher le développement cloud du confort du local. Replit, de son côté, déplace ses scans de sécurité Semgrep en amont du build plutôt qu’en aval, à plus de 100 000 scans par jour à cette échelle. Ensemble, ces annonces dessinent une génération d’outils où l’intelligence n’est plus le seul levier : l’orchestration, la sécurité par défaut et l’intégration infrastructure comptent tout autant.
Au-delà des modèles de langage, la semaine montre l’IA s’installer à la fois dans des usages à impact direct et dans la production créative à grande échelle. WeatherNext de Google DeepMind, publié dans Nature et disponible en poids ouverts, offre en moyenne 24 heures de délai supplémentaire pour anticiper un cyclone — une application où l’intérêt général prime clairement sur la compétition commerciale. À l’inverse, Wan3.0 d’Alibaba, ElevenLabs et Suno illustrent la maturation rapide de la génération média : vidéo native de 30 secondes avec contrôle multimodal, doublage conditionné sur la performance vocale originale désormais en disponibilité générale sur API, et outils de watermarking déployés en réponse aux inquiétudes sur l’authenticité des contenus générés. Ces deux directions, science ouverte et création commerciale, avancent au même rythme mais avec des enjeux de responsabilité très différents.
Sources
- OpenAI — Improving GPT-5.6 Sol in ChatGPT
- @github sur X — Kimi K3 en GA dans Copilot
- GitHub — Changelog Kimi K3
- @GoogleDeepMind sur X — WeatherNext
- @Alibaba_Wan sur X — Wan3.0
- @ArtificialAnlys sur X — Muse Spark 1.2
- @shuchaobi sur X — cinq Olympiades scientifiques
- @AIatMeta sur X — relais Olympiades
- Amp — Portals
- @cognition sur X — Devin Outposts sur Vercel Sandbox
- @Replit sur X — scans de sécurité pendant le build
- @warpdotdev sur X — routeurs de modèles personnalisés
- Cursor — how Cursor Router works
- Hugging Face — Baseten
- Ai2 — partenariat Hugging Face
- @SakanaAILabs sur X — Sakana Marlin
- @github sur X — Innovation Graph Q1 2026
- @genspark_ai sur X — Genspark Design
- GitHub — guide des commandes slash
- @ElevenLabs sur X — Dubbing v2 sur ElevenAPI
- @suno sur X — transparence et règles communautaires
- @OpenAIDevs sur X — Agent Plugins
- @perplexity_ai sur X — GPT-5.6 Terra et Luna dans Computer
- @togethercompute sur X — Kimi K3 vs Claude Fable 5 (Harvey LAB-AA)
- @HuggingApps sur X — Cadena
- @ClementDelangue sur X — régulation IA par couche
- @togethercompute sur X — architecture multi-datacenters
- @GeminiApp sur X — Gemini Omni prolongé
- @genspark_ai sur X — GenOffice sur Linux
- @genspark_ai sur X — Flux 3 dans l’agent vidéo
- @Alibaba_Qwen sur X — Qwen3.8-Max classements
- @Alibaba_Qwen sur X — Qwen-Image-3.0-Pro
- OpenAI — partenariat APA
- OpenAI — données Signals
- @cohere sur X — partenariat Waterloo