Quarante-neuf annonces pour la journée du 2 septembre, le troisième volume le plus élevé depuis le début de cette veille. Trois modèles de premier plan sont sortis le même jour — Gemini 3.8 Flash chez Google, Muse Spark 1.3 chez Meta Superintelligence Labs et Qwen3.8-Max-0902 chez Alibaba — et aucun des trois n’a mis en avant la course aux scores bruts.
Quatre courants traversent cette édition. Le prix d’abord, devenu l’argument central de trois lancements sur trois. L’inférence locale ensuite, avec la génération vidéo qui descend sur une machine de bureau et un moteur d’inférence Apple Silicon dont le code est ouvert le même soir. La gouvernance des modèles en entreprise, où GitHub impose la rétention de données pour un modèle et laisse choisir le défaut pour tous les autres. Et la cybersécurité, avec un modèle dédié réservé à des défenseurs sélectionnés et une alliance qui rejoint la Linux Foundation.
Gemini 3.8 Flash et 3.8 Flash Cyber, un modèle qui travaille plus dur au même tarif
2 septembre — Google a présenté deux modèles signés Tulsee Doshi (Senior Director, Product Management) et Raluca Ada Popa (Gemini Security Lead, Google DeepMind) : Gemini 3.8 Flash et Gemini 3.8 Flash Cyber. C’est la troisième sortie Flash en six semaines, et 3.7 Flash n’avait que trois semaines d’existence.
Les deux variantes partagent la même intelligence de base, et Google attribue explicitement une partie des progrès en code et en raisonnement à un entraînement poussé sur le domaine de la cybersécurité : le travail mené pour le modèle défensif a tiré le modèle généraliste vers le haut. Le tarif introductif ne bouge pas par rapport à 3.7 Flash.
| Caractéristique de Gemini 3.8 Flash | Valeur mesurée |
|---|---|
| Prix en entrée | 0,75 dollar par million de tokens |
| Prix en sortie | 3,75 dollars par million de tokens |
| HLE-Verified | 54,9 % |
Un point mérite l’attention des développeurs, car Google le formule sans détour : le modèle consomme davantage. Le gain de fiabilité vient d’un choix de conception — sur les tâches complexes, 3.8 Flash exécute des étapes de raisonnement supplémentaires et appelle les outils de manière itérative. Aux niveaux d’effort élevés, la facture en tokens grimpe donc, et Google recommande de baisser le niveau d’effort ou de rester sur 3.7 Flash pour les charges où l’efficacité de calcul prime. La version précédente reste pleinement supportée.
La variante Cyber est la plus inhabituelle. Réservée à des défenseurs de confiance via le programme Fairwind lancé le même jour, elle vise la découverte autonome de vulnérabilités et surtout leur correction automatique.
| Épreuve de cybersécurité | Gemini 3.8 Flash Cyber | Points de comparaison |
|---|---|---|
| CyberGym Pass@1 (découverte de failles C/C++) | 86,2 % | GPT-5.5-Cyber 85,6 % · Mythos 5 83,8 % · GPT-5.6 Sol 83,6 % · 3.5 Flash Cyber 77,5 % |
| Benchmark interne sur 20 langages | plus de 70 % | Périmètre plus large que le seul C/C++ |
| CWE-Bench pass@1 (correction, Collinear) | 47,2 % | Modèle de frontière leader à 47,8 %, mais à un coût nettement supérieur |
Les chiffres de déploiement interne appuient le positionnement coût/performance plutôt qu’une domination brute : l’équipe Chrome Security obtient 2,6 fois plus de correctifs valides qu’avec les meilleurs modèles commerciaux bien plus gros, Wiz mesure un rappel supérieur de 7,5 à 9,7 % sur son benchmark de test d’intrusion pour un coût 2,3 à 5,2 fois inférieur, et l’équipe Cloud Vulnerability Research a identifié une vulnérabilité fondamentale critique en moins de deux heures là où la recherche demande habituellement des mois. Le modèle généraliste, lui, est déjà déployé dans Antigravity, l’API Gemini via Google AI Studio et Android Studio, la génération d’interfaces de Stitch, Gemini Enterprise, et pour les abonnés Google AI Pro et Ultra dans l’application Gemini, l’AI Mode de Google Search et Google Sheets.
🔗 Annonce Gemini 3.8 Flash et 3.8 Flash Cyber
Le score CursorBench qui documente le lancement
Cursor a ajouté Gemini 3.8 Flash à son sélecteur de modèles quelques heures après la présentation, et son propre banc d’essai donne la meilleure mesure disponible de ce que vaut le modèle en conditions agentiques. Le journal de CursorBench, daté du même jour, indique que 3.8 Flash est promu au rang de version Gemini « Latest » et que 3.7 Flash passe en position secondaire.
| Modèle et niveau d’effort | Score CursorBench 3.2 | Coût moyen par tâche | Étapes par tâche |
|---|---|---|---|
| Fable 5.1 Max | 73,4 % | 9,64 dollars | 70 |
| Grok 4.6 Extra High | 70,8 % | 2,81 dollars | 46 |
| Fable 5.1 High | 69,4 % | 4,80 dollars | 44 |
| Opus 5 Extra High | 69,3 % | 7,35 dollars | 72 |
| Gemini 3.8 Flash High | 69,2 % | 2,38 dollars | 161 |
| Gemini 3.8 Flash Medium | 67,0 % | 1,93 dollar | 136 |
| Gemini 3.7 Flash High | 61,6 % | 1,20 dollar | 99 |
La lecture se fait en diagonale : à 69,2 %, Gemini 3.8 Flash High obtient un score équivalent à Fable 5.1 High pour environ la moitié du prix, et à Opus 5 Extra High pour un tiers. L’écart avec la génération précédente est de 7,6 points. La colonne des étapes rappelle toutefois le coût caché du choix de conception de Google : 161 étapes par tâche, contre 44 pour Fable 5.1 High. Cursor pose lui-même deux réserves en bas de page — les résultats comportent de la variance, et le coût affiché est reconstitué à partir des tarifs publics par million de tokens, pas mesuré sur facture.
🔗 Gemini 3.8 Flash dans Cursor · 🔗 Résultats CursorBench
Muse Spark 1.3, le modèle agentique de Meta Superintelligence Labs
2 septembre — Meta Superintelligence Labs a publié Muse Spark 1.3, successeur de Muse Spark 1.2, déployé le jour même dans Muse Code et dans la Meta Model API accessible depuis dev.meta.ai. C’est la deuxième sortie du laboratoire en deux jours, après Muse Voice Transcribe.
L’angle revendiqué n’est pas la course aux scores mais l’utilisabilité réelle. Le modèle est conçu pour tenir un travail à horizon long en jonglant avec plusieurs flux dans un seul fil : face à un objectif ouvert, il utilise des outils pour se constituer son propre contexte à partir de sources désordonnées et contradictoires, corrige les lacunes de son plan et garde trace de ce qu’il a appris. La partie la plus inhabituelle concerne la collaboration : Muse Spark 1.3 est entraîné à poser des questions de clarification quand une consigne est ambiguë, à appeler l’utilisateur à l’aide quand il est bloqué et à demander confirmation avant une action à conséquence. Les comparaisons menées par des ingénieurs Meta lui attribuent environ 20 % d’appels d’outils en moins et 25 % de tokens en moins que la version 1.2 — une différence qui se lit directement sur la facture.
| Catégorie évaluée | Benchmark | Muse Spark 1.3 | Muse Spark 1.2 | GPT-5.6 Sol | Opus 5 |
|---|---|---|---|---|---|
| Agent | GDPVal-AA v2 (travail intellectuel) | 1754 | 1615 | 1710 | 1824 |
| Agent | OSWorld 2.0 (usage agentique du poste) | 66,9 | 47,6 | 62,7 | 68,3 |
| Agent | DeepSearchQA (navigation agentique) | 89,4 | 85,9 | 93,0 | 90,4 |
| Agent | AutomationBench (flux métier bout en bout) | 49,4 | 38,2 | 46,7 | 50,3 |
| Contexte long | MRCR 512K-1M | 98,1 | 55,5 | 73,8 | – |
| Codage | DeepSWE v1.1 (code agentique long) | 75,4 | 55,0 | 73,0 | 74,0 |
| Codage | SWEAtlas CodeBase QnA | 59,4 | 46,2 | 53,5 | 52,7 |
Ce tableau mérite une lecture attentive. Muse Spark 1.3 domine nettement sur le contexte long et le codage, mais Opus 5 le devance sur les quatre épreuves agentiques retenues ici. Surtout, la comparaison n’est pas menée à armes égales, et c’est la méthodologie publiée par Meta qui le dit : Muse Spark 1.3 et 1.2 ont été évalués au niveau d’effort xhigh, tandis que Claude Opus 5 et GPT-5.6 Sol l’ont été en mode max. Une seule exception, DeepSWE v1.1, où Muse Spark 1.3 a été mesuré en max — précisément le mode qui n’est pas encore disponible, Meta indiquant qu’il arrivera une fois les tests de sécurité complémentaires terminés.
Un paragraphe de la feuille de route retient l’attention pour l’écosystème ouvert.
Stay tuned for more updates soon, including bigger models, Muse Spark open weights, and more.
🇫🇷 Restez à l’écoute pour d’autres nouvelles bientôt, y compris des modèles plus grands, les poids ouverts de Muse Spark, et plus encore. — @AIatMeta sur X
Après une année où Meta a nettement réduit ses sorties à poids ouverts, l’engagement est notable — il reste à voir quelle version sera concernée, aucune date ni périmètre n’étant donnés.
Qwen3.8-Max-0902 prend la première place du Code Arena WebDev
2 septembre — Qwen a publié une mise à jour de son modèle phare : Qwen3.8-Max-0902, un snapshot daté répondant aussi à l’alias qwen3.8-max-2026-09-02. Le modèle conserve les caractéristiques structurelles de la version d’août — 2 400 milliards de paramètres et une fenêtre de contexte de 1 million de tokens — mais a reçu une phase de post-entraînement supplémentaire orientée « Coding & Cowork ».
| Caractéristique du modèle | Valeur publiée |
|---|---|
| Paramètres | 2,4 T |
| Fenêtre de contexte | 1 M tokens |
| Entrée maximale | 991 K tokens (983 K en mode thinking) |
| Sortie maximale | 131 K tokens |
| Budget de raisonnement | 262 K tokens |
| Prix en entrée et en sortie | 2 dollars et 6 dollars par million de tokens |
| Lecture de cache explicite | 0,17 dollar par million de tokens |
| Lecture de cache implicite | 0,25 dollar par million de tokens |
| Création de cache explicite | 2,50 dollars par million de tokens |
| Plafonds de débit | 1 M tokens par minute, 15 K requêtes par minute |
Le modèle accepte image, texte et vidéo en entrée, et expose cinq outils intégrés via la Responses API : interpréteur de code, recherche image vers image, recherche texte vers image, extracteur web et recherche web. Il est disponible via l’API sur QwenCloud le jour même.
Le même jour, Arena.ai a publié ses résultats sur le Code Arena WebDev. Qwen3.8-Max-0902 y entre directement à la première place du classement général avec 1 691 points, soit 22 points de plus que la version précédente, 3 points devant Claude Opus 5 en réglage Max et 17 points devant Kimi K3 en réglage Max. À un prix mixte de 5 dollars le million de tokens, le modèle occupe la position la mieux notée de la frontière de Pareto d’Arena, c’est-à-dire le meilleur rapport score-coût de tout le classement.
Le détail par catégorie nuance le tableau : premier en Data & Analytics et en Consumer Product, deuxième en Brand & Marketing, Gaming et Simulations, troisième en Content Creation Tools et Reference-Based Design. La force du modèle porte donc davantage sur les applications de données et les produits grand public que sur les tâches à dominante créative. Arena annonce des scores Agent Arena à venir.
L’inférence quitte le cloud : la vidéo sur un bureau, un moteur local sous licence ouverte
C’est le courant de fond de la journée, et il ne tient dans aucune annonce prise isolément. Deux publications majeures et quatre signaux plus discrets vont dans la même direction : faire tourner localement ce qui exigeait hier un GPU de centre de données.
2 septembre — L’équipe FastVideo du Hao AI Lab (UCSD) a publié le portage local de FastH3, sa version distillée du modèle vidéo ouvert MiniMax H3. Générer conjointement vidéo et audio supposait jusqu’ici un GPU de centre de données ; le modèle tourne désormais sur une NVIDIA DGX Spark, deux DGX Spark reliées par lien QSFP, ou un Mac Apple Silicon disposant d’au moins 36 Go de mémoire unifiée.
La contrainte principale n’est pas la puissance de calcul mais la mémoire. La DGX Spark embarque 128 Go de LPDDR5X unifiés à environ 270 Go/s, soit à peu près un dixième de la bande passante d’une HBM de centre de données, dont 121 Go réellement disponibles pour une charge. Le pipeline procède donc par phases : encoder le prompt, libérer l’encodeur de texte, charger le transformer, débruiter, le libérer, puis charger le VAE. Sur un GPU discret, recopier les poids vers l’hôte libère la mémoire du device ; sur Spark, cette copie retombe dans le même pool. L’équipe l’a supprimée au profit d’un chargement DiT direct sur GPU — le chargement du transformer tombe de 445 s à 39 s, et un run 768×1344 sur 124 images de 772 s à 336 s.
| Machine de test | Première génération | Génération répétée |
|---|---|---|
| Apple M4 Max | 504 s | 465 s |
| DGX Spark | 264 s | 243 s |
| 4x GB200 | 10,2 s | 5,1 s |
Face à la recette publique vLLM-Omni pour DGX Spark, qui demande 1 881 s en 1024×576 sur cinq secondes de vidéo et 50 étapes, FastH3 en quatre étapes descend à 268 s, soit environ 7x ; le rapport monte à 8,4x en 832×480 et retombe à 7,9x en 1344×768. Sur M4 Max, l’encodage d’un prompt non mis en cache passe d’environ 80 s à environ 17 s, et le décodeur TAEH3 fait tomber le décodage de 102 s à 1 s en ramenant le pic mémoire de 11,0 à 3,6 Gio. Les poids MLX sont publiés en INT8, INT6 et INT4 sur Hugging Face, accompagnés du FastVideo Cookbook, publié pour la première fois. Prochaine cible annoncée : la famille RTX, 5090 et 4090 comprises.
Le même soir, Perplexity a ouvert le code de Lily, le moteur d’inférence local qui fait tourner la partie sur appareil de son calcul hybride sur Mac. Le moteur avait été présenté la veille dans un billet de recherche ; le fait neuf est la publication du code sous licence Apache-2.0 dans le dépôt perplexityai/pplx-garden, où il rejoint fabric-lib et pplx-unigram.
Le code confirme un parti pris de spécialisation extrême. Lily n’est pas un moteur générique : il ne charge qu’un seul checkpoint, Qwen3.6-35B-A3B quantifié en 4 bits affine au format MLX avec une taille de groupe de 64, vérifié au chargement. Les checkpoints Qwen denses, les variantes plus petites, le BF16, GGUF, AWQ, GPTQ, int8 et fp8 sont explicitement refusés. Écrit en Rust avec des noyaux Metal compilés depuis les sources au démarrage, il n’utilise ni PyTorch ni MLX dans son chemin d’exécution, et exige un GPU Apple de famille 10 ou ultérieure — un M5 ou plus récent — sous macOS 26 au minimum. La surface d’API est tout aussi resserrée : trois routes seulement, décodage toujours glouton, paramètres d’échantillonnage, streaming, outils et contenu multimodal rejetés plutôt qu’ignorés. Cette étroitesse est le point intéressant : Perplexity ne livre pas un concurrent de MLX-LM mais la démonstration qu’un moteur taillé sur mesure pour une plateforme et un modèle donnés bat un framework généraliste.
Quatre autres publications du jour vont dans le même sens et sont reprises en Brèves : TranslatePsy-Nano, des modèles de traduction de 17 à 42 Mo couvrant dix-sept langues ; le travail d’i64 Systems sur les experts d’un modèle MoE résidant sur NVMe sans changer un octet de la sortie ; le billet de Cohere défendant le bon dimensionnement des petits modèles en entreprise ; et le live DGX Spark de NVIDIA consacré à l’exécution locale du Portable Computer de Perplexity. Aucune ne pèse lourd isolément, mais toutes déplacent le calcul du centre de données vers l’appareil.
🔗 FastH3 en local · 🔗 Ouverture du code de Lily · 🔗 Dépôt pplx-garden
Anthropic ouvre le code de Claude Commerce Agents
2 septembre — Anthropic a publié en open source Claude Commerce Agents, un dépôt de référence sous licence Apache 2.0 pour construire des agents de commerce. L’annonce arrive volontairement en amont de la saison des fêtes, période où les équipes e-commerce planifient leurs déploiements.
Le blueprint contient deux agents complets. L’agent d’achat vit dans l’application de l’entreprise : il cherche dans le catalogue, assemble un ensemble d’articles pour une demande formulée en langage naturel, mémorise les préférences du client, affiche produits, comparaisons et panier dans la conversation, puis passe la main au checkout — et répond aux questions de service client dans le même fil. L’agent marchand s’adresse aux équipes qui font tourner la boutique : analyse des ventes, alerte sur un article en rupture avant une promotion, recommandations de prix fondées sur l’historique, rédaction de campagnes.
| Élément du dépôt | Contenu livré |
|---|---|
| Agents fournis | Agent d’achat (client) et agent marchand (back-office) |
| Verticales exécutables | Retail, voyage, télécoms, billetterie |
| Runtimes | Messages API, Claude Agent SDK, Claude Managed Agents (beta) |
| Plateformes de déploiement | Claude API, Amazon Bedrock, Microsoft Foundry, Google Cloud Vertex AI |
| Plugin Claude Code | commerce-builder@claude-commerce-agents |
| Prérequis techniques | Python 3.11 ou plus, Node 22 |
| Résultats déjà observés | Chez les détaillants faisant tourner des agents d’achat sur Claude : paniers jusqu’à 35 % plus gros, acheteurs 60 % plus enclins à finaliser |
La séparation entre ce que le modèle décide et ce qui est réellement exécuté est structurelle, pas déclarative. Côté consommateur, l’interface backend appelée par l’agent ne comporte tout simplement aucune méthode de paiement. Côté marchand, chaque outil d’écriture produit un changement mis en attente accompagné d’un identifiant généré côté serveur, et la fonction apply_change n’aboutit que pour des identifiants approuvés via une véritable surface de validation humaine. Anthropic précise qu’il s’agit d’une implémentation de référence non maintenue, qui n’accepte pas de contributions : un point de départ à forker, pas une dépendance à suivre. Toutes les entreprises des démonstrations sont fictives, et rien ne passe commande ni ne débite de carte.
🔗 Annonce Claude Commerce Agents · 🔗 Dépôt commerce-agents
Le volet technique : cache, latence et garde-fous en code
Publié le même jour et signé Ali Shazal et Matthew Koen, le guide d’ingénierie qui accompagne le blueprint résume un an de travail avec des détaillants, des places de marché et des acteurs du voyage. Son premier conseil est un contre-pied : face à un agent qui doit couvrir de nombreuses catégories, ne pas créer un sous-agent par domaine. Une conversation commerce est une session unique fortement couplée, et le découpage dégrade la qualité — les capacités viennent des skills, pas de la multiplication d’agents.
| Sujet traité | Repère chiffré donné par Anthropic |
|---|---|
| Réponse commerce rendue | 500 à 700 tokens de sortie |
| Lecture de tokens en cache | Un dixième du coût des tokens frais |
| Écriture de cache | Prime d’environ 1,25x, amortie dès la deuxième utilisation |
| Taux de succès du cache à viser | 90 à 99 % |
| Vitesse des lectures en cache | 1,5 à 2x plus rapides autour de 100 000 tokens |
| Gain de la mémoire | 13 % de rappel factuel en plus sur la suite d’évaluation interne |
| Cas d’évaluation par flux | 50 à 100 pour commencer |
Sur le choix du modèle, la recommandation est de partir d’Opus pour les agents marchands, où l’analyse domine, et de Sonnet pour les agents consommateurs, où la latence pèse davantage — puis de balayer toute la suite d’évaluation sur chaque modèle et chaque niveau d’effort, en mesurant le coût par tâche accomplie plutôt que par appel de modèle. La section sûreté, elle, est sans ambiguïté.
The prompt is where safe behavior starts, but in commerce it can’t be where safety is enforced. The failures are financial and often irreversible, and a prompt rule is one injection or one bad sample away from being skipped.
🇫🇷 Le prompt est l’endroit où le comportement sûr commence, mais en commerce ce ne peut pas être l’endroit où la sûreté est appliquée. Les défaillances sont financières et souvent irréversibles, et une règle de prompt n’est qu’à une injection ou un mauvais échantillon d’être contournée. — Anthropic, A guide to the anatomy of effective commerce agents
Quatre règles sont donc appliquées en code, définies une seule fois pour être partagées par les trois runtimes : le modèle prépare mais une personne ou une politique applique ; les écritures et les rendus n’acceptent que des identifiants émis par le serveur ; les transactions plafonnées doivent tenir face à des requêtes répétées ; le contenu tiers est assaini.
Le contrôle de l’ordinateur passe en arrière-plan dans Claude Code et Claude Cowork
2 septembre — Le contrôle de l’ordinateur (computer use) par Claude ne monopolise plus l’écran. Jusqu’ici, lancer une telle tâche revenait à céder sa machine : les autres fenêtres étaient masquées le temps que Claude travaille dans l’application approuvée. Désormais, dans Claude Cowork comme dans l’onglet Code de l’application desktop, la tâche se poursuit en arrière-plan pendant que l’on continue autre chose.
Le changement est en beta, réservé aux forfaits Pro et Max, et limité à macOS — alors que le computer use lui-même reste disponible en research preview sur macOS et Windows. Il n’y a rien à activer pour ceux qui utilisaient déjà la fonction ; les autres la trouveront dans Settings > General, sachant que macOS exige aussi les autorisations système Accessibilité et Enregistrement de l’écran.
Le cadre de sécurité, lui, ne bouge pas. Contrairement à l’outil Bash qui tourne en bac à sable, le computer use s’exécute sur le bureau réel. Les paliers d’accès restent fixés par catégorie d’application et ne se modifient pas : vue seule pour les navigateurs et les plateformes de trading, clic seul pour les terminaux et les IDE — de quoi pousser Claude vers l’outil dédié plutôt que vers le contrôle d’écran — et contrôle complet pour le reste. Une approbation vaut pour la session en cours, ou trente minutes dans une session lancée depuis Dispatch.
🔗 Annonce du computer use en arrière-plan
Cursor fait tourner ses agents cloud sur des machines gérées par le client
2 septembre — Cursor a publié un billet produit signé Jack Pertschuk qui ouvre ses agents cloud à une infrastructure que le client possède. Jusqu’ici, un agent cloud Cursor tournait sur une machine virtuelle dédiée dans le cloud de l’éditeur. Avec Self-Hosted Machines, l’exécution des outils bascule sur des machines situées dans le réseau de l’entreprise, tandis que la boucle d’agent, l’inférence et la planification restent chez Cursor.
Le chiffre qui justifie la manœuvre est donné d’entrée : les agents cloud produisent désormais plus de 60 % des pull requests que Cursor fusionne en interne. Quand une part croissante du travail passe par ces agents, la machine sur laquelle ils s’exécutent cesse d’être un détail. L’éditeur identifie trois situations qui poussent une équipe vers ses propres machines : exécuter les outils au contact direct du gestionnaire de sources et des services internes, disposer de matériel particulier comme des GPU ou des Mac pour le développement iOS, ou faire tourner un système d’exploitation difficile à empaqueter dans une image d’agent cloud.
| Aspect du dispositif | Détail technique |
|---|---|
| Commande d’enregistrement | agent worker start, connexion HTTPS sortante longue durée |
| Sens de la connexion | Cursor n’initie jamais de connexion entrante vers le réseau du client |
| Configurations disponibles | My Machines (poste ou VM individuelle) et Pools (file partagée d’équipe) |
| Reprise après inactivité | Hibernation par snapshot, restauration avec le même identifiant de worker |
| Fournisseurs de bacs à sable | AWS Lambda, Cloudflare, Coder, Daytona, E2B, Modal, Namespace, Vercel |
| Contrôle de l’ordinateur | Linux désormais pris en charge, en plus des Mac, via Chrome ou Chromium |
Les pools montent en charge via un contrôleur qui surveille la file de requêtes et démarre des machines avec un script fourni par l’équipe ; si aucun worker n’est libre, la requête attend. Pour le cas intermédiaire entre réinitialiser une machine et la garder allumée, coûteux dans les deux sens, Cursor introduit l’hibernation : la machine inactive est snapshotée et arrêtée, et si une relance arrive dans la fenêtre de reconnexion, le snapshot est restauré. Un pool n’étant pas lié à un dépôt, une même file peut en servir plusieurs.
Une réserve, que le billet pose lui-même : seul l’environnement d’exécution se déplace. Les sorties d’outils remontent vers Cursor pour l’inférence et peuvent contenir du code, et les transcriptions d’agents peuvent y être traitées et stockées. Ce n’est donc pas une isolation complète, mais un déplacement du lieu d’exécution.
Claude Fable 5.1 entre en disponibilité générale chez les intégrateurs
1er et 2 septembre — Le jour même de sa sortie, Claude Fable 5.1 est passé en disponibilité générale dans GitHub Copilot ; le lendemain, Genspark l’a intégré à son Code Agent et à Claw. Deux intégrateurs en deux jours, sur le même modèle : c’est une vague d’adoption, pas deux nouvelles isolées.
Chez GitHub, la couverture est large — Visual Studio Code, Visual Studio, Copilot CLI, le coding agent, l’application GitHub Copilot, github.com, GitHub Mobile sur iOS et Android, les IDE JetBrains, Xcode et Eclipse — pour les forfaits Pro+, Max, Business et Enterprise, avec un déploiement progressif et une facturation au tarif public du fournisseur. Mais l’aspect le plus notable de cette mise à disposition n’est pas technique, il est contractuel.
| Condition d’accès | Ce qui s’applique à Fable 5.1 |
|---|---|
| Politique administrateur | Désactivée par défaut, à activer explicitement |
| Rétention des données | Obligatoire par défaut, pour les classificateurs de sûreté d’Anthropic |
| Usage des données retenues | Pas d’entraînement des modèles d’Anthropic |
| Autres modèles Claude | Rétention nulle conservée, sauf Fable 5 et Fable 5.1 |
| Exemption de rétention nulle | Entreprises éligibles, jusqu’à la fin de l’année civile |
| Après l’exemption | Enterprise Frontier Safeguards requis |
Contrairement aux autres modèles Claude de Copilot, Fable 5.1 exige la rétention des données par défaut : Anthropic conserve prompts et sorties pour faire fonctionner ses classificateurs de sûreté. Activer la politique vaut donc acceptation explicite de cette contrainte, et la laisser fermée rend simplement le modèle indisponible. La porte de sortie est temporaire et sélective : les entreprises éligibles peuvent rester en rétention nulle jusqu’à la fin de l’année civile, le temps qu’Anthropic déploie ses Enterprise Frontier Safeguards, qui doivent apporter une surveillance de sûreté automatisée et des clés de stockage et de chiffrement contrôlées par le client. L’éligibilité ne s’obtient pas en libre-service : elle passe par l’équipe commerciale GitHub, que le support ne peut pas court-circuiter, et même approuvée elle n’active rien automatiquement.
Genspark, de son côté, revendique une intégration dès le premier jour dans Genspark Code Agent et dans Claw, sans benchmark ni détail de tarification. L’éditeur rejoint la liste des plateformes agentiques ayant basculé dans les heures suivant la sortie du modèle, aux côtés de Cursor, Devin, Warp, v0, Amp et Perplexity Computer.
🔗 Fable 5.1 dans GitHub Copilot · 🔗 Annonce Genspark
GitHub détaille comment il a rendu Copilot moins cher sans dégrader la qualité
2 septembre — GitHub a publié un article d’ingénierie signé Erik Kristensen, avec Napalys Klicius, sur la réduction du coût de Copilot. Le texte est inhabituel dans ce registre : il donne des chiffres, décrit les expériences qui ont échoué et explique pourquoi une optimisation évidente peut se retourner contre soi.
La thèse d’ouverture est contre-intuitive. Compter les tokens d’une interaction isolée ne mesure pas l’efficacité : une réponse d’outil concise qui omet une information dont l’agent a besoin le force à relancer la commande, ce qui rend la tâche plus lente et plus chère au total. GitHub illustre le piège avec RTK (Rust Token Killer), un utilitaire qui raccourcit la sortie shell avant lecture. Il raccourcissait bien certaines réponses, mais les étapes de récupération qui suivaient ajoutaient des tours : des tokens économisés localement, dépensés globalement. Il n’a pas été déployé.
| Changement évalué | Gain mesuré |
|---|---|
| Suppression des numéros de ligne, en tests hors ligne | Environ 5 % de coût d’inférence en moins |
| Suppression des numéros de ligne, en production sur le CLI | Environ 3 % de coût quotidien moyen par utilisateur en moins |
Compression du prompt de l’outil task | 1 300 tokens par tour retirés, 2,9 % de coût normalisé par heure active |
| Livraison directe du travail de fond terminé | Environ 2,3 % d’usage lié aux tokens en moins, mesuré en AI Credits |
| Numéros de ligne et compression sur Copilot code review | Environ 5 % de tokens de prompt par revue, pour chacun des deux |
| Migration antérieure vers les outils fichiers partagés | Environ 20 % de coût de revue en moins |
| RTK (Rust Token Killer) | Écarté, coût global en hausse dans la configuration testée |
La politique de compression retenue est volontairement conservatrice, en trois volets : préserver intactes les sorties qui ressemblent à du source, réorganiser les résultats de recherche sans rien supprimer, et ne compresser que le bruit répétitif d’installation, de build et de test. La compression de git diff faisait partie des premières versions ; elle a été retirée après que des tâches de benchmark aient montré des agents rouvrant la sortie originale.
L’épisode le plus instructif concerne la compression de prompt. Une boucle de méta-prompting, où Copilot réécrit itérativement sa propre consigne, a divisé par deux le prompt de l’outil task — mais la première expérience en ligne a révélé une régression que les évaluations hors ligne avaient manquée : la boucle avait converti une consigne prudente sur le parallélisme en règle d’ordonnancement stricte, sérialisant des agents indépendants. Le correctif a remplacé listes blanches et noires par une seule phrase laissant la décision au modèle. Dernier enseignement, le plus utile : les gains ne se transportent pas d’un produit à l’autre. Un jeu de consignes plus serré, inspiré des bons résultats obtenus sur Copilot code review, a fait augmenter le coût sur Copilot CLI.
None of these changes made the model smarter. They removed work the model never needed to do.
🇫🇷 Aucun de ces changements n’a rendu le modèle plus intelligent. Ils ont retiré du travail que le modèle n’avait jamais eu besoin de faire. — GitHub Blog, How we make AI coding more cost-efficient
Le catalogue de modèles de Copilot se recompose
1er et 2 septembre — Deux changelogs du même moment décrivent les deux faces d’une même recomposition : ce qui sort du catalogue Copilot, et qui décide désormais du modèle par défaut.
Six modèles sont dépréciés au 1er septembre dans la plupart des expériences Copilot — Copilot Chat, éditions en ligne, modes ask et agent, complétions de code.
| Modèle retiré | Alternative suggérée par GitHub |
|---|---|
| Gemini 3.1 Pro | Gemini 3.7 Flash |
| Claude Opus 4.5 | Claude Opus 4.7, Claude Opus 4.8 ou Claude Opus 5 |
| Claude Opus 4.6 | Claude Opus 4.7, Claude Opus 4.8 ou Claude Opus 5 |
| Claude Sonnet 4.5 | Claude Sonnet 5 |
| Claude Sonnet 4.6 | Claude Sonnet 5 |
| Raptor Mini | MAI-Code-1.1-Flash |
Une exception subsiste : Claude Sonnet 4.6 reste accessible aux abonnés individuels sur forfait annuel. Aucune action n’est nécessaire côté utilisateur, mais les administrateurs Copilot Enterprise peuvent avoir à activer explicitement les modèles de remplacement dans leurs politiques, faute de quoi ceux-ci n’apparaîtront ni dans VS Code ni sur github.com.
Dans le même temps, les réglages gérés en entreprise acceptent désormais n’importe quel modèle comme défaut des nouvelles conversations. La granularité va plus loin que l’entreprise : en déclarant la clé model comme overridable et en éditant les fichiers de configuration d’équipe dans team-mappings.json, un administrateur peut laisser chaque équipe choisir son propre défaut, les utilisateurs non couverts héritant du réglage global. La fonctionnalité est en disponibilité générale sur Copilot Business et Copilot Enterprise, dans l’application GitHub Copilot, Copilot CLI et Visual Studio Code.
🔗 Modèles dépréciés · 🔗 Modèle par défaut en entreprise
Le Ship Log d’août : Copilot dans Slack et Teams, et des médias dans le CLI
1er et 2 septembre — Le récapitulatif mensuel publié par GitHub sous forme d’Article X est un exercice promotionnel, mais il expose une livraison d’août qui n’avait pas été relayée : GitHub Copilot est désormais accessible depuis Slack et Microsoft Teams. L’intégration amène les capacités agentiques de Copilot CLI et de l’application GitHub Copilot dans les conversations d’équipe — mentionner GitHub permet de planifier des changements, d’investiguer un problème ou de relayer une tâche de codage sans quitter le fil.
| Élément du Ship Log d’août | Ce qui a été livré |
|---|---|
| Copilot dans Slack et Microsoft Teams | Capacités agentiques de Copilot CLI et de l’application Copilot |
| Copilot code review, profondeur Balanced | Disponibilité générale, à côté de Lite, défaut réglable par organisation ou dépôt |
| Nouveaux modèles rappelés | Gemini 3.7 Flash, MAI-Code-1.1-Flash, Kimi K3 hébergé par Fireworks AI |
| Promotion sur GPT-5.6 Sol | Moitié prix jusqu’au 3 septembre |
| Promotion sur la sélection automatique | 30 % de remise pour les utilisateurs Copilot Max |
| GitHub Copilot Day | 10 septembre 2026 |
Le récapitulatif documente aussi la profondeur Balanced de Copilot code review, passée en disponibilité générale à côté de Lite : Balanced vise une analyse plus approfondie sur les pull requests, Lite les changements directs, et la profondeur par défaut se règle au niveau de l’organisation ou du dépôt.
Une autre livraison du mois vient compléter le tableau côté ligne de commande : le flag répétable --attach de GitHub CLI, disponible depuis gh v2.99.0, téléverse une image ou une vidéo locale et la référence en ligne dans une issue, une pull request ou un commentaire. Il fonctionne sur les six commandes qui écrivent du Markdown, et le détail qui le rend utilisable est le traitement du Markdown existant : un chemin local déjà référencé dans le corps est réécrit sur place, de sorte que  conserve son texte alternatif et pointe vers l’asset téléversé. Le texte alternatif se fournit après un # dans le chemin. Formats acceptés : PNG, JPEG, GIF, WebP, SVG, MP4, MOV et WebM, avec 10 Mo pour les images et 100 Mo pour la vidéo sur les forfaits payants. GitHub Enterprise Server n’est pas pris en charge dans cette version. GitHub souligne explicitement que les agents de codage héritent de cette capacité et peuvent désormais montrer un résultat plutôt que le décrire.
🔗 August 2026 Ship Log · 🔗 Médias dans GitHub CLI
Fairwind Program, la cyberdéfense de Google réservée aux défenseurs de confiance
2 septembre — Le même jour que Gemini 3.8 Flash Cyber, Google a lancé le Fairwind Program, le canal par lequel ce modèle est distribué. Le raisonnement exposé par Four Flynn, vice-président sécurité et confidentialité, part d’un dilemme concret pour les équipes de défense : adopter des modèles de frontière massifs, coûteux et difficiles à maîtriser sur des bases de code d’entreprise, ou se rabattre sur des modèles à poids ouverts plus petits qui peinent sur la correction de vulnérabilités complexes.
La réponse associe Gemini 3.8 Flash Cyber à CodeMender, le harnais de correction automatique de Google. L’argument central n’est pas la détection mais la remédiation : repérer des faiblesses crée de la prise de conscience et de la peur, alors que trouver et corriger automatiquement apporte de la sécurité. La promesse est de générer des correctifs vérifiés et déployables en quelques minutes plutôt qu’en semaines, à l’intérieur de l’environnement cloud sécurisé de l’organisation cliente.
L’accès est délibérément échelonné, avec trois cercles prioritaires : les gouvernements et autorités cyber nationales, les opérateurs d’infrastructures critiques dans la santé, les télécommunications, l’énergie et les réseaux financiers, et les plateformes technologiques centrales. Les organisations participantes acceptent des contraintes strictes — restreindre l’accès aux équipes internes de cybersécurité, de réponse à incident ou de test d’intrusion, et déployer des protections comme l’authentification multifacteur. Google annonce plus de 650 partenaires participants dans le monde. Hors programme, tout client Google Cloud peut utiliser CodeMender avec des modèles publiquement disponibles sur Gemini Enterprise Agent Platform, en complément d’AI Threat Defense. L’entreprise indique par ailleurs avoir dépassé 100 millions de dollars de financement cybersécurité cumulé via Google.org, dont 36 millions pour 35 cliniques cyber ayant appuyé plus de 1 250 hôpitaux, districts scolaires et services municipaux américains.
L’outillage Google en ligne de commande : trois versions en deux jours
1er et 2 septembre — Google a livré trois versions sur le même périmètre en deux jours, et l’ensemble dessine une priorité claire : moins de fonctionnalités, plus de confinement et de stabilité.
| Version publiée | Date | Contenu dominant |
|---|---|---|
| Gemini CLI v0.58.0 | 1er septembre | Sept changements à dominante sécurité, promotion en canal stable |
| Antigravity CLI 1.1.23 | 1er septembre | Deux améliorations, onze correctifs |
| Antigravity 2.12.0 | 2 septembre | Sept améliorations, neuf correctifs |
Le canal stable de Gemini CLI est passé à v0.58.0, une promotion passée inaperçue parce qu’elle est intervenue trente-deux minutes après la publication de la preview v0.59.0. Le contenu est presque entièrement défensif. Le correctif le plus substantiel touche le bac à sable macOS : le profil Seatbelt isole désormais les sockets et binaires de Docker et des runtimes de conteneurs, ce qui ferme une voie classique d’évasion — un processus confiné qui atteint le socket Docker de l’hôte peut en pratique s’en échapper. Deux autres durcissent le cœur : l’évaluation des liens symboliques devient cohérente dans la gestion des chemins ignorés, et les vérificateurs de sûreté de premier niveau sont explicitement déclarés dans la configuration de la politique d’écriture.
Antigravity 2.12.0 apporte deux nouveautés fonctionnelles. La citation de réponses permet de surligner une portion d’une réponse pour la réinjecter comme contexte dans le prompt suivant — une réponse directe à un problème quotidien des sessions agentiques longues. Et la commande /boost, réservée aux utilisateurs payants, renforce l’effort de réflexion via un pipeline de raisonnement multi-agent. Elle arrive le jour même de Gemini 3.8 Flash, dont Google assume qu’il travaille plus dur au prix de davantage de tokens : les deux mouvements vont dans le même sens, celui d’un contrôle explicite du niveau d’effort par l’utilisateur. Le reste touche des irritants réels : les paramètres généraux signalent quels projets surchargent un réglage, les dispositions de terminal en écran divisé survivent aux rechargements de fenêtre, et un message peut partir pendant que la dictée tourne.
Antigravity CLI 1.1.23, enfin, allège le streaming des subagents en envoyant les métadonnées de trajectoire une fois par sous-trajectoire au lieu d’à chaque étape, et accepte par Tab le nom de modèle suggéré en texte fantôme dans /model. Ses onze correctifs révèlent des défauts pénibles au quotidien : plantages provoqués par les hooks de prompt, identifiants d’appel d’outil omis lors de la reconstruction de l’historique pour les modèles Gemini, invites de permission affichant des titres génériques plutôt que des descriptions d’action lisibles — un vrai problème, puisqu’on demande d’autoriser une action qu’on ne décrit pas — et subagents déclarés avec enable_mcp_tools=true qui échouaient faute de dispatcher MCP.
🔗 Notes de version Gemini CLI v0.58.0 · 🔗 Changelog Antigravity
Les Short Video Overviews de Gemini Notebook passent à plus de 70 langues
1er septembre — Gemini Notebook a étendu ses Short Video Overviews à plus de 70 langues, en y ajoutant trois nouvelles variantes de l’anglais. La fonctionnalité transforme les sources d’un notebook en vidéos verticales d’environ 60 secondes, désormais générables dans la langue de l’utilisateur.
Le déploiement concerne le web et le mobile, et reste réservé aux abonnés Ultra et Pro — l’équipe précisant dans le même fil que la diffusion vers les utilisateurs Pro n’est pas encore complète. Deux détails complètent l’annonce : le nombre de sources présentes dans un notebook n’entre pas dans le calcul de la consommation de tokens, et les utilisateurs Pro conservent la génération de Cinematic Video Overviews en anglais. Le passage de l’anglais à 70 langues fait basculer la fonctionnalité du statut de démonstration à celui d’outil réellement utilisable hors du monde anglophone.
Les éditeurs deviennent des multiplexeurs de modèles
1er et 2 septembre — Deux annonces sans lien apparent décrivent le même mouvement : l’environnement de développement devient un point d’accès à des modèles tiers, et le différenciateur se déplace de la qualité du modèle vers les conditions dans lesquelles il tourne.
Zed a publié sa version stable 1.18.0, dont le contenu le plus significatif se trouve dans la section IA des notes de version. L’éditeur y rattrape en une fois plusieurs sorties récentes : la fenêtre de contexte de 1 million de tokens de GPT-5.6 est prise en charge sur Amazon Bedrock, Gemini 3.5 Flash-Lite rejoint les modèles Google AI, Grok 4.5 et Grok 4.6 rejoignent les modèles xAI, et la prise en charge de Claude Fable 5.1, sorti la veille, est améliorée. Deux de ces quatre entrées sont des contributions extérieures créditées dans les notes. S’y ajoutent des éléments d’ergonomie propres au travail avec des agents — rechargement d’une connexion d’agent externe cassée sans redémarrer, consommation mémoire réduite sur les longues sessions, erreurs de connexion qui nomment l’hôte injoignable — et un correctif à signaler pour qui branche des serveurs MCP : l’authentification OAuth échouait avec les serveurs exigeant des portées non standard.
Mistral, de son côté, a ouvert GLM 5.2 dans Vibe Code, son agent de codage, pour les formules Pro et Team. Le point notable n’est pas le modèle mais la manière dont il est servi : Mistral l’héberge en Europe sur sa propre infrastructure. Un développeur européen qui utilise GLM 5.2 depuis Vibe Code adresse donc une inférence opérée par Mistral, sans que ses requêtes transitent par les serveurs de Z.ai. C’est la traduction concrète du positionnement d’inférence régionale que l’éditeur défend depuis août — et la situation est doublement révélatrice, puisque Mistral dispose de sa propre famille Devstral et choisit malgré tout de proposer dans son outil un modèle à poids ouverts développé par un laboratoire concurrent.
🔗 Notes de version Zed 1.18.0 · 🔗 GLM 5.2 dans Vibe Code
NVIDIA : deux billets d’ingénierie et une alliance qui change de tutelle
2 septembre — Trois publications de NVIDIA le même jour, deux techniques et une de gouvernance.
Le premier billet, troisième volet de la série sur le co-design de modèles, donne cinq règles pour régler le speculative decoding. La technique est connue : un petit modèle de draft propose plusieurs tokens que le modèle cible vérifie en une passe parallèle. La question pratique reste ouverte — combien de tokens spéculer, et avec quel mécanisme. Pendant la vérification, le calcul croît avec (1 + D) mais les accès mémoire restent inchangés : il faut donc augmenter la longueur de draft D jusqu’au point où la vérification bascule de memory-bound à compute-bound. Sur un GEMM d’expert représentatif, D = 7 permet d’atteindre ce régime avec un huitième de la taille de batch nécessaire à D = 0. Quand l’attention domine le temps de décodage, la longueur optimale devient D = 128/G − 1, où G est le nombre de têtes de requête partageant une tête KV, et au-delà il vaut mieux choisir des valeurs où G × (1 + D) est un multiple de 128, la taille de tuile du noyau d’attention. Les mesures s’appuient sur SPEED-Bench, le benchmark de speculative decoding de NVIDIA : avec Qwen 3.5 122B A10B comme cible, le draft externe 35B A3B atteint une longueur d’acceptation de 6 à D = 9. Le billet insiste sur un point souvent négligé — une acceptation plus élevée ne signifie pas une accélération plus élevée — et se termine par une mise en garde : un fine-tuning de la cible modifie sa distribution de sortie, si bien qu’un drafter appris pour un checkpoint donné peut perdre en acceptation même quand la cible s’améliore.
Le second billet est un parcours d’optimisation CUDA en six étapes, construit autour d’un exemple unique : convertir trois images RVB en niveaux de gris, puis calculer la médiane de chaque tuile de 32 × 32 pixels. Le point de départ est un code volontairement fautif, que Compute Sanitizer diagnostique immédiatement — une écriture hors bornes en mémoire partagée, causée par l’usage d’un index global là où un index de bloc était attendu.
| Étape d’optimisation | Temps total | Gain de l’étape |
|---|---|---|
| Code de départ | 6,8 s | — |
| CUB (DeviceTransform et BlockRadixSort) | 635 ms | environ 10x |
| Conteneurs mémoire poolés | environ 244 ms | environ 2,6x |
| Mémoire épinglée | 25 ms | environ 10x |
| Un flux CUDA par image | 23 ms | environ 300x cumulé |
Le remplacement du tri à bulles maison par cub::BlockRadixSort fait à lui seul tomber le calcul des médianes de 2,142 s à 773 µs, soit un facteur 2717. Aucune de ces étapes ne relève de l’optimisation bas niveau : ce sont des remplacements d’API.
Enfin, l’Open Secure AI Alliance, que NVIDIA a contribué à fonder, rejoint la Linux Foundation. La thèse défendue par l’alliance déplace le curseur du débat habituel : un agent n’est pas seulement un modèle de langage, c’est un système logiciel fait de modèles, de harnais qui lui donnent du contexte et de garde-fous qui bornent ce qu’il peut faire. Or la conversation sur la sûreté s’est largement concentrée sur le modèle seul, alors que la sécurité dépend de l’ensemble — harnais, mécanismes d’alignement, environnements d’exécution, identité, politique, observabilité et récupération. Un appel à commentaires est ouvert sur SAFE (Shared AI Findings Exchange), dispositif de collecte confidentielle des incidents et quasi-incidents liés à l’IA, en collaboration avec OpenSSF.
🔗 Speculative decoding · 🔗 Optimisation CUDA pas à pas · 🔗 Open Secure AI Alliance
Equinix Inference Exchange, les modèles ouverts dans 280 centres de données
2 septembre — Equinix a annoncé Equinix Inference Exchange, un programme d’inférence IA distribuée qui étend sa collaboration avec NVIDIA et y ajoute Together AI. Le montage repose sur trois couches : Equinix fournit le socle physique relié aux clouds via Equinix Fabric, NVIDIA apporte ses architectures de référence entreprise validées, et Together AI fait tourner la plateforme au-dessus avec la prise en charge de plus de 200 modèles open source, en déploiement mutualisé ou en environnement mono-locataire dédié.
L’argument porte sur la localisation de l’inférence plutôt que sur le choix du modèle, avec trois cas visés : l’inférence en périphérie métropolitaine pour réduire la latence, la migration de charges depuis des modèles propriétaires fermés vers des alternatives ouvertes, et l’IA souveraine pour les entreprises régulées. Les chiffres d’empreinte donnent la mesure du réseau mobilisé : plus de 280 centres de données sur 77 métropoles, 230 rampes d’accès cloud et plus de 10 500 entreprises interconnectées.
Un point de vigilance sur le calendrier, cependant : le communiqué d’Equinix indique noir sur blanc que la solution sera disponible à partir du premier trimestre 2027, alors que le message de Together AI décrit sa plateforme comme déjà active dans les centres de données mondiaux d’Equinix. C’est une annonce de partenariat et de feuille de route, pas une mise en service.
BenchMIRT, la méthode d’Ai2 pour auditer ce que mesurent vraiment les benchmarks
1er septembre — Ai2 a publié BenchMIRT, une méthode qui pose une question rarement traitée de front : un benchmark mesure-t-il réellement la capacité qu’il prétend mesurer ? Plutôt que de raisonner sur le score final, elle descend au niveau de chaque question et estime quelles capacités déterminent réellement la réussite, en s’appuyant sur la théorie de réponse à l’item (Item Response Theory) issue de la psychométrie, dans sa variante multidimensionnelle. L’entraînement a porté sur les résultats de 100 modèles à poids ouverts, 16 benchmarks et plus de 34 000 questions.
Le résultat le plus solide est méthodologique : sans qu’on lui indique quel benchmark était censé mesurer quoi, BenchMIRT a fait émerger de lui-même deux dimensions dominantes, la sécurité et le raisonnement général, retrouvées à l’identique en rejouant l’analyse depuis zéro.
| Benchmark audité | Corrélation au raisonnement | Corrélation à la sécurité | Verdict de l’audit |
|---|---|---|---|
| MMLU-Pro | 0,97 | -0,21 | Conforme à son objectif affiché |
| BBQ | 0,85 | -0,06 | Suit le raisonnement malgré son statut de test de sécurité |
| WMDP | -0,89 | 0,21 | Mesure l’absence de connaissances dangereuses |
| ToxiGen | 0,40 | -0,32 | Faible sur les deux, benchmark saturé à 92 % |
BBQ, conçu pour tester si un modèle s’appuie sur des stéréotypes sociaux, corrèle donc à 0,85 avec le raisonnement général et pas du tout avec la sécurité : un mauvais score en dit peut-être davantage sur le raisonnement du modèle que sur son comportement. Le second apport est pratique : en classant les questions par pouvoir discriminant, Ai2 montre qu’en n’en gardant que 10 % on conserve à peu près le même classement des modèles, et que la méthode prédit correctement la réponse à une question non observée 79 % du temps, contre 70 % pour une approche naïve. Deux limites assumées : les modèles d’entraînement datent tous d’avant mars 2025, et les dimensions découvertes dépendent du jeu de benchmarks fourni.
Runway Dev MCP, l’agent de codage prend la main sur l’intégration média
2 septembre — Runway a lancé Runway Dev MCP, un serveur MCP hébergé qui branche sa plateforme développeur directement dans l’outil de codage utilisé au quotidien — Claude, ChatGPT, Codex ou Cursor. L’argument tient en une phrase : l’agent qui a écrit l’intégration peut désormais choisir le bon modèle pour elle, configurer les outils sur lesquels elle s’appuie et la déboguer.
Le service couvre les trois moments d’une intégration. Avant le premier appel d’API, l’agent interroge le catalogue pour savoir quels modèles un projet peut utiliser, à quel prix et avec quelles entrées, puis récupère le schéma de requête exact du modèle retenu — l’objectif étant d’appeler correctement dès la première tentative plutôt que de deviner. En production, il crée et configure un Model Router qui arbitre entre plusieurs modèles selon le coût, la latence ou la qualité, avec une limite de coût par génération, et peut retrouver quel modèle le routeur a choisi pour un appel donné. La même logique s’applique aux Characters. Le troisième moment est le débogage : quand une génération échoue, l’agent consulte la tâche via un outil défini et lit le motif exact du refus — rejet de modération, limite de taille d’asset, corps de requête malformé — avant de corriger et de relancer. Un menu Quickstart crée la clé d’API puis ouvre Claude Code, Codex ou Cursor avec un message déjà rédigé.
DreamX-Creator 1.0, génération audio-vidéo native en 2K depuis une seule image
2 septembre — L’équipe AMAP d’Alibaba a présenté DreamX-Creator 1.0, un modèle de 7 milliards de paramètres sous licence Apache 2.0 qui part d’une seule image et d’un prompt texte pour produire un flux vidéo et un flux audio synchronisés nativement en 2K, sans enchaîner un modèle vidéo et un modèle audio en cascade.
Trois briques structurent le système : une attention croisée intermodale à portes (Gated Cross-Modal Attention) associée à un entraînement conjoint progressif, qui permet une interaction bidirectionnelle entre les deux flux ; un apprentissage par renforcement audio-vidéo alimenté par un retour multimodal sensible à la modalité ; et un raffinement autorégressif en une seule étape qui porte la vidéo en 2K tout en préservant le mouvement et le calage temporel de l’audio.
La publication reste partielle à ce stade. Le dépôt GitHub, initialisé la veille, contient la présentation du projet et sa feuille de route, et le rapport technique est paru sur arXiv. Les poids validés, le code d’inférence, les configurations et les outils d’évaluation figurent encore comme jalons non franchis. Le travail s’appuie sur Wan2.2 et sur MOVA d’OpenMOSS, tous deux explicitement remerciés.
L’API OpenAI distingue une montée en charge trop rapide d’une surcharge de modèle
2 septembre — OpenAI a modifié la façon dont son API signale deux situations que les applications clientes ne pouvaient pas distinguer jusqu’ici.
| Statut HTTP | Code d’erreur | Signification | Conduite à tenir |
|---|---|---|---|
| 429 | slow_down | Le débit de requêtes a augmenté trop vite | Respecter Retry-After, réduire le débit, puis le remonter progressivement |
| 503 | server_is_overloaded | Le modèle demandé est temporairement surchargé | Respecter Retry-After puis réessayer, allonger le délai si l’erreur persiste |
La distinction a une conséquence pratique immédiate pour tout code de retry. La documentation précise qu’une erreur slow_down peut survenir alors même que le trafic reste dans les limites en requêtes et en tokens par minute de l’organisation : elle ne signale pas un quota épuisé mais une accélération jugée trop brutale — autrement dit, une application peut se faire freiner sans avoir dépassé la moindre limite affichée. Le guide des limites de débit avance une règle empirique : une fois le trafic arrivé à un million de tokens d’entrée par minute, ne pas l’augmenter de plus de 50 % toutes les quinze minutes. Quand l’en-tête Retry-After est absent, OpenAI recommande un backoff exponentiel assorti d’un petit délai aléatoire, pour éviter que toutes les instances d’un même service ne réessaient simultanément. Les organisations dont le trafic à l’usage se heurte régulièrement à ces limites sont orientées vers Scale Tier, et vers Reserved Tier pour GPT-5.6 et les modèles suivants.
Brèves
- Claude Code 2.1.258 — version uniquement corrective : le démarrage sur macOS 12 Monterey, cassé depuis la 2.1.255, est rétabli, et les sessions distantes et planifiées n’échouent plus après une réapprobation de permission. 🔗 CHANGELOG
- Claude Campus Ambassadors — les candidatures sont ouvertes avec trois parcours distincts cette année : premier cycle, cycle supérieur, doctorat et post-doctorat. 🔗 Annonce
- Nokia analyse 50 millions de lignes de code avec Cursor — deux ingénieurs de la division Core Networks en deux semaines, là où l’équipe estimait devoir mobiliser une douzaine d’experts pendant plusieurs mois. Étude de cas éditeur, sans protocole de mesure indépendant. 🔗 Étude de cas
- TranslatePsy-Nano — Tether AI Research publie deux familles de modèles de traduction compacts, EuroNano pour neuf langues européennes et AfriNano pour huit langues africaines, en variantes de 42, 31 et 17 Mo avec un seul point de contrôle par groupe linguistique. 🔗 Annonce
- Puffin-World — un modèle multimodal unifié qui représente le monde par trois états natifs, physique, géométrie et apparence, publié avec le jeu de données Puffin-16M. 🔗 Présentation
- Les experts d’un MoE résidant sur NVMe — i64 Systems laisse les poids des experts sur NVMe avec vérification par manifeste SHA-256, et mesure des sorties identiques octet pour octet entre le chemin loué et le chemin résident. 🔗 Billet technique
- Sakana AI à la CiNet International Conference — Llion Jones, directeur technique, et le chercheur Kai Arulkumaran donneront une conférence sur les ponts entre neurosciences et apprentissage automatique du 5 au 7 octobre 2026 à Osaka. 🔗 Annonce
- Gemini CLI, nightly du 2 septembre — un seul changement, l’amélioration de la validation de destination et du routage de connexion dans les utilitaires de récupération web, dans la continuité des durcissements réseau entamés fin août. 🔗 Notes de version
- MrBeast noue un partenariat pluriannuel avec Google — l’accord étend au-delà de YouTube la relation avec Beast Industries, vers Gemini et Google Health, avec une première vidéo le 5 septembre où Gemini sert à survivre en jungle, désert et Arctique. 🔗 Annonce
- Récapitulatif des annonces IA de Google en août — billet mensuel agrégeant des éléments déjà traités au fil du mois, sans nouveauté propre. 🔗 Récapitulatif
- Enterprise Live Migrations en disponibilité générale — migration de dépôts de GitHub Enterprise Server vers le cloud avec résidence des données en interruption quasi nulle, pilotée par l’extension
gh elm. Sans lien avec l’IA, signalé pour l’exhaustivité. 🔗 Changelog - ElevenLabs nomme Ashley Kramer directrice des revenus — seule publication de l’entreprise sur la période, son changelog produit n’ayant pas bougé depuis le 24 août. 🔗 Annonce
- NVIDIA diffuse un live DGX Spark sur le Portable Computer de Perplexity — vingt-six minutes consacrées à son exécution locale, sans texte descriptif ni transcription. C’est la seconde démonstration du jour à faire de la DGX Spark une cible de portage local. 🔗 Diffusion
- Kling AI documente les Elements de son serveur MCP — tutoriel sur la conservation de l’identité d’un personnage entre les plans ; pédagogie produit et non lancement. 🔗 Tutoriel
- Codex CLI 0.152.1 — publication de correction sortie une vingtaine d’heures après la 0.152.0 : la revue d’approbation Guardian respecte désormais les politiques du REPL Node transmises par les métadonnées du modèle. 🔗 Notes de version
- Cohere défend le pari des petits modèles en entreprise — l’éditeur rassemble Command R7B, Tiny Aya à 3,35 milliards de paramètres et North Mini Code, crédité de 33,4 sur le Coding Index d’Artificial Analysis, pour défendre le bon dimensionnement. Aucun lancement. 🔗 Billet
- Perplexity publie deux guides pédagogiques — sur les assistants personnels et sur la détection des hallucinations. Le second décrit un post-entraînement en deux étapes, la première développant les comportements produit, la seconde s’appuyant sur des tâches de recherche plus difficiles. 🔗 Guide
Ce que ça signifie
Le prix est devenu l’argument principal, y compris chez les modèles de frontière. Trois lancements le même jour, et aucun ne met en avant un score record. Google conserve le tarif de la génération précédente pour Gemini 3.8 Flash et assume que son modèle consomme davantage de tokens — un aveu rare, qui déplace la question du prix affiché vers le coût réel d’une tâche. Qwen revendique explicitement le sommet de la frontière de Pareto d’Arena plutôt que la première place brute. Meta chiffre son gain non en points de benchmark mais en 20 % d’appels d’outils et 25 % de tokens en moins. Et le tableau CursorBench donne la mesure la plus parlante de la journée : à 69,2 %, Gemini 3.8 Flash coûte 2,38 dollars par tâche là où un score équivalent en demandait 4,80 chez Fable 5.1 et 7,35 chez Opus 5. La colonne des étapes rappelle toutefois que ce prix se paie ailleurs — 161 étapes contre 44.
L’ingénierie du harnais devient un levier économique mesurable. L’article de GitHub est le document le plus utile de la journée pour quiconque construit sur ces modèles : quatre optimisations qui ne touchent pas au modèle et qui grignotent 2 à 5 % chacune, avec les expériences ratées documentées. Le guide d’ingénierie d’Anthropic dit la même chose depuis l’autre bout — 90 à 99 % de succès de cache à viser dès la conception, coût par tâche accomplie plutôt que par appel. Les deux convergent sur un point que la course aux modèles masque : à modèle constant, le harnais détermine une part significative de la facture, et les gains ne se transportent pas d’un produit à l’autre. GitHub le démontre en ayant vu une optimisation efficace sur code review augmenter le coût sur le CLI.
L’inférence descend sur le poste de travail, et l’endroit du calcul devient un paramètre de conception. FastH3 fait tenir la génération vidéo sur un Mac ou une machine de bureau, Perplexity ouvre le code d’un moteur qui ne fait tourner qu’un seul modèle sur un seul type de matériel, Tether publie des traducteurs de 17 Mo, i64 Systems fait vivre des experts de MoE sur NVMe, et Cohere plaide pour le bon dimensionnement. Ce mouvement rejoint par le haut celui d’Equinix, NVIDIA et Together AI, qui distribuent l’inférence dans 280 centres de données pour des raisons de latence et de souveraineté. Le fil commun n’est pas la miniaturisation mais la spécialisation : Lily gagne parce qu’il refuse tout ce qui n’est pas Qwen3.6-35B-A3B sur Apple Silicon, et le pari de Perplexity est que cette étroitesse est un avantage, pas une limite.
Le contrôle et la gouvernance se durcissent, et ils passent désormais par le contrat autant que par la technique. GitHub impose la rétention des données pour Fable 5.1 — avec une exemption qui expire à la fin de l’année civile — tout en ouvrant le choix du modèle par défaut à chaque équipe d’entreprise, et retire six modèles du catalogue le même jour. Cursor déplace l’exécution des agents dans le réseau du client, tout en précisant que les transcriptions restent traitées chez lui. Google réserve son modèle de cyberdéfense à 650 partenaires sélectionnés, sous conditions opérationnelles écrites. Mistral sert un modèle chinois depuis l’Europe, et en fait son argument. Enfin, BenchMIRT rappelle que l’outillage d’évaluation sur lequel repose une partie de ces décisions mérite lui-même un audit : un benchmark de biais social qui corrèle à 0,85 avec le raisonnement général et à -0,06 avec la sécurité ne mesure pas ce que son étiquette annonce.
Sources
- Gemini 3.8 Flash et 3.8 Flash Cyber
- Résultats CursorBench
- Gemini 3.8 Flash dans Cursor
- Introducing Muse Spark 1.3
- Feuille de route Muse Spark
- Qwen3.8-Max-0902
- Résultats Code Arena WebDev
- FastH3 en local sur DGX Spark et Apple Silicon
- Code source de Lily
- Ouverture du code de Lily
- Claude Commerce Agents
- Dépôt commerce-agents
- Le guide d’ingénierie des agents de commerce
- Computer use en arrière-plan
- Cursor Self-Hosted Machines
- Claude Fable 5.1 dans GitHub Copilot
- Genspark intègre Fable 5.1
- How we make AI coding more cost-efficient
- Modèles Copilot dépréciés
- Modèle par défaut dans les réglages gérés en entreprise
- August 2026 Ship Log
- Médias dans GitHub CLI
- Fairwind Program
- Gemini CLI v0.58.0
- Changelog Antigravity
- Short Video Overviews en 70 langues
- Zed v1.18.0
- GLM 5.2 dans Vibe Code
- Co-design et speculative decoding
- The modern CUDA toolbox in practice
- Open Secure AI Alliance
- Equinix Inference Exchange
- BenchMIRT
- Runway Dev MCP
- DreamX-Creator 1.0
- Changelog de l’API OpenAI
- Claude Code CHANGELOG
- Claude Campus Ambassadors
- Nokia et Cursor
- TranslatePsy-Nano
- Puffin-World
- Les experts d’un MoE sur NVMe
- Sakana AI à la CiNet International Conference
- Gemini CLI, nightly du 2 septembre
- MrBeast, Gemini et Google Health
- Annonces IA de Google en août 2026
- Enterprise Live Migrations
- ElevenLabs nomme Ashley Kramer
- Live DGX Spark et Perplexity Portable Computer
- Les Elements de Kling MCP
- Codex CLI 0.152.1
- Cohere et les petits modèles
- Guides pédagogiques de Perplexity