Google Cloud a présenté le 8 octobre, à Gemini at Work 2026, l’agent Gemini : un seul agent pour tout le travail en entreprise, qui tourne en continu dans le cloud et orchestre aussi bien les modèles Gemini que les modèles Claude. HeyGen sort de son côté HeyGen Voice, son premier modèle vocal maison, qui prend la tête du classement Controlled Voice d’Artificial Analysis, tandis qu’Anthropic ouvre dans Claude Managed Agents des workflows capables de lancer jusqu’à 1 000 agents par exécution. Côté code, Codex apprend à prédire le prochain message de l’utilisateur et adopte sous Windows un nouveau bac à sable fondé sur les Microsoft Execution Containers.
Google Cloud lance l’agent Gemini, un seul agent pour tout le travail
8 octobre — À Gemini at Work 2026, Google Cloud a présenté l’agent Gemini, qu’il décrit comme un agent unique et universel pour le travail. Depuis une seule zone de saisie et une seule API, il répond aux questions, prend en charge le travail intellectuel, crée images et médias, écrit et exécute du code. L’idée défendue par Thomas Kurian, PDG de Google Cloud : on lui confie un objectif plutôt qu’une suite d’instructions.
L’agent tourne en continu dans le cloud, avec une seule mémoire, et se retrouve partout : web, iOS, Android, Windows, Mac, ligne de commande, Google Workspace, Microsoft 365 et Slack, ou sans interface (headless) dans des applications tierces. Une tâche de plusieurs heures ou de plusieurs jours continue ordinateur fermé. Pour les longs travaux, il crée des sous-agents temporaires dotés chacun d’une identité, et il peut devenir un agent collègue (coworker agent) au rôle permanent, avec sa propre adresse @agents.company.com et son stockage. Le modèle devient un choix séparé : selon Google, l’agent orchestre déjà les modèles Gemini et les modèles Claude d’Anthropic, d’autres modèles privés et ouverts devant suivre. Des déclinaisons sectorielles arrivent en préversion pour la finance (plus de 50 skills de base, déjà utilisées par CME Group et Deutsche Bank) et le juridique.
| Brique de contrôle annoncée | Rôle décrit par Google |
|---|---|
| Identité de chaque agent | Identité attestée cryptographiquement, permissions par rôle, journal d’audit à son nom |
| Agent Sandbox | Exécution isolée, avec sa propre frontière réseau |
| Agent Gateway | Pare-feu réseau pour l’IA, par lequel passe tout le trafic de l’agent |
| Plafonds de dépense en temps réel | Dans Cloud Billing, l’agent du projet se met en pause, reprise en un clic |
Google Cloud avance aussi ses chiffres : près de 500 clients ont chacun traité plus de 1 000 milliards de tokens en un an, et près de 90 % du Fortune 100 utilise Gemini Enterprise. Le billet ne donne en revanche ni date de disponibilité ni tarif pour l’agent lui-même ; Google Cloud cite seulement de grands clients qui l’ont testé en avant-première, comme la marque de sport On pour le choix dynamique du modèle.
🔗 Gemini at Work 2026 (blog Google Cloud)
Gemini Enterprise ouvre Claude Opus 5.5 et Claude Sonnet 5.5 aux outils Antigravity
8 octobre — Le même jour, les notes de version de Gemini Enterprise permettent aux administrateurs d’activer Claude Opus 5.5 et Claude Sonnet 5.5 dans Antigravity 2.0, l’Antigravity CLI et les extensions Antigravity pour IDE. L’administrateur accepte leurs conditions d’utilisation directement dans la console Google Cloud, sans compte Anthropic séparé.
| Paramètre d’activation | Valeur indiquée par Google |
|---|---|
| État par défaut | Modèles tiers désactivés, activation par les administrateurs |
| Mode de facturation | À la consommation, dans le plafond de dépense du projet |
| Emplacements d’inférence | global, us et eu |
| Niveaux de réflexion | Low, Medium (par défaut), High ou Max |
Le développeur garde sa licence Gemini Enterprise et choisit Claude dans le sélecteur de modèles. Les dépassements (overages) doivent être activés avant d’ouvrir un modèle tiers, dont le coût entre dans le plafond commun à tous les modèles. La même page annonce Gemini 3.8 Flash en disponibilité générale à Singapour.
🔗 Notes de version de Gemini Enterprise
Voix : HeyGen Voice en tête du classement Controlled Voice, Mistral publie deux modèles pour l’arabe
9 octobre — HeyGen lance HeyGen Voice, que Joshua Xu présente comme le premier modèle vocal développé en interne par l’entreprise, connue jusqu’ici pour ses avatars. Le modèle est disponible dans HeyGen et par l’API, à 30 dollars par million de caractères ; jusqu’au 31 octobre, les utilisateurs de l’API paient 15 dollars, la remise étant appliquée automatiquement.
L’argument vient d’Artificial Analysis, qui a publié ses résultats une minute et demie avant HeyGen. Sur son classement Controlled Voice, où tous les modèles parlent avec les 8 mêmes voix clonées, en anglais américain et britannique, HeyGen Voice prend la première place avec un Elo de 1 201 sur 1 468 apparitions. Il y est premier dans les catégories Assistants et Service client, ainsi qu’en anglais britannique.
HeyGen Voice takes the #1 spot on the Artificial Analysis Controlled Voice TTS Arena Leaderboard, ahead of Alibaba’s Qwen-Audio-3.1-TTS-Plus and ElevenLabs’ Eleven v4 Turbo
🇫🇷 HeyGen Voice prend la première place du classement Controlled Voice TTS Arena d’Artificial Analysis, devant Qwen-Audio-3.1-TTS-Plus d’Alibaba et Eleven v4 Turbo d’ElevenLabs. — @ArtificialAnlys sur X
| Modèle évalué | Elo Controlled Voice (9 octobre) | Prix API par million de caractères |
|---|---|---|
| HeyGen Voice | 1 201 | 30 dollars (15 jusqu’au 31 octobre) |
| Qwen-Audio-3.1-TTS-Plus | 1 182 | 19,3 dollars |
| Eleven v4 Turbo | 1 166 | 40 dollars |
| Eleven v4 | 1 162 | 80 dollars |
Ce premier rang a un périmètre précis : il porte sur le clonage de voix. Sur le classement Provider Voice, où chaque fournisseur utilise ses propres voix, Eleven v4 Turbo et Eleven v4 restaient en tête le 9 octobre au soir, sans HeyGen Voice parmi les huit premiers. En robustesse de prononciation, HeyGen Voice obtient 83,1 %, soit la 10e place sur 29.
Côté API, le clonage est instantané : un seul enregistrement, dont seules les trois premières minutes servent, donne une voix active en quelques secondes, sans entraînement. La synthèse se fait d’un bloc (fichier WAV à 44,1 kHz) ou en flux, et ce sont les réglages par défaut de l’API qu’Artificial Analysis a évalués.
Voxtral Mini 4B Realtime Arabic et LIDstral Arabic : deux modèles de Mistral pour l’arabe
8 octobre — Mistral a mis en ligne sur Hugging Face, sans annonce, deux modèles ouverts sous licence Apache 2.0 consacrés à l’arabe. Voxtral Mini 4B Realtime Arabic transcrit en flux les dialectes arabes et l’arabe standard moderne, y compris quand les locuteurs changent de langue en pleine conversation (code-switching). Affiné à partir de Voxtral Mini 4B Realtime, il compte environ 4,4 milliards de paramètres. Selon sa fiche, il a été codéveloppé avec le ministère marocain de la Transition numérique et de la Réforme administrative, dans le cadre du partenariat signé entre Mistral et le Maroc en janvier 2026, qui a aussi produit deux nouveaux benchmarks, ISMA et Darija in the Wild.
| Modèle publié | Fonction du modèle | Résultat selon la fiche |
|---|---|---|
| Voxtral Mini 4B Realtime Arabic | Transcription en flux de l’arabe | Taux d’erreur par caractère moyen de 8,82 % sur 7 benchmarks à 480 ms, contre 7,91 % pour Voxtral Transcribe Arabic |
| LIDstral Arabic | Identification de la langue et du dialecte, 51 classes, sur processeur | F1 de 88,67 % sur la darija marocaine, contre 71,28 % pour GlotLID v3 |
🔗 Voxtral Mini 4B Realtime Arabic sur Hugging Face · LIDstral Arabic sur Hugging Face
Claude Managed Agents : des workflows dynamiques jusqu’à 1 000 agents par exécution
9 octobre — Anthropic ouvre en bêta publique les workflows dynamiques (dynamic workflows) de Claude Managed Agents, un nouveau type d’orchestration multiagent. L’agent qui mène la session écrit lui-même un programme, que le serveur exécute en arrière-plan en lançant de nombreux agents par phases, avant de combiner leurs résultats. Une fois le type multiagent_20261001 activé, c’est l’agent qui décide de lancer une exécution.
Une exécution lance jusqu’à 1 000 agents, dont 64 en même temps, vit 24 heures par défaut, et une session peut en garder 10 ouvertes. Ses tokens sont facturés comme ceux de la session et comptent dans son budget ; Anthropic prévient qu’ils peuvent être nombreux, et cite un test interne sur 70 bugs plantés dans une base de code de 116 000 lignes.
| Configuration du test d’Anthropic | Bugs trouvés sur 3 essais |
|---|---|
| Agent seul | 14, 15 et 27 |
| Workflow dynamique | 66 à chaque essai |
🔗 Annonce de @ClaudeDevs · Documentation des exécutions de workflow
Agents de code : prédictions de messages et bac à sable MXC pour Codex, Claude Code 2.1.296, Vibe CLI 2.26.1
Codex reçoit deux nouveautés le même jour, tandis qu’Anthropic et Mistral publient de nouvelles versions de leurs agents en ligne de commande.
Codex prédit le prochain message de l’utilisateur, en bêta pour les abonnés Pro
9 octobre — OpenAI ouvre en bêta les prédictions du compositeur (composer predictions) dans l’application de bureau Codex. Quand Codex a fini de répondre, une suggestion de message suivant peut s’afficher dans la zone de saisie, construite à partir du fil en cours, sans aller chercher dans les mémoires ni dans les applications connectées. La touche Tab l’insère ; le texte reste modifiable et n’est jamais envoyé automatiquement. La suggestion porte sur un message complet, pas sur une complétion mot à mot.
| Condition de la bêta | Valeur indiquée par OpenAI |
|---|---|
| Forfait et âge | ChatGPT Pro personnel, 18 ans et plus |
| Fils et modèles | Fils locaux et SSH, avec GPT-6 Astra ou GPT-6.1 Sol |
| Réglage par défaut | Activé, désactivable dans General > Composer > Show predictions |
| Coût pendant la bêta | Hors limites d’usage de Codex, sans crédits consommés |
Les messages envoyés, prédictions acceptées comprises, restent décomptés normalement. La fonction n’existe pas dans Chat.
🔗 Annonce de @OpenAIDevs · Article d’aide d’OpenAI
Codex sous Windows : un bac à sable fondé sur les Microsoft Execution Containers
9 octobre — OpenAI ajoute à Codex sous Windows un mode de bac à sable fondé sur les Microsoft Execution Containers (MXC), que Microsoft a passés en disponibilité générale le 7 octobre. Il exige un appareil Windows 11 compatible (24H2 build 26100.9278 ou 25H2 build 26200.9278) et promet une mise en place plus rapide, un contrôle réseau plus strict et des accès aux fichiers plus finement réglés.
Selon la documentation, MXC devient l’implémentation recommandée : il isole nativement les processus, sans configuration approuvée par un administrateur, sans comptes Windows supplémentaires ni règles de pare-feu locales. Les modes elevated et unelevated deviennent des replis hérités. L’application de bureau choisit MXC d’elle-même pour les comptes grand public ; en CLI ou en entreprise, il s’active avec prefer_mxc = true dans config.toml, et un administrateur peut le bloquer avec allow_mxc = false. Deux limites sont documentées : le réseau géré exige allow_local_binding = true, et les processus enfants restants s’arrêtent à la fin de la commande au premier plan.
🔗 Annonce de @OpenAIDevs · Documentation du bac à sable Windows
Claude Code 2.1.296 : compaction propre aux sous-agents et modèle unique pour les agents de workflow
9 octobre — Claude Code 2.1.296 compte 79 entrées, dont 56 correctifs, et n’a été accompagnée d’aucun tweet. Elle donne surtout plus de contrôle sur les sous-agents.
| Nouveauté de la version | Ce qu’elle change |
|---|---|
autoCompactWindow (sous-agents, --agents) | Un sous-agent compacte son contexte plus tôt que la conversation principale |
CLAUDE_CODE_WORKFLOW_SUBAGENT_MODEL | Tous les agents d’un workflow sur un même modèle, les autres sous-agents gardent le leur |
Option allow_large de Read | Lecture d’un gros fichier texte en un seul appel, si le contexte le permet |
CLAUDE_CODE_OVERLOADED_RETRY_MAX_DELAY_MS | Délai maximal plus long entre deux relances après une erreur 529 |
| Descriptions d’outils MCP envoyées d’emblée | Limite par défaut portée de 2 048 à 4 096 caractères |
/cost et la ligne d’état comptent désormais les lectures de cache de Sonnet 5.5 à 0,10 dollar par million de tokens. Côté sécurité, la version corrige des hooks PreToolUse gérés qui refusaient un appel sans mettre fin au tour, des vérifications Bash qui approuvaient automatiquement certaines commandes utilisant BASH_ARGV0, des sessions cloud qui sautaient les vérifications du mode auto sur des actions Claude in Chrome, et des modifications Edit et NotebookEdit qui remplaçaient tous les caractères non ASCII des fichiers non UTF-8, désormais refusées.
🔗 Claude Code 2.1.296 sur GitHub
Vibe CLI 2.26.1 : le modèle Devstral local retiré, un mode non interactif plus complet
9 octobre — Trois jours après la 2.26.0 et sans tweet, Mistral publie Vibe CLI 2.26.1. Malgré son numéro de correctif, la version compte 85 entrées (23 ajouts, 24 changements, 36 correctifs, 2 retraits), dont 37 pour la nouvelle interface en Rust. Elle retire le modèle Devstral local qui était embarqué : une configuration qui l’épingle encore repasse, avec un avertissement, sur le modèle hébergé par défaut. Celui-ci ne propose plus que deux niveaux de réflexion, off et high, et déclare une fenêtre de contexte de 256k, sur laquelle se cale la compaction automatique.
Le mode non interactif vibe -p gagne une limite de temps, la lecture de l’invite depuis un fichier ou l’entrée standard, un rapport export.json écrit à chaque sortie et des codes de sortie distincts : 1 pour une erreur d’usage ou de configuration, 2 pour une panne d’infrastructure, 3 pour une limite atteinte ou un refus du modèle. La Rust CLI ajoute /proxy-setup, un narrateur qui lit à voix haute le résumé de chaque tour, /plugins et /whoami. De nouveaux réglages interdisent à l’agent les processus d’arrière-plan ou les sous-agents, et le connecteur Document Library reste désactivé par défaut.
🔗 Notes de version de Vibe CLI 2.26.1
Images, vidéos et jeux génératifs : Qwen-Image-2.1-Turbo, mode Thinking de Midjourney, Syren de Synthesia, Playground de Google
Un modèle d’image plus rapide et moins cher, un générateur qui se relit, un agent qui monte des vidéos et une plateforme de jeux sans code.
Qwen-Image-2.1-Turbo : 8 étapes de débruitage et 0,016 dollar l’image
9 octobre — Qwen publie Qwen-Image-2.1-Turbo, un point de contrôle accéléré (accelerated checkpoint) de Qwen-Image-2.1 qui génère et retouche des images en 8 étapes de débruitage, sur la même architecture de 7 milliards de paramètres. Selon Qwen, il produit toujours des images 2K et accepte des retouches en langage naturel, mais aucun chiffre de qualité ni de vitesse propre à cette version n’est publié. Les poids sont sur Hugging Face et ModelScope, sous la licence de recherche de Qwen (Qwen Research License). Le point de contrôle embarque son calendrier d’échantillonnage en 8 étapes et tourne par défaut avec un CFG de 1.
Le même jour, Qwen ouvre officiellement les API Qwen-Image-2.1 Pro et Turbo ; QwenCloud accorde 120 requêtes par minute à Turbo.
| Modèle servi en API (Model Studio) | Prix par image | Images gratuites |
|---|---|---|
| qwen-image-2.1-turbo | 0,016 dollar | 10 |
| qwen-image-2.1-pro | 0,04 dollar | 10 |
| qwen-image-2.0-pro | 0,075 dollar | 100 |
🔗 Annonce de Qwen · Fiche Hugging Face
Midjourney teste un mode Thinking et ouvre les dossiers partagés sur son site alpha
8 octobre — Le changelog alpha de Midjourney, publié le soir, présente deux fonctions en version précoce, réservées pour l’instant au site alpha.midjourney.com. La première est un test : sur une image produite avec V8.2, en génération ou en édition, le bouton Rerun (Thinking) demande au modèle de regarder le résultat, de repérer où il s’écarte du prompt (objets, mise en page, anatomie, texte) et de générer à nouveau. Midjourney dit constater de meilleurs résultats en fidélité au prompt, en typographie et en cohérence, et envisage d’en faire un mode général.
La seconde est le partage de dossiers : on invite des Collaborateurs, qui génèrent directement dans le dossier, ou des Lecteurs, et l’on peut partager par lien, voire ouvrir le dossier à tout membre de Midjourney. Midjourney précise que le partage ne change pas la visibilité des images : sans le mode stealth, elles peuvent toujours apparaître sur Explore et sur les profils.
🔗 Changelog alpha de Midjourney · Test du mode Thinking (Midjourney)
Syren : Synthesia confie la création vidéo à un agent, en bêta
9 octobre — Synthesia lance Syren en bêta pour tous ses clients, comptes gratuits compris. On décrit la vidéo voulue, ou l’on fournit documents, images, vidéos, présentations PowerPoint ou liens YouTube, et Syren livre une vidéo finie avec animations graphiques (motion graphics), avatars, voix off, musique et plans de coupe (b-roll), que l’on corrige ensuite en conversation. Selon Peter Hill, directeur technique de Synthesia, l’agent écrit toute la vidéo sous forme de code, qu’un moteur de rendu maison, utilisé pour les animations de Synthesia depuis juin, joue en direct.
Les vidéos durent jusqu’à 3 minutes, en format horizontal ou vertical, et se rendent dans le navigateur. La facturation se fait au crédit, sans tarif détaillé, et les administrateurs Enterprise peuvent désactiver l’outil. L’apprentissage automatique de l’identité de marque à partir des vidéos existantes est annoncé pour bientôt dans le billet. Syren arrive quatre jours après HyperFrames Studio de HeyGen et au lendemain de Claude Motion d’Anthropic, deux autres outils où un agent produit la vidéo.
🔗 Présentation de Syren (Synthesia)
Playground : Google ouvre une plateforme pour créer des jeux sans coder
7 octobre — Google lance Playground, une plateforme de jeu expérimentale où l’on crée, joue et partage des jeux en les décrivant par quelques prompts, sans écrire de code. Dans une interface conversationnelle, on part d’une page blanche, d’un exemple à remixer ou d’un accompagnement guidé, puis on ajuste à la demande la physique, les règles, les personnages ou le décor.
Les jeux tournent dans le navigateur, sur téléphone comme sur ordinateur, et peuvent rester privés, se partager par lien ou rejoindre la galerie Explore, avec classements et multijoueur pour certains genres ; chaque jeu publié passe un contrôle de sécurité. Playground est ouvert aux États-Unis aux 18 ans et plus, avec des droits de création qui dépendent de l’abonnement Google AI. Une intégration avec Unity Spark, pour des jeux 3D plus ambitieux, est annoncée en bêta fermée pour bientôt. Google ne précise pas quel modèle fait tourner la plateforme.
🔗 Présentation de Playground (blog Google)
Santé : l’étude clinique d’AMIE publiée dans The Lancet
8 octobre — Google et le Beth Israel Deaconess Medical Center (BIDMC) publient dans The Lancet une étude prospective de faisabilité d’AMIE (Articulate Medical Intelligence Explorer), l’IA conversationnelle de diagnostic de Google ; selon Google, c’est sa première publication dans la revue principale du Lancet. Des patients ont échangé avec AMIE jusqu’à cinq jours avant une consultation urgente, et le médecin recevait ensuite la transcription et un résumé.
| Mesure de l’étude | Résultat publié |
|---|---|
| Patients inclus (avril à novembre 2025), puis suivis | 114, puis 98 |
| Arrêts pour raison de sécurité | 0 |
| Hallucinations relevées | 1 |
| AMIE utile pour préparer la visite, selon le médecin | 33 cas sur 44 (75 %) |
| Diagnostics conformes au diagnostic final (Google) | 90 % |
Étude sur un seul site, sans groupe témoin et financée par Alphabet, ce n’est ni une autorisation ni un déploiement : les auteurs réclament des essais plus larges.
🔗 Billet de Google · L’article dans The Lancet
Recherche chez OpenAI : la réponse à la lettre de trois chercheurs dont l’entreprise s’est séparée
9 octobre — Dans une note publiée sur @OpenAINewsroom au nom de ses responsables de la recherche, OpenAI répond à la lettre de trois chercheurs dont elle dit s’être séparée la semaine précédente. Selon OpenAI, une enquête interne a conclu qu’ils avaient enfreint des règles claires sur le traitement d’informations sensibles, avec une rupture de confiance allant au-delà de ce qu’expose leur lettre ; OpenAI maintient sa décision. Elle affirme que ces décisions ne tiennent ni au fait d’avoir soulevé des préoccupations de sécurité ni à une prise de parole, et qu’elle ne licencie aucun salarié pour avoir exprimé des inquiétudes.
La note annonce aussi :
We are actively finalizing contracts with third-party safety assessors and will announce details in the coming weeks.
🇫🇷 Nous finalisons activement des contrats avec des évaluateurs de sécurité tiers et en annoncerons les détails dans les prochaines semaines. — @OpenAINewsroom sur X
OpenAI se dit d’accord avec la lettre sur un point : préserver la monitorabilité (monitorability) des modèles de frontière exige un engagement de toute l’industrie, OpenAI comprise. Cet article relaie la version d’OpenAI ; la lettre des chercheurs n’a pas été consultée.
Fabriquer des modèles ouverts : six modèles pour environ 103 dollars avec ML Intern, l’ordonnanceur de GPU d’Ai2
Deux retours d’expérience sur la fabrication des modèles : l’un côté agent, l’autre côté grappes de calcul.
ML Intern : six modèles ouverts pour environ 103 dollars de calcul
8 octobre — Déjà présenté ici le 1er et le 8 octobre sous d’autres angles, le mode ML Intern de HuggingChat a droit à un premier bilan chiffré sur le blog de Hugging Face : six projets menés de bout en bout, pour environ 103 dollars de calcul au total. Chacun part d’un message et se termine par un modèle public sur le Hub, évaluation comprise. L’agent planifie, demande l’autorisation avant toute tâche de calcul payante, lance un test court, puis entraîne, évalue et publie sur le matériel de Hugging Face.
| Modèle produit par ML Intern | Résultat publié | Coût de calcul |
|---|---|---|
| Pocket Rewriter (0.8B) | 99,7 % de sorties valides, environ un quart des tokens du réécriveur de 9B de Qwen-Image 2.1 | Environ 16 dollars |
| Citrus Doctor (Qwen3.5-2B) | De 14,9 % à 52,8 % de bons diagnostics de maladies des agrumes | Environ 1,90 dollar |
| Deux LoRA pour Qwen-Image 2.1 | Changement d’angle de vue, gribouillis remplacé par l’objet demandé | Environ 16 et 24,30 dollars |
| Huggy LoRA (FLUX.2 klein) | LoRA de personnage | Environ 7,60 dollars |
| Agate 4 pas | Distillation d’un petit modèle d’image, de 50 pas (100 passes avec le guidage) à 4 | Environ 37 dollars |
L’ordonnanceur de GPU d’Ai2 : l’attente médiane passe de 5 minutes à 24 secondes
9 octobre — Ai2 détaille le nouvel ordonnanceur de ses grappes de GPU, dans un billet signé Jeremy Tryba. Des milliers de GPU NVIDIA H100, B200 et B300, en grappes de 88 à 1 024 GPU, y sont partagés par environ 150 chercheurs, pour une demande deux à trois fois supérieure à l’offre. L’ancien système à priorités laissait des GPU « squattés » par des tâches vides et voyait toutes les charges finir en priorité maximale.
Le nouveau repose sur des budgets de temps GPU répartis le long de l’organigramme de la recherche, un partage équitable hiérarchique (fair-share) calculé sur sept jours glissants et un « contrat d’ordonnancement » : chaque charge déclare une durée protégée de 8 heures au plus, après laquelle elle peut être préemptée et remise en file. Le temps non alloué reste gratuit, mais toujours préemptible.
| Indicateur mesuré par Ai2 | Ancien ordonnanceur | Nouvel ordonnanceur |
|---|---|---|
| Attente médiane, plus grande grappe H100 | 5 minutes | 24 secondes |
| Attente p90 des charges de débogage | 2 heures | 30 secondes |
| Heures GPU dues livrées sur 30 jours | — | 98 % |
Les réparations nécessitant une intervention humaine baissent de 74 %. Ai2 reconnaît des limites, comme des sessions interactives qui deviennent préemptibles après 8 heures, alors qu’elles pouvaient durer une semaine, et ne publie aucun code.
Modèles de décision : pplx-decider-v1.1-27b en tête de Decision Bench, à égalité statistique avec neuf autres
9 octobre — Déjà couvert les 6 et 8 octobre, le modèle de décision de Perplexity obtient un résultat externe. Sur Decision Bench, banc open source d’Atlan Frontier Labs (1 071 questions fermées, 36 jeux de données, 15 modèles classés), pplx-decider-v1.1-27b réalise le meilleur score brut, 94,5 %, au coût le plus bas, 0,017 dollar les 1 000 décisions. Le site donne toutefois le même rang aux modèles dont les intervalles de confiance à 95 % se recouvrent : dix modèles partagent la première place.
| Modèle évalué sur Decision Bench | Précision mesurée | Coût pour 1 000 lignes |
|---|---|---|
| pplx-decider-v1.1-27b | 94,5 % | 0,017 dollar |
| DeepSeek V4.1 Flash | 94,2 % | 0,683 dollar |
| Gemini 3.5 Flash | 94,2 % | 3,32 dollars |
| Jev 1.13 | 93,8 % | 0,044 dollar |
Perplexity publie aussi un guide pratique (cookbook) d’agent de navigation, où le code, jamais le modèle, décide des clics, et la v1.1 remplace la v1 dans l’API.
🔗 Fil de @perplexitydevs · Classement Decision Bench
Grok Bot reçoit sa propre adresse e-mail
9 octobre — Grok Bot, l’agent de SpaceXAI, dispose désormais de sa propre adresse e-mail. Le Bot peut s’en servir pour s’inscrire à des services, contacter des entreprises au nom de l’utilisateur ou fixer un rendez-vous avec quelqu’un. La fonction est déployée le jour même : il suffit de demander une adresse au Bot ou de mentionner @bot sur X, et dans une équipe, un administrateur doit d’abord l’activer.
L’annonce tient en un fil du compte @bot, relayé par @grok, sans billet sur x.ai. Elle ne précise ni le format ni le domaine des adresses, ni les formules concernées. Après l’identifiant Slack propre aux Team Bots fin septembre, l’agent gagne ainsi une identité à lui pour agir à l’extérieur.
ElevenLabs s’installe à Singapour, son hub pour l’Asie du Sud-Est
8 octobre — ElevenLabs officialise son arrivée à Singapour, où l’entreprise ouvre un bureau destiné à servir de hub pour l’Asie du Sud-Est et, plus largement, pour l’Asie-Pacifique. Le billet met en avant l’infrastructure déjà en place : depuis juillet, les entreprises peuvent héberger leurs données à Singapour, avec des options sans conservation et une latence réduite dans la région.
ElevenLabs cite surtout ses clients régionaux : Funding Societies, qui qualifie ses prospects par IA conversationnelle dans cinq marchés, Boost Bank en Malaisie, Salmon Group aux Philippines, MNC Group en Indonésie, ou Rezonate, plateforme de santé utilisée par 60 % des hôpitaux publics de Singapour. Aucun effectif n’est chiffré. L’implantation suit celles de Bruxelles et d’Amsterdam, fin septembre et début octobre.
Brèves
- Projects dans Claude Code — Anthropic a fait entrer tous les abonnés Pro et Max inscrits sur la liste d’attente. Projects reste en bêta : la liste reste ouverte, d’autres accès suivront selon la capacité, et la fonction n’est pas encore proposée sur Team ni Enterprise, selon la documentation. 🔗 source
- Guide des automatisations d’agents — Un guide claude.dev décrit une implémentation de référence sur Claude Managed Agents, qui lit sur planning des canaux Slack et des pull requests GitHub puis publie un résumé dans Slack, et en détaille les six composants avec leurs parades aux pannes courantes, comme ne pas prendre une source illisible pour une journée calme ou fixer le plafond de dépense à 3 à 5 fois le coût d’une exécution normale. 🔗 source
- Block et Claude Fable — Dans un entretien publié par Anthropic, Block explique que Claude Fable conçoit ses grandes migrations de code et dirige jusqu’à des dizaines de modèles Opus ou Sonnet, au point de fusionner jusqu’à un millier de pull requests dans une même migration ; fusions et mises en production restent réservées aux humains, avec double approbation des déploiements. 🔗 source
- La Compliance API de Claude Enterprise — Ses points de terminaison (endpoints) de conversation renvoient aussi, en bêta et avec la clé existante, les conversations de l’expérience Claude unifiée : une conversation poursuivie en session cloud revient comme une seule, avec le travail de Claude en blocs
tool_useettool_result. 🔗 source - Codex CLI 0.162.1 — Ce correctif de la 0.162.0 supprime un plantage du TUI sur les questions asynchrones de plusieurs lignes, et des échecs de démarrage quand un serveur d’arrière-plan déjà lancé n’avait pas les mêmes réglages de fonctionnalités que la CLI. 🔗 source
- Plugins par rôle dans ChatGPT Enterprise et Edu — Quand le contrôle d’accès par rôle (RBAC) est activé, propriétaires et administrateurs règlent l’accès aux plugins rôle par rôle : Available, Install ou Disabled pour l’espace de travail, Default pour qu’un rôle personnalisé hérite de ce réglage. 🔗 source
- Sophos et OpenAI Daybreak — Selon l’éditeur de cybersécurité, ses agents bâtis avec Daybreak ramènent le temps de réponse moyen des dossiers qu’ils traitent d’environ 38 minutes à environ 89 secondes, et 52 % de ses dossiers MDR sont résolus de bout en bout par l’IA ; les actions destructrices restent sous supervision humaine. 🔗 source
- Asana et l’agent de navigation de StackAI — Selon Asana, GPT-6 Astra dans Codex a optimisé cet agent en environ une semaine : sur GPT-6.1 Sol, une exécution de test coûte 0,47 dollar et prend environ quatre minutes, soit 76 fois moins cher et 5 fois plus rapide que la configuration de production d’origine. 🔗 source
- LegalOn et Codex — LegalOn Technologies dit avoir réduit d’environ 65 % ses coûts quotidiens estimés de Codex en passant de GPT-5.5 en mode rapide illimité à une répartition des tâches entre GPT-6 Luna, GPT-6.1 Sol et GPT-6 Astra, avec mode rapide sur demande et plafonds par service et par personne. 🔗 source
- Gemini CLI v0.64.0-preview.1 — Cette preview fait taire les faux positifs de l’avertissement Untrusted Command Flags Detected sur des commandes shell inoffensives : options en lecture seule exemptées, variables shell conservées, boucles autorisées quand chaque sous-commande a sa règle ALLOW. Aucune nightly n’est sortie le 9 octobre, et la stable reste la v0.63.0. 🔗 source
- Antigravity 2.22.0 — Les plugins peuvent afficher leur propre interface dans le panneau latéral (UI Extensions), les conversations se rangent par glisser-déposer d’une section à l’autre de la barre latérale, et les horodatages affichent le nom du mois. 🔗 source
- Gemini 3.7 Flash déprécié — Dans l’API Gemini, les appels à
gemini-3.7-flashsont redirigés versgemini-3.8-flash, et l’ancien agentdeep-research-pro-preview-12-2025sera arrêté le 23 octobre, au profit dedeep-research-preview-04-2026ou dedeep-research-max-preview-04-2026. 🔗 source - Plugins VST3 et AU pour Google Flow Music — Rattrapage du 6 octobre : les Spaces, ces instruments et effets créés en langage naturel, s’exportent en plugins pour les stations audionumériques (Digital Audio Workstations), comme le plugin No Chaser du producteur Khris Riddick-Tynes. 🔗 source
- Google Earth AI et la santé publique — Rattrapage du 6 octobre : pendant l’épidémie d’Ebola en RDC, un prototype d’agent de raisonnement géospatial a permis au bureau Afrique de l’OMS de repérer en quelques minutes 48 localités exposées et plus de 45 500 personnes à risque ; le modèle PDFM repère aussi des zones à risque de choléra jusqu’à 8 semaines à l’avance. 🔗 source
- Facturation de Copilot code review — Les propriétaires d’organisation peuvent imputer à l’organisation propriétaire du dépôt les revues demandées par leurs membres licenciés, au lieu d’entamer leur quota, si l’usage payant des AI Credits est activé, et réserver le déclenchement des revues aux licences fournies par l’organisation ou l’entreprise. 🔗 source
- Copilot CLI 1.0.95 — Passée en stable, elle s’authentifie sur macOS par le broker natif de Microsoft Entra, avec repli sur le navigateur ; la préversion 1.0.96-0 indique dans la chronologie qui a tranché chaque permission : l’utilisateur, Assisted Permissions, une politique ou le repli sans surveillance. 🔗 source
- GitHub MCP Server 2.0 — Rattrapage du 6 octobre : le serveur MCP officiel de GitHub renvoie des sorties typées, décrites par des schémas de sortie (output schemas), pour les agents en Code Mode ou Programmatic Tool Calling ; elles ne sont annoncées qu’aux clients de la spécification MCP 2026-07-28 ou ultérieure. 🔗 source
- Claude Haiku 5.5 dans Genspark — Genspark met le modèle en service dans AI Chat, Code Agent et Claw, en reprenant l’argumentaire d’Anthropic, environ 75 % moins coûteux à faire tourner que Haiku 4.5, sans forfait ni tarif propres. 🔗 source
- Modèle Meta VR pour v0 — Meta publie avec Vercel un modèle v0 fondé sur l’Immersive Web SDK : on décrit une expérience, v0 la code et la prévisualise, un clic la déploie sur Vercel pour l’ouvrir dans le navigateur du Quest ; le regard et les mains des Meta VR Glasses, attendues au printemps 2027, sont déjà pris en charge. 🔗 source
- v0 for teams — v0 présente en vidéo cette façon de voir le travail de ses coéquipiers, de rejoindre leurs conversations et de construire ensemble ; le tweet met en avant des fonctions arrivées par étapes depuis septembre, sans tarif nouveau. 🔗 source
- DeepSeek Harness 0.2.1-alpha.2 — 26e préversion, toujours sans version stable : le catalogue de plugins installe à la demande les paquets Claude Code et Codex, deux plugins expérimentaux apparaissent (Git Worktrees, traduction du raisonnement), et les instructions globales peuvent venir d’un AGENTS.md partagé. 🔗 source
- OGX 1.5.0 — L’ancien Llama Stack, renommé en avril et sorti de l’organisation meta-llama, ajoute un passage natif de l’API /v1/messages pour DeepSeek et Fireworks AI, un fournisseur Text-Embeddings-Inference, la recherche web Exa et Serply et le client MCP 2.x, avec quatre changements cassants. 🔗 source
- GenIA — Meta met en ligne sans annonce, sous licence non commerciale CC BY-NC 4.0, le code de ce travail mené avec le Tübingen AI Center : il reconstruit des objets 3D depuis une image, quelques vues ou une vidéo en alignant au moment de l’inférence l’a priori gelé de SAM 3D Objects, sans réentraînement. 🔗 source
- Étiquette decision-model sur le Hub — Hugging Face donne aux modèles de décision leur propre étiquette, avec une icône et un filtre dans la page Models ; les GGUF de décision sont étiquetés automatiquement à partir de leurs métadonnées llama.cpp. 🔗 source
- Darwin-27B-ZTC-v2 — VIDRAFT annonce que la nouvelle version de son juge, sous Apache-2.0, prend la tête du System One Mosaic Benchmark (137 bancs) avec un score Borda de 89,58, devant OpenJev-27B (87,50) et Jev 1.13 (85,05) ; un classement déclaré par ses auteurs, qui le présentent comme l’instantané d’un tableau public. 🔗 source
- La confiance des modèles de décision — Stephen Solka montre dans un billet communautaire que GPT-6 Luna Decisions, interrogé via OpenRouter, répond « ne correspond pas » à 600 vérifications SHA-256, pour 50 % d’exactitude et 99,8 % de confiance moyenne ; en raisonnement causal, un seuil à 99 % isole 47 bonnes réponses sur 49, mais ne couvre que 8,2 % des cas. 🔗 source
- openai-math en environnements d’apprentissage par renforcement — FineEnvs porte en environnements Harbor 369 des 405 résultats formalisés en Lean de la publication openai/math : l’agent doit prouver un théorème dans un bac à sable Lean 4, et Comparator n’accorde la récompense qu’à une preuve complète de l’énoncé exact ; jeu expérimental sous Apache-2.0. 🔗 source
- JOSIE-2 — Gökdeniz Gülmez publie le rapport technique de cette famille de 2B, 4B et 9B post-entraînée depuis Qwen3.5 sur deux Mac M4, avec environ 3 000 exemples retenus : en mode raisonnement, JOSIE-2-4B atteint 95,5 sur ARC-Challenge (+12,1) et 69,2 sur TruthfulQA (+20,3), sur deux bancs seulement. 🔗 source
- Gradio 6.30 —
gr.Workflowgagne une vue application, et la commande Run this node réutilise les résultats amont encore à jour au lieu de réexécuter tout le sous-graphe ;gr.ImageEditorconserve le canal alpha des images chargées. 🔗 source - tokenizers 0.23.3 — Ce correctif du seul paquet Python accepte
huggingface_hubv2, ce qui débloque l’installation de Transformers selon les notes, et annule un changement cassant de la 0.23.1 sur la troncature. 🔗 source - Relecture scientifique par l’IA — Sakana AI présente un article accepté à TMLR : un banc insère dans des articles des affirmations contradictoires pour vérifier si les relecteurs IA les repèrent, et son système Multi-Layered Review en détecte davantage que les autres systèmes testés, selon l’annonce de Sakana AI, qui ne donne aucun chiffre. 🔗 source
- Suno Studio — Les clips se calent mieux sur le premier temps et s’étirent pour suivre le tempo du projet, les fondus deviennent exponentiels ou logarithmiques, et le synthétiseur, le clavier et les vues de plugins se détachent jusque sur un second écran ; Studio est inclus dans l’abonnement Premier. 🔗 source
- World Models’ Last Exam in Physics — Sur cet examen de physique d’Einsia pour modèles vidéo (40 tâches, 9 catégories, huit modèles), Seedance 2.5 arrive en tête avec 57,76 sur 100, devant MiniMax H3 (54,89), meilleur modèle ouvert selon MiniMax, et Cosmos 3 Super de NVIDIA (42,46) ; un benchmark tiers. 🔗 source
- Simulations Omniverse construites par des agents — Le blog NVIDIA montre des équipes de l’entreprise qui font assembler par GPT-6 Astra, et dans un cas par Claude Fable 5, des simulations avec les bibliothèques ovphysx, ovstage, ovrtx et ovui, dont des jumeaux numériques créés ou améliorés en environ trois jours ; aucun produit nouveau. 🔗 source
- La gestion d’une boutique Shopify — Une fois la boutique connectée, Grok Bot peut vérifier les commandes, suivre les stocks et tenir les fiches produits à jour ; ni formule ni limite ne sont précisées. 🔗 source
- La recherche sur X — Rattrapage du 7 octobre : Grok Bot peut chercher, lire et surveiller X pour tous les utilisateurs, sans configurer le connecteur X, par exemple pour suivre les retours sur un produit ou recevoir une synthèse hebdomadaire de son secteur ; fin août, il fallait encore connecter son compte. 🔗 source
- Grokipedia v0.3 — Selon son compte officiel, l’encyclopédie rédigée par Grok a publié en une semaine plus de 4 400 articles demandés par des lecteurs et fait plus de 2 200 modifications par jour, avec 78 sources en moyenne par nouvel article ; une page diffuse désormais ses modifications en direct. 🔗 source
- Le CLI mistral 0.8.0 —
mistral apps deploydéploie aussi les workers de workflows et tous les modules à la fois, y compris en intégration continue avec une simple clé API, etmistral apps devlance une base Postgres locale dans Docker ; en contrepartie, le.envdu répertoire courant n’est plus lu. 🔗 source - Le SDK Python de Mistral 3.2.0 — Les appels de chat et d’agents acceptent les probabilités logarithmiques (logprobs), sur la réponse comme sur l’invite, ainsi que
top_k, une pénalité de répétition et un nombre minimal de tokens ; version générée automatiquement, sans annonce. 🔗 source - Qwen Code v0.25.1-preview.1 — Deuxième préversion de la v0.25.1 en trois jours, avec 16 fonctionnalités et 27 correctifs nouveaux, dont une collaboration multi-agents centrée sur la session et des hooks PreToolUse qui modifient l’entrée d’un outil avec revalidation complète ; la stable n’est pas encore sortie. 🔗 source
- Claude Haiku 5.5 dans l’Agent API de Perplexity — Rattrapage du 7 octobre : l’Agent API accepte
anthropic/claude-haiku-5-5au tarif d’Anthropic, 0,10 dollar par million de tokens en entrée et 0,50 en sortie jusqu’à 100 000 tokens d’entrée, puis 0,50 et 2,50 au-delà. 🔗 source - Inférence partagée ou dédiée — Un guide de Cohere pour Embed et Rerank pose que la forme des requêtes compte plus que leur nombre, et calcule des seuils de rentabilité illustratifs face à une instance dédiée à un GPU NVIDIA A10 : environ 4 requêtes par minute pour des documents longs, 20 pour un catalogue, 29 pour le reclassement (reranking). 🔗 source
- Agent ou MCP — Perplexity publie un guide qui distingue l’agent, qui décide, de MCP, qui le relie aux outils, avec un tableau de choix, l’exemple d’une boutique en ligne et quatre risques avec leurs garde-fous ; selon le guide, Claude, ChatGPT ou Cursor peuvent confier une tâche à Computer via le serveur MCP de Perplexity. 🔗 source
Ce que ça signifie
Un agent en orchestre désormais beaucoup d’autres, et chacun reçoit une identité. L’agent Gemini lance des sous-agents dotés chacun de la leur et peut devenir un agent collègue avec sa propre adresse ; Claude Managed Agents laisse un agent écrire un programme qui en lance jusqu’à 1 000 ; Grok Bot reçoit une adresse e-mail pour agir à l’extérieur, et Block confie à Claude Fable la direction de dizaines de modèles sur une même migration. La question qui monte n’est plus de savoir si l’agent sait faire, mais comment le tenir. Google répond par Agent Gateway, Agent Sandbox, un journal d’audit au nom de chaque agent et des plafonds de dépense en temps réel ; Anthropic par un budget de session qui suspend toutes les exécutions une fois atteint ; OpenAI par un bac à sable Windows plus strict sur le réseau et les fichiers.
Le multi-modèle s’installe chez les plateformes elles-mêmes. Google, qui développe Gemini, fait orchestrer des modèles Claude par son propre agent, sépare explicitement le choix du modèle de celui de l’agent, et ouvre Claude Opus 5.5 et Sonnet 5.5 dans Antigravity, facturés dans le même plafond de dépense que ses modèles. Genspark et l’Agent API de Perplexity ajoutent Claude Haiku 5.5 dans les jours qui suivent son lancement, LegalOn répartit son travail de code entre trois modèles d’OpenAI selon la nature des tâches, et Block construit un sélecteur automatique de modèle.
Le coût unitaire continue de baisser, et chaque annonce le chiffre : 0,016 dollar l’image pour Qwen-Image-2.1-Turbo, 2,5 fois moins que la version Pro ; 15 dollars le million de caractères pour HeyGen Voice jusqu’au 31 octobre, puis 30, moins qu’Eleven v4 Turbo ; 0,017 dollar les 1 000 décisions pour pplx-decider-v1.1-27b ; six modèles publiés sur le Hub pour environ 103 dollars de calcul avec ML Intern. Les premières places demandent en revanche une lecture attentive : HeyGen Voice n’est premier que du classement à voix contrôlées, et pplx-decider partage son rang avec neuf autres modèles dont les intervalles de confiance se recouvrent.
En santé, la prudence reste de mise. L’étude d’AMIE publiée dans The Lancet est une étude de faisabilité, menée sur un seul site, sans groupe témoin et financée par Alphabet : 98 patients, aucune conversation arrêtée pour raison de sécurité, une hallucination relevée. C’est une étape vers des essais plus larges, que les auteurs réclament eux-mêmes, pas une autorisation ni un déploiement auprès des patients.
Sources
- Gemini at Work 2026 (blog Google Cloud)
- Notes de version de Gemini Enterprise
- Annonce de HeyGen Voice (@HeyGen)
- Résultats d’Artificial Analysis (@ArtificialAnlys)
- Voxtral Mini 4B Realtime Arabic (Hugging Face)
- LIDstral Arabic (Hugging Face)
- Workflows dynamiques de Claude Managed Agents (@ClaudeDevs)
- Documentation des exécutions de workflow (Claude Platform)
- Prédictions du compositeur dans Codex (@OpenAIDevs)
- Article d’aide sur les prédictions du compositeur (OpenAI)
- Bac à sable MXC pour Codex sous Windows (@OpenAIDevs)
- Documentation du bac à sable Windows (ChatGPT Learn)
- Claude Code 2.1.296 (GitHub)
- Vibe CLI 2.26.1 (GitHub)
- Qwen-Image-2.1-Turbo (@Alibaba_Qwen)
- Qwen-Image-2.1-Turbo (Hugging Face)
- Changelog alpha de Midjourney
- Test du mode Thinking (Midjourney)
- Syren (Synthesia)
- Playground (blog Google)
- Étude clinique d’AMIE (blog Google)
- Étude d’AMIE dans The Lancet
- Note des responsables de la recherche d’OpenAI (@OpenAINewsroom)
- Six modèles avec ML Intern (blog Hugging Face)
- Ordonnanceur de GPU d’Ai2 (blog Ai2)
- pplx-decider-v1.1-27b sur Decision Bench (@perplexitydevs)
- Classement Decision Bench
- Adresse e-mail de Grok Bot (@bot)
- ElevenLabs à Singapour (blog ElevenLabs)
- Projects dans Claude Code (@ClaudeDevs)
- Building effective agent automations (claude.dev)
- Block et Claude Fable (claude.com)
- Notes de version de la Claude Platform
- Codex CLI 0.162.1 (GitHub)
- Notes de version ChatGPT Enterprise et Edu
- Sophos et OpenAI Daybreak (OpenAI)
- Asana et l’agent de navigation de StackAI (OpenAI)
- LegalOn et Codex (OpenAI)
- Gemini CLI v0.64.0-preview.1 (GitHub)
- Changelog d’Antigravity
- Notes de version de l’API Gemini
- Plugins de Google Flow Music (blog Google)
- Google Earth AI et la santé publique (blog Google)
- Facturation de Copilot code review (changelog GitHub)
- Copilot CLI 1.0.95 (GitHub)
- GitHub MCP Server 2.0.0 (GitHub)
- Claude Haiku 5.5 dans Genspark (@genspark_ai)
- Modèle Meta VR pour v0 (Meta)
- v0 for teams (@v0)
- DeepSeek Harness 0.2.1-alpha.2 (GitHub)
- OGX 1.5.0 (GitHub)
- GenIA (GitHub)
- Modèles de décision sur le Hub (changelog Hugging Face)
- Darwin-27B-ZTC-v2 et le System One Mosaic Benchmark (blog Hugging Face)
- La confiance des modèles de décision (blog Hugging Face)
- FineEnvs/openai-math (Hugging Face)
- Rapport technique de JOSIE-2 (blog Hugging Face)
- Gradio 6.30.0 (GitHub)
- tokenizers 0.23.3 (GitHub)
- Relecture scientifique par l’IA (@SakanaAILabs)
- Mise à jour de Suno Studio (@suno)
- World Models’ Last Exam in Physics (Einsia)
- Simulations Omniverse construites par des agents (blog NVIDIA)
- Grok Bot et Shopify (@bot)
- Grok Bot et la recherche sur X (@bot)
- Bilan de Grokipedia v0.3 (@Grokipedia)
- CLI mistral 0.8.0 (GitHub)
- SDK Python de Mistral 3.2.0 (GitHub)
- Qwen Code v0.25.1-preview.1 (GitHub)
- Modèles de l’Agent API (Perplexity)
- Inférence partagée ou dédiée pour Embed et Rerank (blog Cohere)
- Agent ou MCP (blog Perplexity)