Ce 23 septembre, Anthropic dévoile son laboratoire de biologie moléculaire et son premier résultat : ART, un système enzymatique inconnu qu’environ 950 agents Claude ont repéré dans l’ADN de bactériophages. Google lance Gemini 3.8 Flash TTS et Flash-Lite TTS, deux modèles de synthèse vocale qui créent et répliquent des voix, Black Forest Labs publie FLUX 3 Action, un modèle à poids ouverts pour piloter des robots, et Perplexity publie le premier audit de sécurité de SPACE, le bac à sable où tournent ses agents.
Anthropic ouvre un laboratoire de biologie moléculaire, et Claude y découvre ART
23 septembre — Anthropic présente un nouveau groupe de recherche en sciences du vivant, doté de son propre laboratoire de biologie moléculaire, formé au printemps et installé dans la baie de San Francisco. Son premier résultat : des agents Claude ont repéré dans l’ADN de bactériophages, les virus qui infectent les bactéries, un système enzymatique jamais décrit, qu’Anthropic a baptisé ART (array-associated reverse transcriptases, transcriptases inverses associées à un réseau).
Tout est parti d’un prompt : chercher dans une vaste base de séquences d’ADN de nouveaux exemples de transcriptases inverses, ces enzymes qui recopient l’ARN en ADN. Pendant 21 heures, environ 950 agents ont consommé 210 millions de tokens, rassemblé plus de 200 000 transcriptases inverses, isolé 3 500 systèmes candidats inédits et retenu les 20 plus prometteurs, chacun accompagné d’un rapport lisible par un humain. Selon Anthropic, une telle analyse demande à un expert des semaines, voire des mois ; l’intervention humaine s’est limitée au prompt initial et aux expériences de laboratoire.
| Étape de la campagne | Valeur mesurée |
|---|---|
| Durée de la recherche | 21 heures |
| Agents Claude mobilisés | environ 950 |
| Tokens consommés | 210 millions |
| Transcriptases inverses rassemblées | plus de 200 000 |
| Nouveaux systèmes candidats | 3 500 |
| Candidats retenus et analysés | 20 |
ART réunit trois éléments : la transcriptase inverse, un gène partenaire voisin dont la fonction est inconnue, et un long réseau de séquences d’ADN répétées, régulièrement espacées, dont la disposition rappelle un réseau CRISPR. La transcriptase elle-même, trouvée dans un phage géant, était déjà connue ; Claude « semble être le premier », selon Anthropic, à avoir remarqué le réseau non codant et la protéine qui l’accompagnent. Les premières expériences montrent que ce réseau est exprimé sous forme de petits ARN distincts. Anthropic reste prudent : la fonction d’ART n’est pas encore connue et d’autres expériences sont en cours. D’après Anthropic, seule une poignée de systèmes connus partagent ces caractéristiques, et tous sont programmables et capables de couper, copier et coller de l’ADN.
Claude has discovered a previously unknown enzyme system hidden in the DNA of bacteriophages. Beside the enzyme’s gene sits a long array of repeating DNA—a structure that looks somewhat similar to CRISPR.
🇫🇷 Claude a découvert un système enzymatique jusqu’ici inconnu, caché dans l’ADN de bactériophages. À côté du gène de l’enzyme se trouve un long réseau d’ADN répété, une structure qui ressemble un peu à CRISPR. — @AnthropicAI sur X
Le laboratoire se limite aux niveaux de biosécurité BSL-1 et BSL-2 et ne manipule aucun pathogène capable d’infecter l’humain ; tout le travail de paillasse est fait par des scientifiques humains. L’équipe utilise Claude Science et Claude Code, parfois avec un harnais maison qui coordonne de nombreuses sessions en parallèle. Comme une campagne produit des centaines, voire des milliers de rapports, les hypothèses deviennent elles-mêmes un objet d’étude : ce qui distingue celles que les chercheurs jugent dignes d’être testées sert à affiner les instructions données à Claude. Feng Zhang, pionnier de l’édition du génome par CRISPR (MIT et Broad Institute), a relu le pré-print et y voit un exemple enthousiasmant de ce que les agents IA peuvent apporter à la découverte biologique. Anthropic publie ce pré-print et invite les scientifiques à lui soumettre des questions de recherche.
🔗 Claude discovers a novel enzyme system with CRISPR-like repeats · Pré-print (PDF)
Gemini 3.8 Flash TTS et Flash-Lite TTS : Google crée et réplique des voix
23 septembre — Google ajoute à la famille Gemini deux modèles de synthèse vocale (text-to-speech), qu’il présente comme ses modèles audio les plus expressifs : Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS. Tous deux sont en disponibilité générale dans l’API Gemini et dans Google AI Studio, avec un nouvel endpoint Voices ; le changelog de l’API date l’entrée du 22 septembre, l’annonce publique est tombée le 23.
Les deux modèles se partagent le travail. Flash TTS sert à créer : on décrit en langage naturel le rôle, l’accent et le caractère d’une voix, puis on dirige chaque réplique (jeu, rythme, changement de dialecte). Google le destine au jeu vidéo, aux livres audio et aux podcasts. Flash-Lite TTS vise le volume et le coût : doublage à grande échelle, production audio en masse et agents vocaux en temps réel ; il doit remplacer gemini-3.1-flash-tts-preview. Les deux gèrent des dialogues à deux voix dans un même script, des heures d’audio sans dérive notable du timbre et des balises comme <laughs>, <sigh> ou |mhm|.
Le billet annonce plus de 2 000 voix prêtes à l’emploi, avec des variantes régionales comme le français québécois ; la documentation de l’API décrit, elle, 30 voix studio et une bibliothèque étendue de plusieurs centaines de voix. La réplication de voix fonctionne à partir d’un échantillon de 30 secondes, à condition d’enregistrer le consentement verbal du propriétaire de la voix, et tout audio généré porte le filigrane SynthID. Point important pour les lecteurs français : selon une note du billet, la réplication de voix via AI Studio n’est pas disponible dans l’Espace économique européen, au Royaume-Uni, en Suisse, en Inde, dans l’Illinois ni au Texas. Le remix de voix existantes est annoncé pour bientôt.
| Caractéristique du modèle | Gemini 3.8 Flash TTS | Gemini 3.8 Flash-Lite TTS |
|---|---|---|
| Identifiant API | gemini-3.8-flash-tts | gemini-3.8-flash-lite-tts |
| Langues prises en charge (documentation de l’API) | 130 | 101 |
| Usage visé | Création, direction fine | Volume, doublage, agents vocaux |
| Sortie audio, prix Standard jusqu’au 31/12/2026 (million de tokens) | 9 dollars | 6 dollars |
| Sortie audio, prix Standard dès le 01/01/2027 (million de tokens) | 18 dollars | 12 dollars |
| Produit grand public | Gemini Notebook | Google Vids (narration annoncée) |
À titre de comparaison, Gemini 3.1 Flash TTS Preview coûte 20 dollars par million de tokens audio en sortie. Google appuie le lancement sur des évaluations externes : Flash TTS prend la première place du Voice Design Benchmark de Hume AI (71,4), et les deux modèles occupent les deux premières places de l’Overall Quality Index de Hume AI. Ils rejoindront aussi Gemini Enterprise par API « bientôt ».
🔗 Annonce Google · Notes de version de l’API Gemini · Tarifs de l’API
FLUX 3 Action : Black Forest Labs publie un modèle à poids ouverts pour piloter des robots
23 septembre — Black Forest Labs, connu pour ses modèles d’image FLUX, publie FLUX 3 Action, un modèle d’action du monde (World Action Model) de 7 milliards de paramètres conçu pour piloter des robots. Dérivé du socle multimodal FLUX 3, il prédit dans un même calcul les images à venir et les commandes motrices, à partir des caméras et de la position des articulations. Les poids sont ouverts (la fiche Hugging Face du checkpoint DROID affiche la licence « flux-kommunity-license »), et le laboratoire publie aussi le code, la recette de réglage fin, les benchmarks et des exemples reproductibles.
An open weights 7B World Action Model that achieves first place on the RoboLab benchmark. It outperforms the previous best open model by 6.1 percentage points while using 56% fewer parameters and running up to 3.95x faster.
🇫🇷 Un modèle d’action du monde de 7B à poids ouverts qui prend la première place du benchmark RoboLab. Il dépasse le meilleur modèle ouvert précédent de 6,1 points de pourcentage tout en utilisant 56 % de paramètres en moins et en s’exécutant jusqu’à 3,95 fois plus vite. — @bfl_ai sur X
| Modèle évalué | Type de modèle | Accès aux poids | Réussite RoboLab-120 | Nombre de paramètres |
|---|---|---|---|---|
| FLUX 3 Action | WAM | Ouverts | 42,92 % | 7B |
| OASIS WAM | VLM + WAM | Fermés | 39,0 % | – |
| Cosmos3-Nano-Policy | WAM | Ouverts | 36,8 % | 16B |
| Phoenix | TAMP+FM | Fermés | 34,4 % | – |
| BiMind v0.1 | VLA | Fermés | 33,3 % | – |
| π0.5 | VLA | Ouverts | 28,0 % | 3,3B |
| DreamZero | WAM | Ouverts | 25,7 % | 14B |
| GR00T N1.6 | VLA | Ouverts | 7,2 % | 3B |
Le meilleur modèle ouvert précédent était Cosmos3-Nano-Policy de NVIDIA. Le « jusqu’à 3,95 fois plus rapide » se lit face à Cosmos 3 Nano en FP8 : de 1,52 à 3,95 fois selon le GPU. Face à π0.5, le modèle vision-langage-action (VLA) ouvert le plus performant, la variante distillée en une seule étape (38,3 %) est plus rapide sur les GPU de station de travail et de centre de données, mais plus lente sur une RTX 5090 ; elle anticipe en revanche 2,13 secondes de mouvement par prédiction, contre 1 seconde pour π0.5.
Le billet teste aussi une politique hybride où GPT-6 Astra, d’OpenAI, supervise le robot : associé à Astra en effort bas (low), FLUX 3 Action réussit 90 % des épisodes pour 8,77 dollars et environ 8 minutes par succès, contre 13,47 dollars et 16 minutes pour Astra seul en effort « xhigh », qui réussit toutes les tâches. Sur un vrai bras Franka, une évaluation en aveugle de Positronic Robotics donne 28 succès sur 30 à FLUX 3 Action, contre 27 pour Cosmos 3 Nano et 13 pour π0.5. Trois checkpoints sont disponibles sur Hugging Face (base, SO-101 et DROID), et le modèle est intégré à LeRobot avec NVIDIA, avec un déploiement possible sur Jetson.
🔗 FLUX 3 Action (Black Forest Labs) · Collection Hugging Face
Escaping SPACE : Perplexity publie le premier audit de sécurité du bac à sable de Computer
23 septembre — Le Perplexity Secure Intelligence Institute publie la première partie d’un rapport de tests d’intrusion (red-teaming) sur SPACE, le bac à sable dans lequel tournent les agents de Perplexity Computer, présenté le 15 juillet. Ce n’est pas un lancement mais la première évaluation de sécurité publiée de SPACE. Chaque bac à sable y est une micro-machine virtuelle Firecracker, isolée de la machine hôte, et une passerelle propre à chaque bac à sable applique la politique de sortie réseau.
Neuf modèles ont reçu un accès root dans la machine virtuelle, avec deux missions de type capture de drapeau : franchir la frontière entre la VM et l’hôte pour récupérer un identifiant AWS leurre, ou atteindre une URL que la politique réseau bloque. Le protocole croise l’accès ou non au code source de SPACE et deux niveaux de réseau, aucun ou partiel (dépôts de paquets PyPI et Ubuntu, recherche web de Perplexity), à raison de trois essais par configuration. Résultat : aucune évasion de la VM vers l’hôte en 108 essais, même avec le code source. Le filtrage réseau a tenu quand tout était bloqué (0 sur 54) ; avec un réseau partiel, en revanche, 11 essais sur 54 ont atteint la destination interdite, avant correctif.
| Modèle évalué | Succès avec code source | Succès sans code source |
|---|---|---|
| Claude Opus 5.0 | 3 essais sur 3 | Aucun |
| GPT-5.6 Sol | 3 essais sur 3 | 2 essais sur 3 |
| Kimi K3 | 2 essais sur 3 | Aucun |
| GPT-5.6 Cyber | Aucun | 1 essai sur 3 |
| Cinq autres modèles évalués | Aucun | Aucun |
Deux failles ont servi. Une usurpation DNS : l’agent injectait une fausse réponse associant pypi.org à l’adresse de la cible, et la passerelle, qui ne vérifiait pas la provenance, l’enregistrait ; il fallait pour cela une adresse interne visible seulement dans le code source. Et le partage d’adresses IP par un CDN : GPT-5.6 Sol a fait chercher l’URL interdite par fiddle.fastly.dev, joignable par la même adresse que PyPI, et GPT-5.6 Cyber est passé par un service d’images de Taboola et le générateur de captures thum.io avant de lire le drapeau par reconnaissance de caractères. Claude Opus 5.0 a repéré ce vecteur mais l’a écarté, le jugeant contraire à la consigne de ne cibler aucun système externe. Kimi K3 est le seul modèle à poids ouverts à avoir réussi. Deux modèles n’ont pas pu être évalués : Fable a refusé l’exercice malgré l’inscription de Perplexity au Cyber Verification Program d’Anthropic, et GPT-6 Astra a lui aussi refusé.
Les failles, découvertes le 26 août, sont corrigées : chaque paquet sortant doit porter l’adresse attribuée à sa VM, et la passerelle termine elle-même le TLS pour vérifier le nom de serveur (SNI) et l’hôte HTTP. Réévalués dans la configuration la plus favorable à l’attaquant, les modèles n’ont plus récupéré le drapeau. Perplexity a ensuite testé, sans agent, dix plateformes tierces de bacs à sable : huit présentaient au moins un contournement, dont E2B, Vercel Sandbox, Modal Sandboxes et Daytona Sandbox, tandis que Cloudflare Sandbox et NVIDIA OpenShell ont résisté. Tous les éditeurs, prévenus le 1er septembre, ont répondu ; au 10 septembre, Daytona, Deno et microsandbox avaient corrigé, Vercel et Modal traitant le comportement comme une limite connue. La seconde partie du rapport, sur les stratégies des modèles, est annoncée sans date.
Claude Code 2.1.281 : attribution désactivable et mode auto resserré
23 septembre — Publiée à 19 h 19 UTC, au lendemain de la 2.1.280, Claude Code 2.1.281 aligne 176 entrées, dont 112 correctifs. Deux changements se voient au quotidien : le réglage "attribution": false dans settings.json supprime toute attribution dans les commits et les pull requests, et l’envoi immédiat d’un message (ctrl+enter) fait passer les outils en cours en arrière-plan au lieu d’annuler le tour.
Le mode auto se resserre : là où la revue du classifieur tourne côté serveur, même les commandes shell en lecture seule attendent son verdict. Correctif de sécurité à noter : un rm récursif visant une substitution de commande, comme rm -rf "$(pwd)", s’exécutait sans confirmation en mode auto et avec --dangerously-skip-permissions ; il demande désormais confirmation, même avec une règle Bash autorisée. Pour ne pas bloquer les sessions sans surveillance, l’invite d’un rm dangereux attend deux minutes, puis refuse la commande en suggérant une réécriture.
Changement incompatible pour les runners auto-hébergés : les scripts intermédiaires (wrappers) ou les hooks qui ajoutent --system-prompt doivent passer à --system-prompt-file. Côté administrateurs, la passerelle Claude apps peut appeler Amazon Bedrock sous un rôle IAM obtenu par STS (assume_role), au besoin dans un autre compte AWS, et appliquer un garde-fou Bedrock à chaque requête.
Anthropic côté produit : claude.ai accéléré, Marketplace élargi
Deux annonces produit d’Anthropic, publiées le même jour, complètent le résultat scientifique.
claude.ai trois fois plus rapide en deux semaines
23 septembre — Sur claude.dev, trois ingénieurs d’Anthropic racontent le sprint de deux semaines, mené en août, qui a rendu claude.ai et l’application de bureau environ trois fois plus rapides. Tout s’est joué dans un seul canal Slack, avec Claude Tag (bêta) animé par un modèle de recherche interne « à peu près comparable à Opus 5.5 » : Claude a repéré les goulets, construit les benchmarks, proposé les correctifs et surveillé les déploiements, les humains fixant les objectifs et approuvant chaque changement. Bilan : plus de 3 000 changements fusionnés, sans incident visible des clients ni retour arrière.
| Parcours mesuré (75e centile) | Avant le sprint | Après le sprint |
|---|---|---|
| Page claude.ai prête à la saisie | 3,1 s | 0,55 s |
| Nouvelle session Claude Code (bureau) | 0,8 s | 0,3 s |
| Session cloud Claude Cowork (bureau) | 2,6 s | 0,73 s |
| Moyenne géométrique sur 13 mesures | – | 3,1x plus rapide |
La méthode tient en une idée : dès que Claude dispose d’un chiffre à battre, il peut optimiser. L’équipe a donc transformé des mesures déterministes en cliquets de CI qui ne peuvent que baisser. Une partie de ces gains, un streaming environ quatre fois plus fluide, avait déjà été annoncée le 24 août.
🔗 How we made claude.ai 3x faster in two weeks
Le Claude Marketplace réunit connecteurs, agents et intégrateurs
23 septembre — Anthropic élargit le Claude Marketplace, lancé en préversion limitée en mars. La vitrine réunit désormais trois familles d’offres : plus de 2 000 connecteurs et plugins (Atlassian, Google, Microsoft, Notion, Salesforce…), des agents et produits propulsés par Claude (CrowdStrike, Cursor, Harvey, Legora, Lovable, Snowflake), que les entreprises peuvent régler avec une partie de leur engagement de dépense Anthropic, et les cabinets de conseil du Claude Partner Network (Accenture, Boston Consulting Group, Deloitte). Les éditeurs ont trois voies d’entrée : construire un connecteur ou un plugin avec MCP et les Agent Skills, soumettre la candidature d’un agent ou d’un produit, ou rejoindre le Partner Network. Un billet compagnon illustre le mécanisme d’achat : CodeRabbit a financé un plan Vercel avec engagement sur son budget Anthropic, accord conclu en une semaine. Ce paiement par l’engagement Anthropic reste en préversion limitée, sur demande d’éligibilité.
ChatGPT : Voice passe à l’action, fiches de révision et Privacy Center
Voice utilise les plugins et arrive dans ChatGPT Work
23 septembre — OpenAI étend ChatGPT Voice dans deux directions. Le mode vocal Live peut désormais utiliser les plugins et les applications connectées au compte, comme la messagerie, l’agenda ou Slack, pendant une conversation sur le web, iOS et Android. Et Voice arrive dans ChatGPT Work sur le web et le mobile : on y demande à voix haute de créer un document, une présentation ou une feuille de calcul, d’utiliser une application connectée ou de mener une tâche dans le navigateur, qui peut se poursuivre par écrit après l’appel.
Côté modèles, le tweet d’OpenAI indique que Voice peut aussi s’appuyer sur GPT-6 Astra, Sol et Luna ; l’article d’aide précise, lui, que Live repose sur GPT-Live-1 ou GPT-Live-1 mini selon le forfait, sans détailler le rôle des modèles GPT-6. Les utilisateurs Free et Go ont Voice dans Chat avec les plugins de leur forfait ; Voice dans Work demande l’accès aux deux, et les tâches lancées ainsi comptent dans l’usage normal de Work. Live ne gère ni la vidéo ni le partage d’écran. Le déploiement est mondial depuis le 23 septembre, dans la dernière version de l’application.
🔗 Annonce d’OpenAI sur X · Article d’aide ChatGPT Voice
Fiches de révision et centre de confidentialité
22 septembre — ChatGPT sait désormais créer des fiches de révision interactives (flashcards), à partir d’un sujet ou de notes téléversées. On touche une carte pour la retourner, puis on indique si l’on connaissait la réponse ou s’il faut la revoir ; l’ordre des cartes peut être mélangé. Les fiches sont enregistrées automatiquement dans la bibliothèque. La fonction est disponible sur mobile et sur le web pour tous les forfaits, gratuit compris.
21 septembre — Rattrapage : la même page de notes de version annonçait la veille un centre de confidentialité (Privacy Center), en déploiement pour les utilisateurs connectés des forfaits Free, Go, Plus et Pro. Il réunit au même endroit les informations sur la confidentialité des conversations, la mémoire, la personnalisation, l’utilisation des données, les applications connectées et la sécurité du compte, avec des liens directs vers les réglages. On y accède sur le web par le menu du compte (Help, puis Privacy Center) et sur mobile depuis les réglages.
Deux nouveaux benchmarks : santé mentale et service d’inférence
MentalHealthBench (OpenAI)
23 septembre — OpenAI publie MentalHealthBench, un benchmark ouvert qui mesure la façon dont les modèles répondent dans des conversations réalistes de santé mentale, des échanges du quotidien à composante émotionnelle jusqu’aux urgences. Il a été co-construit avec plus de 80 psychologues et psychiatres agréés de 22 pays, parlant 19 langues. Les conversations, synthétiques, mettent en scène quatre profils : adultes, adolescents de 13 à 17 ans, aidants et cliniciens. Pour chacune, les experts ont écrit des critères pondérés de -10 à +10 ; seuls ceux approuvés par au moins deux experts sur trois, sans contradiction du troisième, ont été gardés. La notation est automatique, avec GPT-5.6 Sol comme évaluateur, et le score se décompose en dix dimensions, comme la sécurité, la recherche de contexte ou le respect de l’autonomie de l’utilisateur. OpenAI affirme que les modèles progressent régulièrement, notamment dans la recherche de contexte, mais les scores par modèle ne figurent que dans les graphiques du billet. OpenAI rappelle que ChatGPT ne remplace ni une thérapie ni un suivi professionnel.
🔗 Introducing MentalHealthBench
SWE-Serve (NVIDIA)
23 septembre — L’équipe de NVIDIA chargée des données et de l’évaluation des modèles Nemotron publie SWE-Serve, construit avec l’équipe SGLang : 83 pull requests réellement fusionnées dans ce moteur de service d’inférence deviennent 53 tâches exécutables (décodage spéculatif, prise en charge de modèles, kernels, cache, API de service). Le résultat principal porte sur l’écart entre tests locaux et service réel : sur les 19 tâches qui démarrent un vrai serveur, les mêmes correctifs passent à 69,4 % sans les tests de service en direct, mais à 45,9 % avec le vérificateur complet. Environ un correctif sur trois qui réussit les autres contrôles échoue donc dès que le modèle est chargé et interrogé.
| Modèle évalué (raisonnement max) | pass@1 sur 3 passes | Coût moyen par tâche |
|---|---|---|
| Claude Opus 5 | 75 % | 17,40 dollars |
| GPT-5.6 Sol | 75 % | 12,26 dollars |
| Kimi K3 | 64 % | 7,24 dollars |
| GPT-5.6 Luna | 64 % | 0,95 dollar |
| DeepSeek V4 Flash (0731) | 55 % | 0,69 dollar |
Onze modèles ont été évalués avec un agent minimal, sans accès au web ; le tableau ne comprend ni Claude Opus 5.5 ni GPT-6 Sol et Luna, sortis le 22 septembre, ni GPT-6 Astra. Tâches et vérificateurs sont publics.
🔗 How SWE-Serve exposes the gap between local tests and live serving · Dépôt GitHub
La vidéo générative entre dans les logiciels de montage
Runway dans DaVinci Resolve Studio
23 septembre — Deux semaines après ses plugins pour Premiere Pro et After Effects, Runway arrive dans DaVinci Resolve Studio, le logiciel de montage de Blackmagic Design. Le plugin, gratuit pour macOS et Windows, s’ouvre depuis Workspace, puis Workflow Integrations. On y génère images et vidéos par prompt, importées en un clic dans le Media Pool et sur la timeline, sans passer par le navigateur. La fonction Edit Studio agit sur un plan déjà monté : le panneau exporte la plage choisie et Aleph 2.0 la re-rend dans un nouveau style, à durée identique, à partir d’au plus cinq images clés retouchées. Il faut DaVinci Resolve Studio 19 ou ultérieur ; la génération est ouverte à tous les forfaits Runway payants et consomme les crédits existants, avec le coût de chaque génération affiché avant validation.
🔗 Runway is Now in DaVinci Resolve
Gemini Omni 1.1 Flash gratuit dans Google Vids
23 septembre — Toute personne disposant d’un compte Google ou Google Workspace peut désormais générer des vidéos sans frais avec Gemini Omni 1.1 Flash dans Google Vids, depuis vids.new sur ordinateur. La version 1.1 apporte trois commandes : prolonger une scène en conservant personnages, éclairage et décor, fixer la durée exacte d’un clip pour le caler sur une voix off, et générer directement en 1080p. Chaque clip porte un filigrane SynthID. Le déploiement complet commence le 23 septembre et peut prendre 1 à 3 jours ; les forfaits payants donnent des volumes de génération plus élevés, sans chiffre publié. Google annonce pour bientôt la narration par Gemini 3.8 Flash-Lite TTS dans Vids, dans plus de 100 langues.
Made On YouTube 2026 : Gemini Omni dans le montage des Shorts
23 septembre — Lors de son événement annuel Made On YouTube, YouTube intègre Gemini Omni dans un assistant de montage conversationnel pour Shorts et l’application YouTube Create : de simples instructions textuelles suffisent pour couper des passages parlés, synchroniser la musique, ajouter des accroches textuelles ou réordonner les plans. Les directs gagnent un doublage automatique (Live auto-dubbing), YouTube Music reçoit Ask Music pour composer ses files d’écoute en conversant, et Podcast Lineup livre chaque semaine des aperçus parlés, générés par IA, des podcasts recommandés. Les créateurs obtiennent aussi une détection de ressemblance élargie pour protéger leur voix et leur visage. Seuls les fils d’accueil personnalisés (Custom Feeds) sont datés : ils arriveront cet automne pour les spectateurs américains ; les autres fonctions n’ont pas encore de calendrier précis.
🔗 Made On YouTube 2026 · Récapitulatif Google
Les assistants se branchent à d’autres applications
Gemini : une nouvelle vague d’applications connectées
23 septembre — Google déploie une nouvelle série d’applications connectables à Gemini, que le compte @GeminiApp décrit comme des connexions MCP. Le billet cite 14 noms en trois familles : productivité (Airtable, Linear, monday.com, PandaDoc, Wispr AI, Zoho), création (Adobe, Picsart, Squarespace, Webflow) et vie quotidienne (apartments.com, Experian, Peloton, SeatGeek) ; le tweet de @GeminiApp parle, lui, de 13 nouvelles applications. Ces services s’activent dans les paramètres ou s’appellent dans la conversation en tapant @. Exemples donnés : retoucher l’éclairage d’une photo avec Adobe, ou consulter sa note de crédit avec Experian. Le billet ne précise ni les pays ni les offres concernés.
🔗 Annonce Google · Annonce de @GeminiApp
Muse, l’agent de Meta : Shopify, PayPal, Expedia, Instacart, puis ElevenLabs et HeyGen
22 et 23 septembre — Muse, l’agent personnel lancé par Meta le 8 septembre, a annoncé en moins de 24 heures quatre connecteurs vers des services marchands, tous « bientôt » disponibles selon le compte officiel @Muse, sans date, tarif ni pays. Le 23, deux acteurs des médias génératifs annoncent à leur tour leur arrivée : ElevenLabs, sans date de disponibilité, et HeyGen, qui s’appuie sur son serveur MCP.
| Service annoncé | Usage décrit par l’annonce | Annoncé par | Disponibilité annoncée |
|---|---|---|---|
| Shopify | Paiement en un geste sur tout le web | @Muse | Bientôt |
| PayPal | Paiements gérés par l’agent, dans le monde | @Muse | Bientôt |
| Expedia | Réservation d’hôtels | @Muse | Bientôt |
| Instacart | Courses livrées à domicile | @Muse | Bientôt |
| ElevenLabs | Voix off, bandes-son et vidéos | @ElevenLabs | Non précisée |
| HeyGen | Vidéo de son avatar, avec sa voix, prête à publier | @HeyGen | Non précisée |
🔗 Les quatre connecteurs annoncés par @Muse · ElevenLabs arrive dans Muse · HeyGen rejoint Muse
Grok Bot dans les Tesla et dans Google Slides, Sheets et Docs
22 septembre — Tesla annonce l’arrivée de Grok Bot, l’agent de SpaceXAI, dans ses voitures : avec les Connectors, Grok peut gérer la boîte mail, ranger l’agenda ou reprendre des fichiers, conversations et tâches existants, sans que le conducteur lâche le volant. Le compte @grok relaie l’annonce le soir même. L’activation passe par trois étapes : se connecter à l’application Grok dans la voiture, ajouter les Connectors depuis l’application mobile ou le site de Grok, puis souscrire à SuperGrok, nécessaire pour Grok Bot. Les messages ne précisent ni les modèles de véhicules concernés ni les pays.
Le même jour, le compte @bot annonce que Grok Bot se connecte nativement à Google Slides, Sheets et Docs, gère mieux les pièces jointes des e-mails (lecture et ajout de fichiers) et peut faire passer sa navigation web par le réseau de l’utilisateur. SpaceXAI promet aussi des tâches plus rapides et une application de bureau plus réactive, sans chiffre à l’appui.
🔗 Relais de @grok · Annonce de Tesla · Fil de Grok Bot
Antigravity : agents en local et commande /plan
Le SDK fait tourner ses agents en local avec Gemma 4 26B
23 septembre — Le SDK Antigravity, qui donne accès depuis Python aux capacités agentiques de Google Antigravity, prend désormais en charge des workflows entièrement locaux. Le support initial porte sur Gemma 4 26B A4B exécuté avec LiteRT (Google AI Edge), sur une machine dotée de plus de 24 Go de VRAM ou de mémoire unifiée ; LocalOpenAIAgentConfig se branche sur tout serveur compatible OpenAI, comme Ollama, LM Studio ou vLLM. Google avance l’absence de coût d’API et de limite de débit, un code qui ne quitte pas la machine et des workflows hybrides. Sa démonstration : Gemini 3.8 Flash planifie dans le cloud l’audit de trois modules vulnérables pour 95 tokens, sans jamais voir le code, pendant que des instances locales de Gemma 4 26B reproduisent les failles, écrivent et valident les correctifs ; 97,2 % des tokens (3 322) restent en local. Ces nouveautés sont arrivées avec le SDK 0.1.18 du 21 septembre, qui retire aussi l’outil de question interactive ASK_QUESTION des outils par défaut, pour que les agents tournent en autonomie.
Antigravity 2.16.0 et 2.17.0, CLI 1.2.8 et 1.2.9
22 septembre — L’application Antigravity publie deux versions le même jour. La 2.17.0 introduit la commande /plan : l’agent rédige un plan que l’on relit et modifie avant qu’il n’écrive la moindre ligne de code, avec un réglage Plan Review Policy à trois modes (revoir chaque plan, laisser l’agent juger, s’en passer). Elle réserve aussi aux règles un budget de 20 000 tokens et lit la configuration par dépôt dans .gemini/config.json, l’ancien .agents/settings.json n’étant plus pris en compte. La 2.16.0 permet de se connecter à une distribution WSL, de glisser dans un prompt des documents Word, Excel et PowerPoint, et affiche les sous-agents en cartes en direct.
| Version de l’application | Nombre d’améliorations | Nombre de correctifs | Nouveauté principale |
|---|---|---|---|
| 2.16.0 | 12 | 15 | WSL, pièces jointes Office, cartes de sous-agents |
| 2.17.0 | 11 | 10 | /plan, budget de 20 000 tokens pour les règles |
22 et 23 septembre — Côté terminal, la CLI 1.2.9 ajoute une syntaxe @ pour écrire directement à un sous-agent et fiabilise le mode headless : les tâches de fond sont attendues jusqu’à 30 minutes au lieu d’être annulées quelques secondes après l’inactivité de l’agent. La 1.2.8 revoit la compaction du contexte et plafonne la dictée vocale à 3 min 30 s.
Google DeepMind : une mémoire persistante chiffrée pour Private AI Compute
23 septembre — Google DeepMind détaille comment il compte doter Private AI Compute, sa plateforme de traitement dans des enclaves cloud isolées matériellement, d’une mémoire persistante. Jusqu’ici, la plateforme était « sans état » : tout le contexte disparaissait à la fin de la tâche. La nouvelle couche fonctionne comme un coffre-fort chiffré dans le cloud, dont les clés restent exclusivement sur les appareils de l’utilisateur, ce qui rend les données, selon Google, inaccessibles à quiconque, Google compris. Quand un modèle a besoin d’une information, une enclave sécurisée déchiffre temporairement les données en mémoire isolée, traite la requête, enregistre le nouveau contexte puis rechiffre aussitôt. Exemple cité : retrouver sur son ordinateur des instructions de montage consultées plus tôt avec des lunettes connectées.
Il s’agit d’une annonce d’architecture, formulée au futur, sans date de disponibilité ni produit nommé. Pour appuyer la confiance, Google publie un livre blanc mis à jour, un registre public inviolable de son logiciel serveur, que les appareils pourront vérifier avant d’envoyer des données personnelles, et les résultats d’un audit indépendant mené par un cabinet qu’il ne nomme pas.
Qwen : agents pour smartphones et audio moins cher
Qwen Intelligence, trois agents pour les constructeurs de téléphones
23 septembre — Qwen lance Qwen Intelligence, une offre d’agents pour smartphones qui vise d’abord les constructeurs de téléphones. Les modules (planification, exécution, image, mémoire) se combinent à la carte, et un routage répartit les calculs entre l’appareil et le cloud. Trois agents au lancement : Mobile Planner planifie les tâches complexes, Mobile-Use les exécute en passant d’abord par les API, avec un repli sur l’interface graphique (82,1 sur MobileWorld, 97,2 sur AndroidDaily, 90 % de réussite de bout en bout selon Qwen), et Mobile Creative génère une image en 3 secondes. Qwen ouvre quatre benchmarks, mais ni les poids ni le code des agents. Mobile-Use et Mobile Creative sont déjà facturés à l’usage, alors que la facturation de Mobile Planner est annoncée « bientôt ».
| Modèle ou système évalué (selon Qwen) | Score global MobilePA-Bench |
|---|---|
| Qwen-Planner-Agent 27B | 77,05 % |
| GPT-6 Astra | 76,84 % |
| Claude Opus 5 | 75,71 % |
| Claude Fable 5 | 74,53 % |
| GLM 5.3 | 73,88 % |
🔗 Annonce de Qwen sur X · Rapport Qwen-Planner-Agent
Qwen-Audio-3.1, jusqu’à 95 % moins cher
23 septembre — Qwen-Audio-3.1 met à niveau les trois modèles audio de Qwen, reconnaissance vocale (ASR), synthèse vocale (TTS) et conversation en temps réel (Realtime), et en ajoute deux : TTS-Next, qui génère en une passe voix, effets et fond sonore, et ASR-Next, qui distingue les locuteurs, horodate la transcription et reconnaît émotions et bruits ambiants. Realtime écoute et parle en même temps et se laisse interrompre. Sur QwenCloud, qwen-audio-3.1-realtime-plus coûte 6,4 dollars par million de tokens audio en entrée et 24 dollars en sortie texte et audio, avec 262K tokens de contexte ; l’ASR sur fichiers coûte 0,15 dollar par million de tokens en entrée. Seules ces deux API sont ouvertes, les autres sont annoncées « bientôt ».
| Famille de modèles | Baisse de prix annoncée |
|---|---|
| TTS | environ 70 % |
| Realtime | environ 85 % |
| ASR | jusqu’à 95 % |
🔗 Annonce de Qwen-Audio-3.1 sur X · Qwen-Audio-3.1-Realtime sur QwenCloud
Mistral Vibe : Chat et Work fusionnent, la CLI resserre ses autorisations
Chat et Work fusionnent, base de connaissances en préversion
22 septembre — Mistral publie quatre notes de version pour Vibe, son assistant (l’ancien Le Chat), sans billet ni tweet. La principale fusionne Chat et Work en une seule expérience : on pose une question ou on lance une tâche au même endroit, un sélecteur Fast / Think remplace le changement de mode, et les Skills remplacent les Chat Agents, Deep Research devenant l’une d’elles. La migration a commencé le 14 septembre pour les comptes Free, Pro et Teams ; les entreprises suivront à partir du 1er octobre, dans une fenêtre d’environ six mois. La base de connaissances agentique (Agentic Knowledge Base), en préversion publique, remplace une mémoire opaque par des pages consultables et modifiables, et indique d’où vient chaque fait rappelé. Mini App Canvas génère de petites applications React partageables à partir d’un prompt, et les tableurs Excel ou CSV arrivent dans Vibe Work sur les formules payantes.
Vibe CLI 2.25.8 corrige des contournements d’autorisation
23 septembre — Vibe CLI 2.25.8 aligne 5 ajouts et 38 correctifs, dont plusieurs touchent la sécurité des autorisations. Une liste d’autorisation par chemin relatif n’autorise plus un fichier simplement parce que son chemin se termine par le même suffixe, les jokers des commandes shell ne sautent plus la vérification des chemins hors du dossier de travail, et une autorisation accordée à un dossier parent ne couvre plus automatiquement ses sous-dossiers, ce qui peut faire réapparaître certaines demandes d’approbation. Les notes mentionnent aussi, pour la première fois, une « Rust CLI », concernée par 18 lignes, qui permet notamment de configurer les projets distants de Vibe Code. Côté entreprises, la configuration imposée par l’organisation s’applique dès l’ouverture d’une session Unified Harness, et la connexion OAuth aux serveurs MCP qui émettent un secret client, comme Supabase, est corrigée.
🔗 Notes de version de Vibe CLI 2.25.8
Agents de code ouverts et en ligne de commande
ZCode passe en open source après des problèmes de sécurité
21 septembre — Rattrapage : Z.ai a ouvert le code de ZCode, son harnais de programmation agentique présenté comme l’outil officiel de GLM-5.3, en réponse à des problèmes de sécurité signalés par la communauté. Le compte @zcode_ai dit avoir terminé les corrections nécessaires et présente ses excuses. Le dépôt zai-org/ZCode, sous licence Apache-2.0, contient les clients, les services backend, la CLI et le runtime de l’agent ; il comptait environ 6 500 étoiles le 23 septembre.
With respect to the code data referenced by the community, we confirm that no such data is retained and that it has never been used for model training.
🇫🇷 Concernant les données de code évoquées par la communauté, nous confirmons qu’aucune de ces données n’est conservée et qu’elles n’ont jamais servi à entraîner des modèles. — @zcode_ai sur X
Selon ZCode, deux organismes ont ensuite évalué la situation : pour le CAICT, le bucket Alibaba Cloud OSS « zcode-prod » ne contient plus de données ; pour NSFOCUS, ses objets comme le bucket lui-même ont été supprimés. Tous deux relèvent que le client v3.14.0 intègre la correction, que la fonction Repo Wiki a disparu et que le flux qui téléversait des instantanés de dépôts locaux est désactivé. Z.ai annonce un processus permanent de signalement des failles, avec récompenses, et promet de publier le rapport d’évaluation complet.
🔗 Code source de ZCode sur GitHub
Kimi Code 2.1.0 durcit sa sécurité
23 septembre — Moonshot publie Kimi Code 2.1.0 (2 nouveautés, 18 correctifs). La nouveauté visible est une disposition plein écran expérimentale, à choisir dans /settings et effective au redémarrage. Plusieurs correctifs durcissent la sécurité : les outils de fichiers ne peuvent plus sortir du dossier de travail par des liens symboliques, la configuration locale d’un projet ne s’applique qu’une fois l’espace de travail approuvé, la configuration git d’un dépôt ne peut plus exécuter de commandes pendant les opérations git en arrière-plan, et les dossiers supplémentaires qui pointent vers le dossier personnel ou la racine sont refusés. L’OAuth des serveurs MCP demande désormais un accès hors connexion, ce qui met fin aux réautorisations toutes les heures. Dans le même temps, Moonshot a archivé l’ancien Kimi CLI écrit en Python (11 424 étoiles), dont les versions 1.51.0 et 1.52.0 renvoient vers Kimi Code.
🔗 Notes de version de Kimi Code 2.1.0
DeepSeek Harness 0.1.7-rc.1, en préversion
23 septembre — DeepSeek publie la v0.1.7-rc.1 de DeepSeek Harness, son harnais d’agent open source sous licence MIT présenté le 13 août. C’est une version candidate (release candidate) : le dépôt compte 21 préversions depuis août, sans aucune version stable à ce jour. Les ajouts marquants sont expérimentaux : un mode Computer Use qui permet à l’agent d’agir sur l’ordinateur local et d’en prendre des captures d’écran (via Cua Driver MCP ou un pilote natif), et trois backends de pilotage de navigateur (Playwright MCP, Chrome DevTools MCP, Stagehand). L’interface web gagne des terminaux intégrés et une revue des modifications avec diffs, le mode headless lit ses tâches sur l’entrée standard et émet ses événements en JSON, et l’agent peut travailler sur un espace distant via SSH. Migrations à prévoir : l’adaptateur officiel de DeepSeek passe exclusivement par la Messages API, les backends d’exécution E2B disparaissent, et le mode équipe expérimental passe de 8 à 16 coéquipiers.
🔗 DeepSeek Harness v0.1.7-rc.1
GenCode, l’agent de code de Genspark
23 septembre — Genspark lance GenCode, un agent de code intégré à sa Super App, sur macOS, Windows et Linux, et disponible en ligne de commande. L’argument central est le choix du modèle : Claude, GPT, DeepSeek ou un modèle à poids ouverts, tâche par tâche, depuis un seul compte et sans clé d’API à configurer ; Genspark annonce des modèles ouverts « de 1/10 à 1/20 du coût ». GenCode reprend en une étape les instructions, règles et mémoire construites pour Claude Code. Le README du paquet npm @genspark/gencode précise son origine : il dérive d’opencode, l’agent de code open source, mais reste un produit propriétaire non affilié au projet, qui partage volontairement le dossier .opencode/ des dépôts. La dépense s’affiche en crédits Genspark à chaque étape.
🔗 GenCode · Annonce de Genspark sur X
GitHub Copilot : approbations assistées et bac à sable local
Copilot pour JetBrains 1.18.0
22 septembre — La version 1.18.0 de Copilot pour les IDE JetBrains introduit, en préversion publique, les approbations assistées (assisted approvals) : dans les sessions d’agent, les appels d’outils jugés à faible risque sont approuvés automatiquement, tandis que les actions plus risquées demandent toujours une décision. On peut aussi rééditer un message antérieur : Copilot rembobine alors la conversation et les modifications de fichiers avant d’envoyer la nouvelle consigne. L’agent Codex, disponible dans Copilot pour JetBrains, gagne un mode plan pour relire, affiner ou approuver la démarche avant toute modification, et les sessions acceptent les skills et instructions d’organisation et d’entreprise. Le serveur MCP GitHub intégré, actif par défaut, devient désactivable. Les utilisateurs d’un IDE JetBrains 2025.1 recevront un avis les invitant à passer en 2026.1 ou plus.
🔗 Nouveautés de Copilot pour JetBrains
L’app Copilot confine ses sessions locales
23 septembre — L’app GitHub Copilot, l’application de bureau de GitHub dédiée à ses agents, reçoit un bac à sable local en préversion publique. Configuré projet par projet, il limite ce que les commandes d’une session locale peuvent atteindre : le système de fichiers (dossiers en lecture et écriture, en lecture seule ou interdits), le réseau (accès sortant à internet et au réseau local) et les identifiants (Git en HTTPS, GitHub CLI). Des réglages gérés par l’entreprise peuvent durcir la politique. Si le système d’exploitation ne sait pas appliquer la politique demandée, le shell du bac à sable s’arrête sur une erreur plutôt que de s’exécuter sans protection. Désactivé par défaut, le bac à sable s’active pour les nouvelles sessions du projet, ou avec /sandbox on pour une session en cours ; il ne couvre ni les sessions cloud ni les hôtes distants, et ses réglages restent distincts de ceux de Copilot CLI.
🔗 Bac à sable local dans l’app GitHub Copilot
Cursor : deux bots pour la mise en production, 7 % de tokens en moins
Rollouts et Security Review
23 septembre — Cursor lance deux bots consacrés au « dernier kilomètre » de la livraison de code, disponibles sur les formules Teams et Enterprise. Rollouts publie à l’ouverture de chaque pull request un plan de surveillance (risques, effet attendu, signaux à vérifier), puis confronte ce plan aux logs, métriques et traces après chaque déploiement et rend un verdict par environnement : sain, régression détectée ou non concluant. En cas de régression, il désigne le changement suspect et peut ouvrir une PR de retour arrière soumise à validation, sans rien fusionner ni annuler de lui-même. Security Review passe sur chaque pull request et signale les failles exploitables (injections, contournements d’authentification, secrets laissés dans le code, SSRF…), chacune avec sa gravité, son chemin d’attaque et un correctif proposé. Pendant 10 jours, des crédits d’essai permettent de tester Rollouts sur environ 50 changements pour Teams et 500 pour Enterprise.
7 % de coût en tokens en moins, sans perte de qualité
23 septembre — Cursor détaille comment il a réduit de 7 % le coût en tokens de son agent pour les utilisateurs, sans baisse de qualité. Les modèles récents n’ayant plus besoin de longues listes d’interdictions, le prompt système a été raccourci d’environ 66 %, des coupes validées par des tests A/B sur le trafic réel. Les outils intégrés, dont la plupart servent dans moins de 20 % des conversations, sont désormais chargés à la demande.
| Levier d’optimisation | Effet mesuré par Cursor |
|---|---|
| Prompt système allégé | environ 66 % du prompt supprimé |
| Outils intégrés chargés à la demande | -60 % de tokens de description en contexte statique |
| Points d’arrêt de cache explicites | -20 % d’échecs de cache à froid |
| Un numéro de ligne toutes les dix | -1,6 % de tokens lus depuis le cache |
| Ensemble des changements | -7 % de coût en tokens pour les utilisateurs |
NVIDIA : diarisation ouverte et AI Day Singapore
Nemotron 3 Diarization distingue jusqu’à huit locuteurs
23 septembre — NVIDIA publie sur Hugging Face Nemotron 3 Diarization, un modèle à poids ouverts de 100 millions de paramètres qui détermine qui parle et à quel moment dans une conversation, y compris quand les voix se chevauchent. Il suit jusqu’à huit locuteurs, contre quatre pour son prédécesseur Streaming Sortformer, et fonctionne en différé comme en flux continu, avec une latence de tampon réglable de 30,4 à 0,32 seconde. Il ne transcrit pas les mots : il fournit des plages horaires par locuteur, à combiner avec un modèle de transcription. Sur les premiers résultats du Diarization-Bench de VoiceArena, il se classe premier sur 12 systèmes avec 14,72 % d’erreur de diarisation, contre 19,3 % pour le suivant, un classement initial qui peut encore évoluer selon NVIDIA. Face à l’ancien modèle, l’erreur baisse de 41 % en moyenne sur huit jeux d’évaluation, avec un léger recul sur les conversations à deux locuteurs de CALLHOME. Licence OpenMDW 1.1.
| Mesure publiée | Nemotron 3 Diarization | Modèle précédent |
|---|---|---|
| Locuteurs suivis au maximum | 8 | 4 |
| Débit à 30,4 s (lots de 32, RTX PRO 5000) | 15 113 fois le temps réel | 2 619 fois |
| Erreur DIHARD III à 30,4 s | 12,73 % | 19,09 % |
🔗 Nemotron 3 Diarization sur le blog Hugging Face
AI Day Singapore : Vera Rubin et Nemotron en Asie du Sud-Est
22 septembre — Dans un billet publié le 22 à 19 h 30 PT, pendant son AI Day Singapore (22 et 23 septembre), NVIDIA présente Sea Limited, maison mère de Shopee, Garena et Monee, comme la première entreprise de la région ASEAN à adopter sa plateforme Vera Rubin, pour développer et déployer modèles et agents à plus grande échelle. Le reste du billet montre les modèles ouverts Nemotron déclinés localement : AI Singapore étend sa famille SEA-LION, dédiée aux langues de la région, aux modèles Nemotron ; au Vietnam, Viettel AI a affiné Nemotron 3 Super pour le vietnamien, en tête du benchmark VMLU ; en Thaïlande, iApp Technology a adapté Nemotron 3 Nano au droit thaïlandais avec OpenThai 2.0 Legal, publié en open source, qui fait tourner le chatbot juridique Thanoy et ses quelque 43 000 utilisateurs.
🔗 At AI Day Singapore, NVIDIA and Partners Showcase AI Advancements Across Southeast Asia
Mettre l’IA en production sans casse
Deux annonces partagent une même idée : valider sur de vraies charges avant de basculer du trafic ou de mettre à jour des machines.
Les déploiements canari de Together AI
22 septembre — Together AI détaille les déploiements progressifs de son offre Dedicated Model Inference, disponibles depuis la mise à jour du 15 septembre : changer le modèle servi derrière un endpoint sans interruption ni changement d’URL. Trois stratégies sont proposées : le canari fait monter le nouveau modèle par paliers (5 %, 25 %, 50 % puis 100 % par défaut), le bleu-vert bascule tout le trafic d’un coup, et le remplacement progressif échange les répliques une à une. Après chaque palier du canari, une porte compare la latence ou le taux d’erreur à ceux de l’ancien modèle et met le déploiement en pause s’ils se dégradent. Dans la démonstration publiée, le passage de Qwen2.5-7B à Qwen3.5-9B est stoppé dès 10 % du trafic sur une régression de 137 % de la latence p95 (1 740 ms contre 734 ms) ; le retour à l’ancien modèle s’est fait sans qu’aucune des 6 800 requêtes servies n’échoue.
🔗 Canary rollouts: upgrade models in production without downtime
NVCRE et NodeWright chez NVIDIA
23 septembre — NVIDIA détaille deux projets open source (Apache 2.0) de DSX OS, la couche logicielle de sa plateforme d’usines IA, pour les grappes GPU sous Kubernetes. NVIDIA Cluster Readiness Engine (NVCRE) part d’un constat : une grappe peut réussir tous ses contrôles de santé et échouer quand même sur un entraînement distribué. Il la certifie donc par de vraies charges (tests de communication NCCL, diagnostics DCGM, pré-entraînement NeMo) sur des groupes de nœuds choisis selon la topologie, nomme les nœuds fautifs et, en mode diagnostic, coupe en deux les groupes défaillants jusqu’à isoler les suspects. Le billet cite parmi ces charges des modèles Nemotron 5 de 8 et 56 milliards de paramètres, sans autre détail. NodeWright, l’ancien Skyhook utilisé en production chez NVIDIA, met à jour le système des nœuds (réglages du noyau, agents de sécurité, correctifs de failles) en attendant la fin des tâches protégées, par vagues fixes, linéaires ou exponentielles qui s’arrêtent d’elles-mêmes si trop de lots échouent.
🔗 Validate GPU cluster readiness before AI workloads land · NodeWright
Deux jeux de données ouverts : conversations à plusieurs voix et corpus scientifique
Basis Conversations 1500
23 septembre — Basis publie sur Hugging Face Basis Conversations 1500 : 1 502 heures de conversations spontanées entre 2 645 personnes de 33 pays, dans 22 langues, de l’anglais au mingrélien et au xhosa. Chaque échange réunit de deux à quatre personnes, chacune enregistrée sur sa propre piste synchronisée (FLAC 48 kHz), de quoi étudier chevauchements, interruptions et tours de parole, sur lesquels les modèles butent encore selon l’équipe. Environ 100 heures sont annotées finement par des humains (113 096 jugements) : rétroaction vocale compatissante ou agacée, silence gêné, chevauchement coopératif ou compétitif. Les transcriptions fournies sont automatiques et ne doivent pas servir de cibles d’entraînement sans vérification. Le billet présente le jeu comme libre pour un usage commercial et de recherche, mais il relève d’une licence propre à Basis (basis-data-license-1.0), avec un accès validé manuellement.
QVAC Genesis III
23 septembre — Tether AI Research publie QVAC Genesis III, troisième volet de son corpus synthétique destiné au pré-entraînement de petits modèles en sciences, techniques, ingénierie et mathématiques. Avec 43,06 milliards de tokens de plus, l’ensemble atteint 191,43 milliards de tokens et environ 160 millions de documents sur 19 domaines ; l’article qui l’accompagne est accepté à la conférence COLM 2026. La méthode interroge un petit modèle élève, Qwen3-1.7B-Base : une erreur devient une explication corrective, une réussite une analyse de chaque option de réponse. Entraîné de zéro sur ce corpus, un modèle de 1,7 milliard de paramètres progresse nettement face au même modèle entraîné sur Cosmopedia-v2, à budget de tokens égal. Le corpus est publié sous licence non commerciale (CC-BY-NC 4.0), et un modèle entraîné dessus est annoncé sous Apache 2.0.
| Benchmark évalué | Gain face à Cosmopedia-v2 (budget de tokens égal) |
|---|---|
| ARC-Easy | +28,57 points |
| ARC-Challenge | +21,35 points |
| GPQA Diamond | +2,52 points |
| MMLU STEM | +15,03 points |
L’IA pour le climat et l’alimentation
Ai2 et Global Fishing Watch surveillent les océans avec des agents
23 septembre — À la Climate Week de New York, Ai2 et Global Fishing Watch annoncent un partenariat pour amener l’IA, et en particulier des agents, dans la surveillance des océans et le contrôle des pêches. Les deux organisations collaboraient déjà ; elles passent au co-développement : un pipeline de détection commun, de nouveaux modèles de vision en temps réel sur images satellite et des agents capables de croiser plusieurs sources de données. Global Fishing Watch disposera d’OlmoEarth, la plateforme d’observation de la Terre d’Ai2 fondée sur des modèles ouverts, pour annoter ses données et entraîner ses propres modèles. Les détections de navires en temps réel de Skylight arriveront dans son portail pour les gestionnaires d’aires marines, et les deux équipes feront évoluer des agents comme Shippy, auquel un analyste peut demander l’historique d’un navire. Aucun calendrier ni aucun montant n’accompagne l’annonce.
🔗 Ai2 and Global Fishing Watch unite to bring AI agents to ocean monitoring
Google.org et la Gates Foundation, pour 200 millions de petits agriculteurs
18 et 22 septembre — Rattrapage : Google.org et la Gates Foundation élargissent leur initiative commune pour mettre des outils d’IA climatiques, agricoles et linguistiques à la disposition de 200 millions de petits exploitants en Afrique subsaharienne et en Asie du Sud, contre 50 millions prévus au départ. Les deux partenaires y consacrent 100 millions de dollars de financement combiné, avec le soutien technique de chercheurs et d’ingénieurs de Google. Le communiqué de la Gates Foundation date du 18 septembre ; blog.google l’a relayé le 22 au soir. Le programme finance des acteurs locaux comme Wadhwani AI et Digital Green en Inde, intègre des prévisions IA à la plateforme climatique TomorrowNow, cartographie les parcelles à une résolution inférieure au mètre et soutient des jeux de données vocaux et textuels ouverts dans plus de 40 langues africaines. Les petits exploitants produisent près de 35 % de la nourriture mondiale.
🔗 Annonce Google.org · Communiqué de la Gates Foundation
Brèves
- Anthropic, modernisation de code — Dans la série « Notes from the Field », deux ingénieurs d’Anthropic détachés chez les clients, Jonah Ezekiel et Lexie Tonelli, proposent six étapes pour préparer une modernisation de code menée par des agents : cible, « certificat » de tests, revue humaine par paliers, prérequis, flux agentique, puis lancement. Aucun chiffre de coût : ils conseillent de le mesurer sur un pilote. 🔗 source
- Boris Cherny vérifie le Claude Agent SDK en Lean — Le 22 au soir, Boris Cherny (Claude Code) raconte avoir fait vérifier formellement le Claude Agent SDK par Opus 5.5 avec l’assistant de preuve Lean : quelques prompts courts ont produit 16 pull requests corrigeant des bugs et des situations de concurrence. Il dit utiliser aussi TLA+. 🔗 source
- Codex CLI 0.156.1 — Ce correctif de la 0.156.0 ajoute GPT-6 Sol et GPT-6 Luna au sélecteur de modèles du CLI ; l’invite affichée en cas de limite de débit recommande désormais Luna, et des migrations sont proposées depuis GPT-5.5 et GPT-5.6. 🔗 source
- Airbnb et GPT-6 Astra — Un nouvel accord élargit l’accès des équipes d’ingénierie et produit d’Airbnb aux modèles d’OpenAI, dont GPT-6 Astra, via l’API d’OpenAI et Amazon Bedrock. Son directeur technique, Ahmad Al-Dahle, affirme que ses équipes livrent environ 80 % de fonctionnalités de plus qu’il y a un an ; aucun montant n’est communiqué. 🔗 source
- OpenAI Academy a deux ans — Plus de 250 événements et plus de 4 millions de personnes touchées depuis septembre 2024 ; OpenAI teste un programme de formateurs communautaires (Community Trainer Program) où des salariés d’organisations partenaires apprennent à animer des ateliers, après une évaluation. 🔗 source
- Un afficheur LED devenu assistant vocal — Sur le blog OpenAI Developers, Sid Rampally raconte comment Codex l’a aidé à câbler et programmer un panneau LED de 128 × 64 pixels piloté par un Raspberry Pi ; GPT-Live-1 tient la conversation et délègue recherches et affichage à GPT-5.6 Luna via la Responses API. 🔗 source
- MedGemma dépasse 10 millions de téléchargements — Google détaille des usages de terrain de ses modèles médicaux ouverts : dépistage du cancer du col de l’utérus chez plus de 3 500 femmes en Zambie, pilotes à l’hôpital AIIMS de Delhi, détection de la tuberculose en Indonésie. Leurs sorties ne doivent pas guider directement un diagnostic, rappelle Google. 🔗 source
- Gemini Notebook dans Google Docs — En tapant @ dans Docs, on peut citer un notebook comme source : Gemini ancre sa rédaction dans ses sources, avec des citations en ligne, et les combine avec e-mails et fichiers via Workspace Intelligence. Disponible pour Business Standard et Plus, Enterprise Standard et Plus, Education Plus et les abonnés Google AI Pro et Ultra. 🔗 source
- Six outils Google Flow — Google Labs publie six outils bâtis avec Google Flow Tools par des créatifs : Mondo Sónico (bruitages synchronisés), CaptionCast (sous-titres animés), ThumbnailForge (vignettes), Surface (textures sur des surfaces en 3D), CollageMotion Pro et SwissFlow Studio (motion design) ; chacun peut être dupliqué et remixé. 🔗 source
- Google Beam livré en France — Beam, la plateforme de communication vidéo de Google qui vise à recréer une présence en face-à-face, vendue avec HP, est désormais livrée dans six pays, dont la France, avec 18 partenaires. Une étude interne évoque des équipes 50 % plus connectées et 21 % de réunions de suivi en moins. 🔗 source
- Android Enterprise et les agents Gemini — Gemini peut enchaîner des tâches entre applications à partir du contexte affiché à l’écran, tandis que des garde-fous empêchent les agents personnels d’accéder au profil professionnel ; les administrateurs peuvent restreindre ou désactiver l’automatisation IA sur toute leur flotte. 🔗 source
- AI Brief en français — La bêta fermée d’AI Brief, qui guide les campagnes AI Max de Google Ads avec ses propres mots, s’ouvre au français, au néerlandais, à l’allemand, à l’italien, au japonais, au portugais et à l’espagnol. 🔗 source
- Gemini CLI, nightly du 23 septembre — Il ne s’agit que d’une nightly, pas d’une version stable : elle ajoute Gemini 3.8 Flash et Gemini 3.5 Flash Lite, accessibles tout de suite par clé API, Vertex AI ou passerelle, et sous indicateurs d’expérimentation avec un compte Google. Aucune stable n’est sortie le mardi 22. 🔗 source
- EcoHash mesure ses optimisations vidéo — Sur une RTX PRO 6000 de 96 Go, EcoHash fait passer une vidéo MiniMax H3 de 174,8 à 40,8 secondes et Wan2.2 en texte vers vidéo de 132,3 à 10,7 secondes, avec une LoRA distillée en 4 étapes ; trois des dix réglages essayés, dont les deux modes de compilation, n’ont rien changé. 🔗 source
- Tatar de Crimée, un test faussé évité — Le développeur d’un modèle de reconnaissance vocale pour le tatar de Crimée a découvert que quatre livres audio figuraient deux fois dans son corpus : 96,9 % des extraits de son test principal avaient un jumeau dans l’entraînement. Après correction, un affinage LoRA et un réglage du décodeur, le taux d’erreur par mot passe de 0,3463 à 0,1701. 🔗 source
- Falcon-H1 et mlx-lm — Dans mlx-lm 0.31.3, sans cache KV, seule la première des 66 couches de Falcon-H1 s’exécute pendant l’entraînement : toute LoRA s’entraîne sans erreur ni avertissement sur un modèle à une couche. Le correctif tient en une ligne, et une issue est ouverte. 🔗 source
- Agents et contributions open source — Quentin Gallouédec (Hugging Face) estime que les contributions produites par des agents détruisent le signal d’un besoin réel et coûtent du temps de revue aux mainteneurs ; il demande d’arrêter de lâcher des agents sur des projets pris au hasard et de commencer par utiliser le projet. 🔗 source
- Phionyx à l’IETF — L’auteur de Phionyx dépose un brouillon individuel, Claim-Preserving Exchange of AI Evaluation Evidence, pour qu’un résultat d’évaluation garde ses conditions et ses limites d’un système à l’autre ; le texte n’est adopté par aucun groupe de travail. 🔗 source
- Kimi Work 3.2.12 — L’agent de bureau de Moonshot permet de sélectionner un passage dans un fichier PPT, Excel, Word ou Markdown pour le faire modifier précisément ; la limite de taille des pièces jointes disparaît. 🔗 source
- Qwen-Image-2.1 en tête des modèles ouverts — Selon Arena, Qwen-Image-2.1 devient le premier modèle ouvert en édition d’image (1 367 points, 16e au général) et en génération d’images à partir de texte (1 228 points, 17e au général). 🔗 source
- OpenTelemetry dans l’app Copilot — Les administrateurs peuvent exporter les traces des sessions d’agent de l’app GitHub Copilot (requêtes aux modèles, outils utilisés) vers leurs outils de supervision via la propriété
telemetrydemanaged-settings.json; le contenu des prompts et des réponses est exclu par défaut. 🔗 source - Copilot CLI et le C++ — Le Microsoft C++ Language Server de Copilot CLI construit désormais un index persistant des symboles de tout le projet, activé par défaut ; la première construction peut être longue et gourmande en mémoire, et GitHub ne chiffre pas le gain. 🔗 source
- Une pull request d’un million de lignes — Un billet d’ingénierie de GitHub explique comment l’app Copilot affiche une pull request de 2 200 fichiers, plus d’un million de lignes et plus de 400 commentaires, en séparant la géométrie du code, calculée d’avance, de celle des commentaires, mesurés près de la zone visible. 🔗 source
- Genspark ajoute Opus 5.5, GPT-6 et Grok 4.7 — Dans la nuit du 23, Genspark ouvre Claude Opus 5.5, Grok 4.7, GPT-6 Sol et GPT-6 Luna dans AI Chat, Code Agent et Claw, en reprenant l’argumentaire des éditeurs, sans forfait ni tarif précisé. 🔗 source
- Enquête GitHub et Yale — Sur 1 039 utilisateurs de GitHub aux États-Unis, 71 % se disent préoccupés par l’impact environnemental de l’IA et huit sur dix veulent des outils pour écrire du code plus économe en énergie ; GitHub précise que l’échantillon, issu de personnes ayant accepté ses communications marketing, n’est pas représentatif. 🔗 source
- Zed 1.21.0 — La version stable ouvre Claude Opus 5.5 et GPT-6 Astra, Sol et Luna avec sa propre clé API, ajoute la connexion SuperGrok dans le panneau Agent et empêche par défaut la mise en veille de la machine pendant qu’un agent travaille. 🔗 source
- Warp — GPT-6 Sol et Luna, puis Claude Opus 5.5, arrivent dans le terminal Warp et la Warp Agent CLI, ainsi que Grok 4.7 pour qui connecte son abonnement Grok ; simple disponibilité, sans tarif. 🔗 source
- Devin dans Microsoft Teams — Devin, jusqu’ici limité aux canaux, répond désormais en message direct et en discussion de groupe, lance des Automations depuis un canal et envoie des cartes de question ou d’approbation ; l’application ne demande aucune nouvelle permission. 🔗 source
- Scribe v2 Medical — Disponible depuis le 11 septembre, le modèle de transcription clinique d’ElevenLabs reçoit son annonce officielle, avec un chiffre nouveau : 35 % d’erreurs de mots en moins sur l’audio clinique face à Scribe v2. Il est facturé à partir de 0,22 dollar de l’heure. 🔗 source
- Sora 2 quitte ElevenLabs — ElevenLabs retire Sora 2 et Sora 2 Pro de son studio, car OpenAI ferme l’API Sora le 24 septembre, une échéance annoncée par OpenAI le 24 mars ; les flux concernés doivent passer à un autre modèle vidéo, comme Gemini Omni 1.1 Flash. 🔗 source
- Cohere Model Vault au Canada — Cohere annonce que Model Vault, sa plateforme d’inférence dédiée à locataire unique, est disponible au Canada, sans préciser région cloud, fournisseur ni tarif ; la page produit ne mentionne pas encore le Canada. 🔗 source
- Cohere et la conduite du changement — Un billet de Katherine Correia (Cohere) invite à intégrer l’IA comme un participant plutôt qu’un simple outil, à classer les tâches en vérifiables, de jugement ou hybrides, et à gouverner par cas d’usage ; ni produit ni chiffre. 🔗 source
Ce que ça signifie
Le résultat d’Anthropic emmène les agents du code vers la biologie fondamentale. Environ 950 agents Claude ont trié plus de 200 000 transcriptases inverses en 21 heures, et les humains ne sont intervenus qu’au début, avec un prompt, et à la fin, pour les expériences. Le goulet se déplace vers le tri des hypothèses, qu’Anthropic étudie désormais comme un objet de recherche. La prudence reste de rigueur : la fonction d’ART est inconnue et le résultat prend pour l’instant la forme d’un pré-print. La même logique d’agents lancés en nombre et cadrés par des mesures se retrouve dans le sprint qui a accéléré claude.ai, avec plus de 3 000 changements, et dans la vérification formelle du Claude Agent SDK en Lean.
La sécurité des bacs à sable d’agents devient un sujet public. L’audit de Perplexity sépare deux frontières : l’isolation de la machine virtuelle a tenu dans les 108 essais, le filtrage réseau a cédé 11 fois sur 54 face à des modèles qui ont exploité un DNS mal vérifié ou les adresses partagées d’un CDN, et 8 plateformes tierces sur 10 présentaient au moins un contournement. Deux modèles, Fable et GPT-6 Astra, ont refusé l’exercice. Le même jour, l’app GitHub Copilot livre un bac à sable local qui préfère échouer plutôt que tourner sans protection, le mode auto de Claude Code soumet au classifieur jusqu’aux commandes en lecture seule, et Vibe CLI et Kimi Code ferment des contournements d’autorisation ; deux jours plus tôt, ZCode avait ouvert son code après des problèmes signalés par sa communauté.
La voix devient une interface pour agir. Gemini 3.8 Flash TTS et Flash-Lite TTS rendent la sortie audio plus de deux fois moins chère que la préversion précédente (9 et 6 dollars par million de tokens jusqu’à fin 2026, contre 20) et ajoutent une réplication de voix encadrée par un consentement enregistré, indisponible dans l’Espace économique européen via AI Studio. Qwen annonce des baisses de 70 à 95 % sur sa pile audio, NVIDIA ouvre un modèle qui distingue huit locuteurs, et Basis publie 1 500 heures de conversations où les voix se chevauchent. En face, ChatGPT Voice passe de la conversation à l’action, avec les plugins et les tâches de ChatGPT Work.
Enfin, l’IA physique s’ouvre, avec des nuances. FLUX 3 Action place un modèle de 7 milliards de paramètres en tête de RoboLab-120, l’intègre à LeRobot avec NVIDIA et montre qu’une politique rapide et fiable réduit le besoin de raisonnement coûteux : 8,77 dollars par succès avec GPT-6 Astra en superviseur, contre 13,47 pour Astra seul. Mais « ouvert » recouvre des réalités différentes : une licence propre pour FLUX 3 Action comme pour Basis Conversations 1500, une licence non commerciale pour QVAC Genesis III, des benchmarks publiés sans les poids pour Qwen Intelligence. Pour qui veut réutiliser ces ressources, la licence compte autant que le score.
Sources
- Claude discovers a novel enzyme system with CRISPR-like repeats (Anthropic)
- Pré-print ART (PDF, Anthropic)
- @AnthropicAI : le système enzymatique découvert par Claude
- Gemini 3.8 Flash TTS et Flash-Lite TTS (Google)
- Notes de version de l’API Gemini, 22 septembre
- Tarifs de l’API Gemini
- FLUX 3 Action (Black Forest Labs)
- @bfl_ai : lancement de FLUX 3 Action
- Collection FLUX 3 Action sur Hugging Face
- Escaping SPACE, Part I (Perplexity)
- Claude Code v2.1.281
- How we made claude.ai 3x faster in two weeks (claude.dev)
- Claude Marketplace (Anthropic)
- @OpenAI : ChatGPT Voice avec les plugins et dans ChatGPT Work
- Article d’aide ChatGPT Voice
- Notes de version de ChatGPT
- Introducing MentalHealthBench (OpenAI)
- SWE-Serve (NVIDIA)
- Dépôt NVIDIA/swe-serve
- Runway is Now in DaVinci Resolve
- Gemini Omni 1.1 Flash dans Google Vids
- Made On YouTube 2026
- Récapitulatif de Made On YouTube 2026 (Google)
- Nouvelles applications connectées de Gemini
- @GeminiApp : 13 nouvelles applications connectées
- @Muse : quatre connecteurs à venir
- @ElevenLabs : ElevenLabs arrive dans Muse
- @HeyGen : HeyGen rejoint Muse
- @grok : Grok Bot dans les Tesla
- @Tesla : Grok et les Connectors
- @bot : Grok Bot relié à Google Slides, Sheets et Docs
- Modèles locaux dans le SDK Antigravity (Google Developers)
- Changelog Antigravity
- Mémoire persistante pour Private AI Compute (Google DeepMind)
- @Alibaba_Qwen : Qwen Intelligence
- Rapport Qwen-Planner-Agent
- @Alibaba_Qwen : Qwen-Audio-3.1
- Qwen-Audio-3.1-Realtime sur QwenCloud
- Notes de version de Mistral
- Vibe CLI 2.25.8
- @zcode_ai : ouverture du code de ZCode
- Dépôt zai-org/ZCode
- Kimi Code 2.1.0
- DeepSeek Harness v0.1.7-rc.1
- GenCode (Genspark)
- @genspark_ai : lancement de GenCode
- Copilot pour JetBrains 1.18.0 (GitHub Changelog)
- Bac à sable local dans l’app GitHub Copilot (GitHub Changelog)
- Rollouts et Security Review (changelog Cursor)
- Improved token efficiency (Cursor)
- Nemotron 3 Diarization (NVIDIA, blog Hugging Face)
- AI Day Singapore (NVIDIA)
- Canary rollouts (Together AI)
- NVIDIA Cluster Readiness Engine (NVIDIA)
- NodeWright (NVIDIA)
- Basis Conversations 1500 (blog Hugging Face)
- QVAC Genesis III (blog Hugging Face)
- Ai2 et Global Fishing Watch (Skylight)
- Google.org et la Gates Foundation (blog.google)
- Communiqué de la Gates Foundation
- How to prepare for AI-driven code modernization projects (Anthropic)
- @bcherny : vérification formelle du Claude Agent SDK en Lean
- Codex CLI 0.156.1
- Airbnb et GPT-6 Astra (OpenAI)
- Two years of OpenAI Academy
- Bringing my LED display to life (OpenAI Developers)
- MedGemma et la santé mondiale (Google)
- Gemini Notebook dans Google Docs (Workspace Updates)
- Six outils Google Flow (Google Labs)
- Google Beam s’étend à six pays (Google)
- Nouveautés Android Enterprise 2026 (Google)
- AI Brief et AI Max (Google Ads)
- Gemini CLI v0.62.0-nightly.20260923
- Three of ten optimisations did nothing (EcoHash)
- Reconnaissance vocale du tatar de Crimée (blog Hugging Face)
- Fine-tuning Falcon-H1 on a Mac (blog Hugging Face)
- The Road to Open Source Hell Is Paved With Good Intentions (blog Hugging Face)
- The Dashboard Says PASS. What Exactly Passed? (Phionyx)
- Notes de version de Kimi Work
- @arena : Qwen-Image-2.1 premier modèle ouvert
- OpenTelemetry dans l’app GitHub Copilot
- Intelligence de code C++ dans Copilot CLI
- Rendering huge pull requests in the GitHub Copilot app
- @genspark_ai : Claude Opus 5.5 dans Genspark
- Enquête GitHub et Yale sur l’efficacité logicielle
- Zed 1.21.0
- @warpdotdev : GPT-6 Sol et Luna dans Warp
- Devin, Microsoft Teams et Microsoft 365
- @ElevenLabs : Scribe v2 Medical
- Changelog ElevenLabs du 23 septembre
- @cohere : Model Vault au Canada
- AI change management (Cohere)