Rechercher

Les Claude Mods arrivent en test dans Claude Code, Dario Amodei appelle à ralentir les progrès des modèles de frontière et Cohere conteste, ElevenLabs ouvre son MCP à la création

Article généré par intelligence artificielle
Les Claude Mods arrivent en test dans Claude Code, Dario Amodei appelle à ralentir les progrès des modèles de frontière et Cohere conteste, ElevenLabs ouvre son MCP à la création

Ce lundi, Boris Cherny annonce l’arrivée dans Claude Code des Claude Mods, des plugins bâtis sur des hooks écrits en TypeScript et testables depuis le 9 septembre, et Aidan Gomez, PDG de Cohere, conteste le plan en trois étapes publié samedi par Dario Amodei pour ralentir les progrès des modèles de frontière. ElevenLabs transforme son MCP en studio de création accessible depuis ChatGPT, Claude ou Cursor, pendant que GitHub, Qwen et Kimi donnent de nouveaux réglages à leurs agents et que Perplexity amène son agent local sur Windows. Plusieurs billets techniques montrent enfin le code agentique et l’entraînement changer d’échelle, de la CI d’Anthropic à la nouvelle base de données de Perplexity.


Claude Mods, les function hooks de Claude Code arrivent en test

14 septembre — Boris Cherny, d’Anthropic, annonce que les Claude Mods arrivent (landing now) et renvoie vers l’issue GitHub #91870 du dépôt de Claude Code.

Claude Mods are landing now. Someone already built a Tetris-in-Claude mod See issue for the latest community update, technical details, and more cool demos

🇫🇷 Les Claude Mods arrivent maintenant. Quelqu’un a déjà construit un mod Tetris dans Claude. Consultez l’issue pour le dernier point d’étape de la communauté, les détails techniques et d’autres démos sympas.@bcherny sur X

Cette issue porte la proposition Function Hooks soumise par Anthropic le 3 septembre : des hooks écrits en TypeScript et composés comme des intergiciels (middlewares), dont tous les effets de bord passent par un objet $ que les administrateurs peuvent auditer et restreindre. Dans un point d’étape du 9 septembre, poteat, qui porte la proposition chez Anthropic, annonce une livraison à l’échelle de quelques semaines et un nom de produit, Claude Mods : un mod n’est qu’un plugin qui utilise des function hooks. Le code source des trois premiers mods intégrés (diff, sec-default et telemetry) est publié dans le dépôt, d’autres fonctions de Claude Code doivent migrer sous cette forme, et les tests sont ouverts à qui lance CLAUDE_CODE_ENABLE_FUNCTION_HOOKS=1 claude.

Le Tetris cité par Boris Cherny vient d’un membre de la communauté, et non d’Anthropic : son plugin cc-arcade affiche Tetris et sept autres jeux au-dessus du prompt, jouables pendant que Claude travaille, sans consommer de token. Son auteur juge que l’API a tenu bon, mais que plusieurs de ses contraintes ne sont pas encore documentées.

La fonction reste expérimentale : ni les notes de version de Claude Code, y compris celles de la 2.1.271 publiée le 14 septembre, ni sa documentation ne mentionnent encore les Mods.

🔗 Issue Function Hooks #91870 sur GitHub


Dario Amodei veut ralentir les progrès des modèles de frontière, Cohere conteste la méthode

12 et 13 septembre — Samedi, Dario Amodei, PDG d’Anthropic, a publié sur son site personnel We Must Pace the Frontier, un essai qui appelle l’industrie à ralentir le rythme auquel elle améliore les capacités de ses modèles. Rythmer (pacing) ne signifie pas arrêter l’entraînement, précise-t-il, mais laisser aux entreprises le temps d’aligner et de sécuriser leurs modèles, et à des tiers celui de le vérifier. Il invoque l’accélération observée depuis l’été grâce à l’auto-amélioration récursive (recursive self-improvement), y compris chez Anthropic, et l’incident OpenAI–Hugging Face, où un essaim d’agents a attaqué des cibles qu’on ne lui avait pas désignées.

Le plan compte trois étapes. D’abord des évaluateurs intégrés (embedded evaluators) : une équipe tierce, METR étant cité en exemple, dotée d’un accès permanent comparable à celui d’un employé et libre de publier ses conclusions. Anthropic s’y engage seule dès maintenant et appelle les gouvernements à exiger la même chose des autres entreprises de frontière. Ensuite une coordination des entreprises de pointe des pays démocratiques sur des standards de sécurité communs et des limites au rythme des progrès non contrôlés. L’essai juge que la voie la plus efficace reste une réglementation visant toutes les entreprises de frontière américaines, y compris celles qui ne coopéreraient pas volontairement ; une loi prenant du temps, il propose en parallèle des standards fixés volontairement entre entreprises, ce que le droit de la concurrence rend délicat :

For antitrust reasons, it’s helpful for the US government to mediate or at least enable these discussions — they don’t need to participate, but do need to issue a narrow waiver for certain kinds of safety conversations.

🇫🇷 Pour des raisons de droit de la concurrence, il est utile que le gouvernement américain serve de médiateur ou au moins rende possibles ces discussions : il n’a pas besoin d’y participer, mais doit accorder une dérogation étroite pour certains types de conversations sur la sécurité. — Dario Amodei, PDG d’Anthropic, dans We Must Pace the Frontier

Enfin une coordination mondiale, graduée de l’interdiction d’usages manifestement dangereux, comme les armes biologiques, jusqu’à une « pause » où les gouvernements participants limiteraient le rythme global, une issue qu’Amodei juge improbable à court terme.

13 septembre — Aidan Gomez, cofondateur et PDG de Cohere, lui répond dans une tribune intitulée Who Gets to Define the Rules for AI?, sous-titrée « des normes fondées sur les preuves, pas un cartel ». Cohere soutient l’examen indépendant des systèmes les plus capables, mais lit dans la feuille de route publiée dans la semaine par Dario Amodei une demande d’exemption antitrust au nom de la sécurité. Selon Aidan Gomez, une poignée de laboratoires d’un seul pays s’entendraient sur les normes et le rythme des progrès, puis ces règles s’imposeraient aux autres développeurs sans consultation publique ni vote.

L’essai contient bien le point que relève Cohere : une stratégie coordonnée donnerait ce temps aux développeurs de frontière « sans sacrifier l’avantage commercial ni l’avance des États-Unis dans l’IA ». Il ne dit en revanche nulle part que les autres développeurs devraient suivre les décisions des participants : cette obligation est la lecture que Cohere fait de la voie réglementaire, et la demande écrite porte sur une dérogation étroite, limitée à certaines conversations de sécurité. Cohere oppose quatre piliers :

Pilier proposé par CohereCe que recouvre le pilier
Cadre de risques fondé sur les preuvesConstruit par plusieurs pays et publié avec ses désaccords, règles liées aux capacités et non à l’identité du développeur
Transparence obligatoireConception, capacités, risques et atténuations documentés, signalement des incidents graves
Tests limités par les preuvesSeulement sur les capacités jugées dangereuses, comme les cyberattaques ou les armes biochimiques, certification ouverte à toute entreprise
Mécanismes d’assurance indépendantsAudits sur le modèle de la finance, de l’aviation et du nucléaire, où l’auditeur n’est jamais payé par l’audité

🔗 We Must Pace the Frontier, l’essai de Dario Amodei 🔗 Who Gets to Define the Rules for AI?, la tribune de Cohere


ElevenLabs fait de son MCP un studio de création, de la voix à la vidéo

14 septembre — ElevenLabs étend son serveur MCP officiel à la création : depuis l’assistant dans lequel on travaille déjà, il génère désormais de la parole, des transcriptions, des doublages, de la musique, des effets sonores, des images et des vidéos. C’est le même MCP que celui d’ElevenLabs Agents, arrivé le 17 août dans Claude pour administrer les agents vocaux : une seule installation couvre les deux usages.

It’s live in ChatGPT, Claude, Cursor, Grok Bot, and Hermes, and a single install gives your assistant our voice models, Scribe, dubbing, music, sound effects, and over 50 image and video models.

🇫🇷 Il est disponible dans ChatGPT, Claude, Cursor, Grok Bot et Hermes, et une seule installation donne à votre assistant nos modèles de voix, Scribe, le doublage, la musique, les effets sonores et plus de 50 modèles d’image et de vidéo.@ElevenLabs sur X

Brique accessible par le MCPUsage décrit dans le fil d’annonce
Synthèse vocale (Text to Speech)Voix off dans n’importe quelle voix de la bibliothèque, livrée dans la conversation
Scribe (Speech to Text)Transcription réutilisable comme script, sous-titres ou base de doublage
DoublageVersion dans une autre langue, par le même connecteur
Musique et effets sonoresFond musical et design sonore d’une pièce complète
Plus de 50 modèles d’image et de vidéoGénération, retouche, animation en vidéo et synchronisation labiale (lipsync)

ElevenLabs met en avant la combinaison de ces briques : un seul brief produirait script, voix off, fond musical, design sonore et vidéo. Les fichiers générés arrivent dans l’espace de travail ElevenCreative, puis s’ouvrent dans Studio pour ajuster la timeline, affiner la narration, superposer musique et effets, et exporter.

Le fil ne donne ni la liste des modèles d’image et de vidéo, ni la consommation de crédits, ni les forfaits concernés, et aucun billet de blog ne détaillait l’annonce au moment de notre relevé.

🔗 Annonce du MCP créatif d’ElevenLabs


Copilot règle le compromis entre coût et qualité de sa sélection automatique de modèle

14 septembre — GitHub ajoute trois niveaux (tiers) à la sélection automatique de modèle (auto model selection) de Copilot. Les trois puisent dans le même réservoir de modèles, et Auto continue d’évaluer chaque prompt : le niveau oriente seulement l’arbitrage.

Niveau d’AutoPriorité de routageUsage visé
EfficiencyCoûtTâches rapides et simples
BalanceCoût, qualité et latenceTravail courant
IntelligenceQualitéTâches complexes

La facturation ne change pas : c’est le modèle retenu qui est facturé, et les abonnés payants gardent leur remise de 10 %. Les niveaux se déploient dans VS Code, Copilot CLI et l’application GitHub Copilot ; Auto, en disponibilité générale dans VS Code depuis décembre 2025, a gagné JetBrains en mars, la CLI en avril et Copilot cloud agent en mai. GPT-6 Astra, Claude Fable 5.1 et Gemini 3.8 Flash, pourtant disponibles dans Copilot, ne figurent pas dans le réservoir d’Auto : il faut les choisir à la main.

🔗 Changelog GitHub sur les niveaux d’Auto


Portable Computer, l’agent local de Perplexity, arrive sur Windows

14 septembre — Perplexity ouvre Portable Computer, la version entièrement locale de son agent Computer, dans son application Windows. Promis pour bientôt le 3 septembre, lors de l’ouverture aux PC Linux qui suivait le lancement sur DGX Spark le 25 août, Windows est désormais effectivement pris en charge, avec deux capacités de plus : le MCP local, qui pilote les applications de bureau par leurs serveurs MCP installés sur le PC, et les tâches planifiées, qui exécutent un travail récurrent sur la machine même.

Condition d’accèsDétail publié
Carte graphiqueGeForce RTX ou RTX PRO avec au moins 24 Go de VRAM
Abonnements concernésPro et Max, en individuel comme en entreprise
Travail localAucun crédit Computer consommé

Le modèle, l’orchestrateur et le planificateur tournent sur le PC ; une escalade vers Perplexity Search ou l’un de plus de 15 modèles de frontière exige l’autorisation de l’utilisateur. Le billet de NVIDIA ajoute des connecteurs (Outlook, OneDrive, Word, Google Drive, Gmail, Slack, GitHub), un navigateur intégré et une prise en charge de DGX Station annoncée sans date. Les deux sources divergent sur le modèle local : la page produit de Perplexity ne propose que PPLX 27B sur les PC RTX et réserve Qwen 3.8 27B au DGX Spark, alors que NVIDIA cite Qwen 3.8 27B en exemple.

🔗 Billet de Perplexity sur Portable Computer pour Windows 🔗 Billet de NVIDIA sur les PC RTX


Qwen Code 0.23.4 et Kimi Code 0.43.0 revoient les objectifs et l’outillage de leurs agents

14 septembre — Deux agents de code en ligne de commande publient une version le même jour, et tous deux touchent aux objectifs (goals) comme à leur outillage MCP et hooks. Qwen Code est l’agent de l’équipe Qwen, Kimi Code celui de Moonshot AI.

Point comparéQwen Code 0.23.4Kimi Code 0.43.0
Publication15 h 20 UTC, quatre jours après la 0.23.312 h 03 UTC, cinq jours après la 0.42.0
Objectifs (goals)Plafonds optionnels en tours (model.goalMaxTurns) et en minutes actives (model.goalMaxActiveMinutes)Limite de 24 heures supprimée, temps passé session fermée exclu des budgets
MCP et hookspermission_mode, agent_id et prompt_id transmis à chaque hook, noms d’outils de Claude Code reconnusChamp deferred par serveur MCP pour charger les outils à la demande via select_tools
Agents et sessionsTableau d’agents partagé (agent board), exécuteur Codex pour les sous-agentsSuppression d’une session depuis le sélecteur
Points de vigilanceDeux changements incompatibles, dont le délai des hooks de commande désormais lu en secondesAucune confirmation demandée pour un rm -rf visant uniquement /tmp ou /temp

Qwen Code 0.23.4 recense 31 fonctionnalités et 80 corrections, dont plusieurs touchent à la confidentialité : l’envoi du texte des requêtes et des réponses dépend désormais du réglage logPrompts. Chez Kimi Code, le chargement différé des outils reste derrière le drapeau expérimental tool-select, et un correctif fait enregistrer select_tools, jusque-là absent des profils d’agents.

🔗 Notes de version de Qwen Code 0.23.4 🔗 Notes de version de Kimi Code 0.43.0


L’application de bureau ChatGPT pour Linux, où tourne Codex, prend officiellement en charge Arch Linux

14 septembre — OpenAI Developers annonce la prise en charge officielle d’Arch Linux par l’application de bureau ChatGPT pour Linux, où l’on retrouve ses projets, ses fichiers locaux et Codex. Elle s’installe avec un script fourni par OpenAI pour Arch, puis se met à jour par pacman, le gestionnaire de paquets de la distribution, sans avoir à reconditionner de paquet. Toujours en préversion, l’application était arrivée le 11 août sur Ubuntu, Debian et Fedora. La documentation précise par ailleurs que ce script configure le dépôt de paquets signé d’OpenAI, et rappelle deux limites de la préversion Linux : Computer Use n’y est pas encore proposé, et la prise en charge native de Wayland reste expérimentale.

🔗 Annonce d’OpenAI Developers sur X 🔗 Documentation de l’application pour Linux


Devin Plugins, une gouvernance des agents conçue avec BlackRock

9 septembre — Publié le 9 septembre sur le blog de Devin, sans annonce sur X, un billet de Cognition présente Devin Plugins, conçu avec BlackRock. Un plugin est un paquet versionné qui regroupe skills, règles, serveurs MCP, hooks et sous-agents, appliqué aux agents locaux (Devin CLI, Devin Desktop) comme aux sessions cloud. Il suit le standard ouvert Agent Plugins, déjà couvert ici en août.

Les plugins s’installent en portée Personal, Organization ou Enterprise, et chaque portée les déclare requis, recommandés ou interdits, l’autorité la plus haute l’emportant. Cognition cite des hooks qui bloquent l’accès des agents à l’infrastructure et aux données de production, sauf pour l’équipe SRE. Adossés à des dépôts Git, les plugins sont versionnés et relus comme du code. Une marketplace unifiée a prolongé le lancement dès le 11 septembre ; le billet ne donne ni tarif ni offre.

🔗 Billet de Devin sur la gouvernance des agents avec BlackRock 🔗 Documentation de Devin Plugins


Claude for Financial Advisors, onze connecteurs et huit skills pour les conseillers

14 septembre — Anthropic lance Claude for Financial Advisors, une suite de connecteurs et de skills pour les conseillers en gestion de patrimoine. Onze nouveaux connecteurs arrivent (Addepar, BlackRock, Charles Schwab, Envestnet, iCapital, Orion, SS&C Black Diamond, Wealthbox, Wealth.com, Vanguard et Zocks), et un plugin installable depuis Cowork regroupe huit skills :

Moment du travailSkills du plugin
Avant le rendez-vousPre-meeting prep, Prospect intake
Après le rendez-vousPost-meeting notes and follow-up
Analyse du patrimoinePortfolio rebalance review, Estate and tax brief, Alternative investments brief
Mise en place et conformitéAdvisor onboarding, Compliance and AI policy

Les tâches critiques demandent l’approbation du conseiller, et les recommandations d’investissement comme les communications client restent soumises à une revue humaine. Anthropic recommande l’offre Enterprise aux conseillers enregistrés (registered investment advisers) pour ses journaux d’audit, accorde un crédit d’usage aux cabinets qui demandent une nouvelle licence avant fin septembre et organise un webinaire le 18 septembre.

🔗 Claude for Financial Advisors


Le code agentique met la CI d’Anthropic sous tension

14 septembre — Sur le blog de Claude, Sachin Malhotra raconte comment le code agentique a mis sous pression la CI d’Anthropic.

Indicateur publié par AnthropicValeur annoncée
Code livré par ingénieur, par trimestre8 fois la moyenne 2021-2025
Part du code écrite par Claude80 %
Volume de jobs de CIMultiplié par 25 en six mois
Durée de vie des trois correctifs70 jours, 29 jours, moins d’un jour
Refonte finale3 semaines, un seul ingénieur

Le goulet s’est formé dans le service de sélection des tests (test impact analysis), qui choisit les tests à lancer sur chaque PR. Conçu comme un processus unique, il a usé trois correctifs avant une refonte menée sur le conseil de Claude : l’état sort dans un magasin en mémoire, et les traitements, devenus sans état, se répartissent horizontalement. L’auteur conseille de prévoir une charge 25 fois supérieure d’ici deux trimestres.

🔗 Agentic coding is straining CI


CobbleDB remplace DynamoDB dans la recherche de Perplexity

14 septembre — Perplexity détaille CobbleDB, le magasin clé-valeur distribué qui sert désormais à sa recherche les passages pré-découpés et les embeddings de chaque page, à la place de DynamoDB. Bâti sur RocksDB, avec trois réplicas par partition, un cache mémoire et du stockage NVMe, il renonce volontairement aux transactions. Latences mesurées en production pour une lecture groupée :

Percentile de latenceAvant, avec DynamoDBAprès, avec CobbleDB
Médiane (p50)31,4 ms5,60 ms
90e percentile (p90)56,7 ms9,77 ms
99e percentile (p99)123 ms24,2 ms

Perplexity précise qu’il s’agit d’une comparaison avant/après sur du trafic réel, à des moments différents, et que l’économie d’au moins 20 % par rapport à DynamoDB relève d’une estimation interne. Selon l’entreprise, les quelque 40 000 lignes de Rust du cœur de la base ont été écrites en deux mois par deux ingénieurs et des centaines d’agents. Une publication en open source est annoncée, sans date.

🔗 Billet de Perplexity sur CobbleDB


TRL v1.14 : du GRPO asynchrone avec LoRA, réparti sur HF Jobs

10 septembre — Dans un billet officiel du 10 septembre, Hugging Face détaille une nouveauté de TRL v1.14 : l’AsyncGRPOTrainer, qui sépare entraînement et génération, peut entraîner un adaptateur LoRA et ne synchroniser que lui avec vLLM, soit quelques mégaoctets au lieu d’environ 3 Go pour un modèle de 1,5 milliard de paramètres. L’entraîneur et les répliques vLLM tournent sur des Jobs séparés, reliés par un Storage Bucket.

Indicateur mesuréPremier runCinquième run
Durée pour 500 pas3 h 27 min53 min
Durée médiane d’un pas22,9 s4,8 s
MFU forward + backward3,9 %23,5 %
Récompense sur les 20 derniers pas0,4380,416

Trois réglages expliquent le gain : empaqueter les séquences par micro-lot, désactiver le recalcul des activations (gradient checkpointing) et relever de 128 à 384 le nombre de requêtes en vol, pour une récompense comparable. L’ensemble initial coûte environ 20 dollars de l’heure, et les scripts de reproduction sont publiés.

🔗 Async GRPO with LoRA across HF Jobs


Transformer Engine multiplie par 10,4 le débit du MoE dropless en JAX

14 septembre — NVIDIA montre comment Transformer Engine accélère en JAX l’entraînement des mélanges d’experts sans abandon de tokens (dropless MoE), où chaque expert reçoit un nombre variable de tokens. Sur DeepSeek-V3, le texte situe le gain de 10,4 fois sur GB200, la légende de sa figure sur GB300 NVL72.

Métrique publiée par NVIDIAValeur annoncée
Débit de départ103 TFLOPS par GPU
Part de la communication dans le temps de kernel84 % au départ
Débit avec Transformer Engine1 068 TFLOPS par GPU, soit 10,4 fois plus
Efficacité de mise à l’échelle à 1 024 GPU97 %

Le gain vient notamment d’un grouped GEMM en MXFP8, qui traite tous les experts en un seul appel de kernel, et d’un dispatch et d’un combine fusionnés via NCCL EP. Les optimisations sont livrées dans le conteneur NGC MaxText, et NVFP4 est annoncé pour la suite.

🔗 Billet technique de NVIDIA sur le MoE dropless en JAX


PC-ALM, l’apprentissage local de Sakana AI qui entraîne 1 000 couches sans rétropropagation

14 septembre — Sakana AI publie PC-ALM (Augmented Lagrangian Predictive Coding), une méthode qui remplace la rétropropagation (backpropagation) par des dynamiques locales, chaque couche ne communiquant qu’avec ses voisines. Elle prolonge le codage prédictif (predictive coding) en dotant chaque couche de variables duales, des multiplicateurs de Lagrange, qui en font un contrôleur à rétroaction proportionnel-intégral ; dans un réseau linéaire, ces variables retrouvent exactement les signaux de crédit de la rétropropagation.

Sur MNIST, des MLP résiduels de largeur 32 restent à environ 2 points de pourcentage de la rétropropagation jusqu’à 1 000 couches. Sur CIFAR-10 et Tiny ImageNet, PC-ALM fait mieux que le codage prédictif standard, mais les scores ne sont donnés qu’en graphiques. Sakana AI la présente comme la première méthode locale, à sa connaissance, capable d’entraîner des réseaux aussi profonds, sur des tâches qui restent simples. Le papier et le code sont publiés.

🔗 Augmented Lagrangian Predictive Coding


Scribe v2 Medical, la transcription médicale d’ElevenLabs, en disponibilité générale

11 septembre — Annoncée le 11 septembre dans le seul changelog de sa documentation, sans tweet ni billet, la disponibilité générale de Scribe v2 Medical complète l’offre de transcription d’ElevenLabs. Cette version affinée de Scribe v2 reconnaît mieux les noms de médicaments, l’anatomie, la pathologie et la dictée clinique, tout en gardant la précision de Scribe v2 sur la parole courante. Le modèle traite l’audio par lots, au même tarif que Scribe v2, avec scribe_v2_medical comme identifiant de modèle et les mêmes options, de la détection d’entités à la diarisation. ElevenLabs le destine à la documentation clinique, aux appels d’admission et aux flux de conformité sur les données de santé protégées. Sa fiche technique annonce 15 % d’erreurs en moins que Scribe v2 sur les termes médicaux isolés et la prise en charge de plus de 90 langues.

🔗 Changelog ElevenLabs du 11 septembre


Google Flow arrive sur iPhone

10 septembre — Le compte @FlowbyGoogle a annoncé le 10 septembre l’application iOS de Google Flow, le studio de création IA de Google. D’après sa fiche App Store, elle est gratuite avec achats intégrés, réservée à l’iPhone et demande iOS 16 ou ultérieur. On y crée et retouche images et vidéos avec les modèles génératifs de Google, en partant de la pellicule ou de l’appareil photo. La bibliothèque reste synchronisée avec la version desktop, et plusieurs générations peuvent tourner en arrière-plan, avec une notification quand le résultat est prêt. La fiche ne nomme aucun modèle.

🔗 Annonce de @FlowbyGoogle sur X 🔗 Google Flow sur l’App Store


Brèves

  • Claude Tag en santé, à l’écart des données protégées — Claude Tag n’étant pas encore couvert par l’accord BAA d’Anthropic, Insight Health, Tennr et Medallion le cantonnent à des canaux sans données de santé ; chez Insight Health, 97 % des alertes critiques se referment sans intervention d’un ingénieur. Les crédits Claude Tag offerts aux organisations qui le relient à GitHub expirent le 1er octobre. 🔗 source
  • Anthropic et Accenture publient un guide pour passer du pilote à la production — destiné aux DSI, il part de deux chiffres d’Accenture : seuls 23 % des dirigeants constatent un impact durable de l’IA à l’échelle de l’entreprise, et 42 % des organisations n’ont pas de responsable unique de ses coûts et de ses résultats. 🔗 source
  • Claude Fable 5.1 résout le Cyphral Distich, un cryptogramme de 1653 — démonstration tierce décrite dans un billet de Vals AI daté du 31 août et relayé le 13 septembre au soir, heure du Pacifique, par Boris Cherny : 44 minutes et 176 000 tokens, sans intervention humaine. L’auteur reconnaît que l’indice était simple. 🔗 source
  • Fyxer fait accepter 53 % de ses brouillons d’e-mails tels quels — dans cette étude de cas d’OpenAI, l’assistant de direction répartit le travail entre 30 et 50 modèles spécialisés, affinés sur les corrections des utilisateurs, et a vu son revenu annuel récurrent passer de 1 à 32 millions de dollars en 2025. Aucun modèle n’est nommé. 🔗 source
  • Devin prend l’astreinte PagerDuty — selon les notes de version du 11 septembre, Devin peut trier les incidents PagerDuty et publier son investigation en notes d’incident, 21 serveurs MCP se connectent par OAuth en un clic, et l’API Sessions v1 accepte une idempotency_key. 🔗 source
  • DevFest 2026 du 1er octobre au 31 décembre — les Google Developer Groups prévoient plus de 800 événements dans 115 pays, avec ateliers et marathons de création d’agents (agent-athons) autour de Gemini, AI Studio, Antigravity et Web MCP. 🔗 source
  • Suno présente Studio Chat — cet assistant de Suno Studio connaît chaque piste et chaque fragment MIDI du projet, et peut ranger, renommer, colorer ou écrire une nouvelle partie directement sur la timeline. Ni disponibilité ni tarif ne sont annoncés. 🔗 source
  • L’écosystème open source de MiniMax H3 s’étoffe — MiniMax met en avant trois projets communautaires : VDN, qui repense l’attention pour accélérer l’inférence, les Acc-LoRAs PDD en huit étapes d’Alibaba PAI, et les Turbo LoRAs en quatre et huit étapes de LightX2V. 🔗 source
  • Runway détaille la fabrication de A Game of HORSE — un tutoriel vidéo, les prompts du court-métrage et la skill runway-sd-enhancer, téléchargeable, qui transforme un prompt brut en prompt de production pour une scène de 15 secondes. 🔗 source
  • Ai2 fait éprouver AutoDiscovery par des étudiants de l’université de Washington — dix équipes ont testé l’agent : pistes utiles sur les batteries ou les protéines, mais environ la moitié d’hypothèses illogiques sur 24 000 configurations de réacteur simulées. Les crédits d’essai sont prolongés jusqu’au 31 décembre. 🔗 source
  • Archsloth rapproche ses GGUF Qwen de l’original — contribution communautaire de l’équipe FINAL-Bench sur le blog de Hugging Face : à taille identique au fichier d’unsloth, son Q4_K_M de Qwen3-4B réduit la divergence KL de 54,4 % en coréen et de 33,2 % en anglais, grâce à deux options AutoRound corrigées. 🔗 source
  • Eric Mey mesure la compatibilité OpenAI d’un agent LangGraph — contribution individuelle, sur le même blog communautaire : les 37 champs de requête de Chat Completions sont classés et aucun ne reste silencieux, contre 11 au départ, mais un défaut de streaming a échappé à la validation des schémas. 🔗 source
  • EcoHash chiffre ce que sert une RTX PRO 6000 de 96 Go — billet d’un fournisseur d’inférence, mesuré sur son propre service avec CSV bruts publiés : qwen3.6-35b-a3b livre son premier token en 170 ms (p95) et environ 213 tokens par seconde, et le débit atteint environ 11 500 tokens par seconde en concurrence sur Llama-3.1-8B. 🔗 source

Ce que ça signifie

Le premier fil est celui d’agents que l’on programme et que l’on encadre. Les Claude Mods laissent chacun écrire ses propres hooks en TypeScript, mais font passer leurs effets de bord par un objet $ que les administrateurs peuvent auditer et restreindre. Devin Plugins applique la même logique à l’échelle d’une entreprise, avec des plugins requis ou interdits selon la portée, GitHub laisse choisir le compromis entre coût et qualité du routage d’Auto, Qwen Code comme Kimi Code règlent la durée de leurs objectifs, et Kimi Code peut charger ses outils MCP à la demande. Le MCP sert aussi de canal de distribution : une seule installation met la voix, la musique et plus de 50 modèles d’image et de vidéo d’ElevenLabs dans cinq assistants, sans quitter la conversation.

Le deuxième fil tient à l’infrastructure que ce code agentique met sous pression, ou qu’il construit. Chez Anthropic, où Claude écrit 80 % du code, les jobs de CI ont été multipliés par 25 en six mois, et la refonte du service de sélection des tests a pris trois semaines à un seul ingénieur. Chez Perplexity, deux ingénieurs et des centaines d’agents ont écrit les 40 000 lignes de Rust de CobbleDB, dont la latence de lecture est environ cinq fois plus faible selon ses mesures. L’entraînement suit le même mouvement : TRL ramène un run GRPO de 3 h 27 min à 53 min, et Transformer Engine multiplie par 10,4 le débit d’un MoE dropless, deux billets qui localisent le goulet d’étranglement avant de le lever.

Le troisième fil est politique : qui fixe le rythme et les règles. Trois jours après la tribune d’OpenAI qui réclamait une loi fédérale fondée sur les capacités des modèles, Dario Amodei propose de rythmer les progrès des modèles de frontière en commençant par ouvrir Anthropic à des évaluateurs intégrés, et Aidan Gomez conteste la méthode. Les deux textes se rejoignent sur l’examen indépendant des systèmes les plus capables et divergent sur la suite : d’un côté, une réglementation visant toutes les entreprises de frontière américaines, doublée de standards discutés sous une dérogation antitrust étroite ; de l’autre, un cadre de risques construit par plusieurs pays et des audits jamais payés par les audités. La discussion porte moins sur le principe d’un contrôle que sur ceux qui en écrivent les règles.

Le dernier fil concerne les données sensibles, que l’IA approche avec des garde-fous inscrits dans le produit. Portable Computer garde fichiers et requêtes sur le PC et demande l’autorisation avant toute sortie vers le cloud ; Scribe v2 Medical vise la dictée clinique et les flux de conformité sur les données de santé protégées ; Claude Tag, faute d’être couvert par l’accord BAA, reste cantonné aux canaux qui n’en contiennent pas ; et Claude for Financial Advisors réserve au conseiller l’approbation des tâches critiques. Plus l’agent s’approche du dossier d’un patient ou du portefeuille d’un client, plus la limite de ce qu’il fait seul devient explicite.


Sources