Rechercher

Google annonce Gemini 4 Argon, OpenAI dit avoir déjoué une campagne de distillation, Cohere lance Embed 5

Mercredi 30 septembre, Google annonce Gemini 4 Argon, un modèle de frontière qui se déploie d’abord chez les défenseurs cyber de confiance du Fairwind Program, avec une sortie portée à 1 million de tokens. OpenAI dit avoir déjoué une campagne coordonnée d’extraction du raisonnement protégé de ses modèles, dont elle attribue le noyau à des individus associés à Moonshot AI. Cohere lance Embed 5 avec sa propre méthode d’évaluation, Ideogram 4.5 promet des retouches successives sans artefacts et HeyGen sort un modèle vidéo bâti sur MiniMax H3 ; côté développeurs, Claude Code 2.1.286, Zed 1.22.0 et VS Code 1.140 sortent le même jour.


Gemini 4 Argon : le nouveau modèle de frontière de Google, d’abord pour les défenseurs cyber

30 septembre — Google annonce Gemini 4 Argon, son nouveau modèle de frontière, dans un billet signé Koray Kavukcuoglu, vice-président senior de Google DeepMind et architecte en chef de l’IA de Google (Chief AI Architect). Argon est conçu pour soutenir un raisonnement approfondi sur des flux de travail longs et complexes (long-horizon workflows), sur trois terrains : le génie logiciel en conditions réelles, le travail de connaissance en entreprise (juridique, finance) et la cyberdéfense.

Le modèle n’est pas encore ouvert au public. Il se déploie d’abord auprès d’un ensemble de défenseurs cyber de confiance du Fairwind Program, lancé le 2 septembre avec Gemini 3.8 Flash Cyber, qui le reçoivent, comme les équipes internes de Google, sans garde-fous cyber (cyber guardrails). Les développeurs, les entreprises et le grand public suivront « dès que possible », en commençant par les clients payants de l’API et les abonnés Google AI Ultra, sans date annoncée. D’ici là, Google renforce le refus des demandes nuisibles en cyber et en NRBC, la surveillance de la chaîne de pensée et des actions du modèle, et isole ses entraînements et évaluations à haut risque dans des bacs à sable scellés ; l’entreprise dit aussi participer au processus volontaire du gouvernement américain d’accès aux modèles avant leur sortie.

Introducing Gemini 4 Argon – our new frontier model. It’s built for complex workflows across coding, enterprise knowledge work, and cybersecurity defense – rolling out today to a set of trusted testers through our Fairwind Program.

🇫🇷 Voici Gemini 4 Argon, notre nouveau modèle de frontière. Il est conçu pour les flux de travail complexes en programmation, en travail de connaissance en entreprise et en cyberdéfense, et se déploie dès aujourd’hui auprès d’un ensemble de testeurs de confiance via notre Fairwind Program. — @GoogleDeepMind sur X

Le tarif est déjà fixé : en prix de lancement, 2 dollars par million de tokens en entrée et 10 dollars en sortie, soit le tarif de GPT-6.1 Sol lancé la veille, puis 4 et 20 dollars à la fin d’une période dont la durée n’est pas indiquée ; l’entrée en cache coûte 95 % de moins que l’entrée. La limite de sortie passe à 1 million de tokens, contre 64K auparavant, la plus élevée du secteur selon Google : le modèle peut produire des centaines de milliers de tokens dans une même trajectoire pour venir à bout d’un problème difficile.

Prix par million de tokensTarif de lancementTarif après la période de lancement
Entrée2 dollars4 dollars
Sortie10 dollars20 dollars

La page de Google DeepMind compare Argon à GPT-6 Astra, Claude Fable 5.1 et Claude Opus 5.5 sur dix-neuf lignes. Argon y obtient le meilleur score sur 13 d’entre elles, partage la première place avec GPT-6 Astra sur CWE-bench v1 (68 %) et se fait devancer sur 5. Le code agentique est le terrain le plus disputé : premier sur DeepSWE v1.1 (77,9 %) et sur Vibe Code Bench, Argon finit dernier des quatre sur FrontierSWE v2 et sur Terminal-bench 4.0. Son avance est nette en travail de connaissance, notamment sur le Legal Agent Benchmark de Harvey (19,6 % contre 6,7 % au mieux pour les trois autres), et en contexte long entre 256K et 1M tokens. Le meilleur score de chaque ligne est en gras.

Benchmark évalué (domaine)Gemini 4 ArgonGPT-6 AstraClaude Fable 5.1Claude Opus 5.5
Vals Index (travail de connaissance)68,9 %63,1 %65,8 %67,0 %
AutomationBench (travail de connaissance)51,3 %41,4 %31,4 %42,5 %
Vals Finance Agent v2 (travail de connaissance)65,4 %53,5 %58,9 %58,6 %
Legal Agent Benchmark de Harvey (travail de connaissance)19,6 %5,4 %6,7 %3,8 %
DeepSWE v1.1 (code agentique)77,9 %74,1 %67,4 %74,2 %
FrontierSWE v2 (code agentique)55,0 %65,5 %56,3 %62,3 %
Vibe Code Bench (code agentique)91,9 %89,6 %90,3 %90,3 %
Terminal-bench 4.0 (code agentique)57,4 %58,2 %57,9 %66,4 %
PostTrainBench (ingénierie ML)45,3 %44,3 %40,2 %49,3 %
Terminal-Bench Science 0.1 (sciences et maths)57,6 %68,1 %52,6 %63,3 %
LABBench 2 (sciences et maths)88,8 %85,4 %68,6 %73,1 %
RiemannBench (sciences et maths)76,0 %72,0 %65,6 %69,6 %
GraphWalks BFS jusqu’à 128K (contexte long, F1)99,7 %98,7 %91,4 %90,6 %
GraphWalks BFS de 256K à 1M (contexte long, F1)84,2 %71,8 %65,0 %66,8 %
Agent’s Last Exam (usage d’ordinateur)39,5 %34,2 %—38,2 %
OSWorld-2.0, sous-ensemble hors ligne, score partiel (usage d’ordinateur)69,2 %72,6 %——
Chartography (compréhension multimodale)71,6 %71,0 %46,2 %66,3 %
LVBench (compréhension multimodale)91,7 %87,5 %79,7 %83,7 %
CWE-bench v1 (cybersécurité)68,0 %68,0 %58,0 %67,0 %

Chez Google, des milliers d’employés s’en servent déjà. Sur libgav1, le décodeur vidéo open source de Google, des agents Argon ont remplacé 32 000 lignes de code SIMD d’un portage Rust existant par du Rust sûr : le décodeur obtenu est 2,7 fois plus rapide que ce portage, avec une sortie vidéo identique. D’autres agents ont préparé pour les centres de données des optimisations mémoire qui doivent libérer plus de 300 TiB une fois déployées. En cybersécurité, Wiz l’utilise dans son initiative Scan for Good : Argon y a découvert, dans un logiciel de santé utilisé par des hôpitaux du monde entier, une vulnérabilité critique exposant des données personnelles sensibles, que les modèles de frontière précédents avaient manquée.

🔗 Gemini 4 Argon: our next era of frontier intelligence (blog Google) 🔗 Page Gemini de Google DeepMind et tableau des benchmarks


OpenAI dit avoir déjoué une campagne de distillation et en attribue le noyau à des individus associés à Moonshot AI

30 septembre — Dans un billet de sa rubrique Security, OpenAI dit avoir repéré puis neutralisé une campagne coordonnée visant à extraire le raisonnement protégé (protected reasoning) de ses modèles, c’est-à-dire la trace interne qu’un modèle produit pour travailler une tâche. L’entreprise y voit une distillation adverse (adversarial distillation) : l’usage systématique et non autorisé des sorties ou du raisonnement d’un modèle pour entraîner, reproduire ou améliorer un autre modèle.

Selon OpenAI, les opérateurs n’ont ni cassé le chiffrement, ni compromis une base de données, ni accédé directement aux conversations stockées des utilisateurs. Ils ont manipulé les échanges pour que le raisonnement protégé réapparaisse sous une forme visible, par exemple en copiant le raisonnement chiffré d’une conversation pour demander à un modèle, dans une autre conversation, de le déchiffrer et de le transcrire. Des chercheurs indépendants avaient signalé par divulgation responsable des vulnérabilités voisines, décrites dans l’article « Stealing Reasoning Traces from Proprietary LLM APIs » soumis sur arXiv le 10 août ; OpenAI confirme que ces chemins d’attaque étaient réels.

Étape de la campagneDate ou volume relevé par OpenAI
Début de l’activité, à faible volume1er juillet
Pics d’activité24 et 25 juillet
Requêtes suivant le motif d’extraction pendant les pics16 000, venues de plus de 4 000 utilisateurs
Groupe relié à ce motifplus de 15 000 utilisateurs
Neutralisation complète du groupe28 juillet

Sur l’attribution, le billet reste prudent : il n’est pas établi que tous les opérateurs relèvent d’un même acteur, et les 16 000 requêtes des pics sont des tentatives d’extraction, pas nécessairement réussies. OpenAI attribue toutefois un noyau de l’activité à des individus associés à Moonshot AI, le développeur de Kimi.

… we attribute a core cluster of the activity to individuals associated with Moonshot AI …

🇫🇷 … nous attribuons un noyau de l’activité à des individus associés à Moonshot AI … — OpenAI, billet de la rubrique Security

En réponse, OpenAI a banni ou restreint les comptes frauduleux, durci ses contrôles d’inscription et d’infrastructure, élargi la surveillance des réseaux liés et renforcé la protection du raisonnement caché entre utilisateurs, espaces de travail, organisations et familles de modèles. Elle a fermé une voie qui permettait de rejouer le raisonnement chiffré d’un autre utilisateur pour en retrouver le contenu, et ajouté des contrôles qui détectent et retiennent une sortie en flux (streaming) susceptible de l’exposer. Les résultats ont été partagés via le Frontier Model Forum et des canaux gouvernementaux : selon OpenAI, la technique n’est pas propre à ses modèles, et tout système qui rend le raisonnement portable ou rejouable peut être exposé à des risques voisins. L’entreprise présente la distillation adverse comme un risque de sûreté et de sécurité nationale, un raisonnement extrait pouvant servir à entraîner un autre modèle sans les garde-fous de l’original. Le sujet n’est pas neuf : en février, Anthropic avait attribué des campagnes de distillation à DeepSeek, Moonshot AI et MiniMax, et Anthropic facture depuis le 24 septembre les requêtes bloquées dans plusieurs catégories, dont l’extraction de raisonnement.

🔗 Article « Stealing Reasoning Traces from Proprietary LLM APIs » sur arXiv


Embeddings : Cohere lance Embed 5 et la métrique RCP-nDCG@10, Perplexity publie pplx-embed-v2-context-9b-preview

30 septembre — Cohere lance Embed 5, une famille de modèles d’embeddings pour la recherche en entreprise, en deux tiers qui partagent le même espace d’embeddings : Embed 5 Pro, pour la qualité maximale et l’indexation hors ligne, et Embed 5 Fast, pour la recherche interactive, le RAG à fort volume et la recherche agentique. On peut indexer un corpus avec Pro puis l’interroger avec Fast sans rien réindexer, à condition de garder la même dimension de sortie : sur 40 jeux de données de développement, ce schéma recommandé par Cohere conserve en moyenne 98,4 % de la qualité d’un système entièrement en Pro, contre 96,6 % pour un système tout Fast.

Les deux modèles lisent jusqu’à 128K tokens, acceptent du texte, des images ou les deux fusionnés dans un même vecteur, couvrent plus de 100 langues et produisent des vecteurs de 256 à 2 048 dimensions en float, int8 ou binaire. Cohere conseille 1 024 dimensions en int8, soit 1 Ko par vecteur contre 8 Ko en float32 à 2 048 dimensions. Pro coûte 0,12 dollar par million de tokens de texte et Fast 0,08 dollar, un tiers de moins, pour un débit documentaire 2,4 fois supérieur en moyenne ; l’image est facturée 0,40 dollar par million de tokens pour les deux. Embed 5 est disponible dès aujourd’hui via l’API Cohere, Model Vault, Microsoft Foundry et Amazon SageMaker, ainsi que dans North, et peut être déployé en privé avec vLLM.

Benchmark (métrique)Embed 5 ProEmbed 5 FastAutres modèles cités
ViDoRe V3, 8 domaines (RCP-nDCG@10)85,884,5Voyage 4 Large 83,7 ; Gemini Embedding 2 83,2 ; OpenAI text-embedding-3-large 75,5
FinanceBench (RCP-nDCG@10)80,180,0Pro 21,4 points devant OpenAI text-embedding-3-large
FinQA (RCP-nDCG@10)90,088,8—
ViDoRe V3 Finance (RCP-nDCG@10)85,083,9—
PDF analysés, moyenne de la suite (RCP-nDCG@10)84,883,4Voyage 4 Large 83,6 ; Gemini Embedding 2 80,8 ; Embed 4 78,6
Texte et image fusionnés, 5 jeux (nDCG@10)82,381,2Gemini Embedding 2 61,3
Image de page, 5 jeux financiers (nDCG@10)77,073,2Embed 4 71,1 ; Voyage Multimodal 3.5 70,1 ; Gemini Embedding 2 56,7
5 langues européennes (nDCG@10 ou RCP-nDCG@10)77—Voyage 4 Large 76 ; Gemini Embedding 2 73

La plupart de ces scores sont exprimés en RCP-nDCG@10, la méthode d’évaluation que Cohere publie le même jour (voir ci-dessous) : une note du billet précise qu’elle réordonne un jeu de candidats fixe et mesure donc la qualité de classement plutôt que la récupération de premier niveau. Le second tableau multilingue mérite une lecture complète : Cohere y souligne ses progrès sur Embed 4, jusqu’à 13 points en farsi, mais sur ces dix langues, Gemini Embedding 2 devance Embed 5 Pro sur neuf, le chinois faisant seule exception, et Voyage 4 Large le devance sur cinq. Cohere présentera Embed 5 lors d’une session sur X le 8 octobre.

🔗 Billet Embed 5 de Cohere · Annonce de @cohere sur X

RCP-nDCG@10, la métrique avec laquelle Cohere mesure Embed 5

30 septembre — Cohere publie aussi RCP-nDCG@10 (Rubric-Calibrated Preferences nDCG@10), sa méthode d’évaluation de la recherche. Point de départ : nDCG, la métrique de MTEB et BEIR, compare les résultats à une liste de documents annotés à l’avance, forcément incomplète, si bien qu’un document pertinent jamais annoté ne rapporte rien ; dans l’étude de Cohere, 28 % des documents marqués non pertinents sont pourtant jugés utiles par des humains. RCP-nDCG@10 confie le jugement à un juge IA calibré, qui répond à cinq questions oui/non identiques pour chaque requête et compare les documents par groupes. Validation à l’aveugle avec 46 annotateurs sur 289 duels : quand les deux métriques désignent des gagnants différents, les humains donnent raison à RCP-nDCG dans 70 % des cas. L’article, le code et les données sont publiés, et le mainteneur principal de MTEB annonce son intégration. Cohere dit avoir optimisé contre cette métrique sa cinquième génération d’Embed et de Rerank, cette dernière encore sans date, et prévient que ces modèles ne paraîtront pas toujours les meilleurs au seul nDCG historique.

🔗 Billet RCP-nDCG@10 de Cohere · Code et données sur GitHub

Perplexity publie pplx-embed-v2-context-9b-preview et le benchmark context-bench

30 septembre — Perplexity publie en préversion, sous licence MIT sur Hugging Face, pplx-embed-v2-context-9b-preview, un modèle d’embeddings contextuels : chaque fragment d’un document est encodé avec le document entier en vue, pour qu’un passage qui dit « elle » reste rattaché à la bonne entité. Plutôt qu’un seul fragment « or » (gold passage) par requête, le modèle apprend d’un enseignant, le modèle de compression de contexte de Perplexity, qui note chaque token du document : il apprend ainsi à retrouver la réponse et les passages qui la justifient. Soumis à l’aveugle sur context-bench, un benchmark privé de turbopuffer, cosignataire du billet (2 099 requêtes, 38 894 documents), il devance voyage-context-4 ; sur ConTEB, il obtient la meilleure moyenne sans gagner toutes les tâches. Perplexity prévient que poids et interface peuvent encore changer, et prépare un accès par son API, sans date.

Mesure publiée par Perplexitypplx-embed-v2-context-9b-previewÉcart avec voyage-context-4
Rappel de réponse sur context-bench, à K = 1045,5 %+14,4 points
Rappel de preuves sur context-bench, à K = 1040,6 %+5,0 points
Stockage par vecteur (1 024 dimensions, int8)1 Ko8 fois moins que voyage-context-4 en float32

🔗 Billet de Perplexity Research · Modèle sur Hugging Face


Ideogram 4.5 : un modèle d’édition d’image pensé pour les retouches successives

30 septembre — Ideogram lance Ideogram 4.5, qu’il présente comme « le modèle d’édition le plus précis ». Le constat de départ : à chaque retouche, les modèles d’image ajoutent des artefacts, des décalages de pixels et des dérives de couleur, si bien qu’une image devient vite inexploitable après plusieurs passes. Ideogram 4.5 est conçu pour supprimer cette accumulation et rendre possible l’édition en plusieurs tours (multi-turn editing).

Introducing Ideogram 4.5, the most precise edit model. With each edit, leading models add artifacts, pixel shifts, and color changes. Ideogram 4.5 eliminates artifact buildup, making multi-turn editing possible. Live in Ideogram, the API, and launch partners. Open weights soon.

🇫🇷 Voici Ideogram 4.5, le modèle d’édition le plus précis. À chaque retouche, les modèles de pointe ajoutent des artefacts, des décalages de pixels et des changements de couleur. Ideogram 4.5 élimine l’accumulation d’artefacts, ce qui rend possible l’édition en plusieurs tours. Disponible dans Ideogram, dans l’API et chez les partenaires de lancement. Poids ouverts bientôt. — @ideogram_ai sur X

Pour appuyer ce point, Ideogram publie une comparaison côte à côte des mêmes retouches successives avec GPT Image 2.5 Sunburst, Nano Banana Pro et Nano Banana 2, dont les sorties deviendraient, selon lui, inutilisables en quelques retouches. La comparaison est visuelle, sans score chiffré. Les exemples couvrent la couleur et l’éclairage (ombres, reflets et hautes lumières suivent le changement sans bouger la composition), la modification de texte, la photo de produit, la décoration intérieure, la restauration de vieilles photos étape par étape, le passage d’un croquis ou d’une carte de profondeur à une image, et le recadrage.

Le modèle introduit aussi l’édition à toute résolution (Zoom editing) : une zone d’une image haute définition, de 24,2 mégapixels (4 016 × 6 016 pixels) dans l’exemple d’Ideogram, se retouche sans réduire l’image, ses bords étant préservés pour la réintégrer sans raccord visible. Bien que pensé pour l’édition ciblée, le modèle se comporte aussi très bien en édition générale, selon Ideogram.

Élément de l’annonceCe que l’on en sait
Disponibilitédès le 30 septembre dans Ideogram et dans l’API
Partenaires de lancementPika et Luma, qui l’annoncent le jour même
Poids ouvertspromis « bientôt », comme ceux d’Ideogram 4.0 publiés en juin
Tarifnon publié

🔗 Page du modèle Ideogram 4.5


HeyGen Video : un modèle vidéo bâti sur MiniMax H3, ouvert par API

30 septembre — HeyGen lance HeyGen Video, un modèle de génération vidéo destiné aux entreprises qui veulent une vidéo de qualité production sans en payer le coût. Bâti sur MiniMax H3 et post-entraîné par HeyGen, il produit une vidéo à partir d’un texte ou d’une image, avec le son généré dans le même appel, et s’utilise via l’API de HeyGen ainsi que sur OpenRouter, Runware et ComfyUI.

Côté prix, trois chiffres coexistent. Le tarif démarre à 0,01 dollar par seconde jusqu’à fin octobre, soit 50 % de remise sur le tarif standard de 0,02 dollar, selon la page du catalogue. Sa grille comparative retient, elle, le prix catalogue en 768p avec audio, avant promotions de lancement : 0,03 dollar par seconde. Même à ce prix, HeyGen Video est le moins cher des modèles comparés.

Modèle comparéPrix catalogue par seconde (768p, audio)Elo interne de HeyGen (HeyGen Video = 1 000)
HeyGen Video0,03 dollar1 000
Seedance 2.00,303 dollar955
H3 Max0,08 dollar952
H3 Max Turbo0,04 dollar920
H3 Max balanced0,08 dollar860
Kling 3.0 Pro0,168 dollar857
Veo 3.10,40 dollar744

Sur la qualité, HeyGen s’appuie sur une évaluation interne menée sur des requêtes d’Artificial Analysis Arena (4 800 votes), avec un Elo ramené à 1 000 pour son modèle. En préférence à l’aveugle face à H3 Max, 55,8 % des 650 votes vont à HeyGen Video, dans une fourchette de 49 à 62 % qui n’exclut pas l’égalité. Pour un clip de 10 secondes en image vers vidéo, le temps d’inférence du transformeur de diffusion tombe à 3,7 secondes, contre 4,1 pour H3 Max Turbo et 8,3 pour H3 Max, hors temps de légendage.

MiniMax a salué le lancement et mis en avant le même jour un autre modèle dérivé de H3 : Boreal-H3 de Creatify, un modèle vidéo optimisé pour la publicité.

🔗 Catalogue HeyGen Video · Annonce de @HeyGen sur X


Assistants et agents généralistes : les skills de Gemini, Manus Flex et Grok Bot

L’application Gemini lance les skills, qui remplaceront les Gems

30 septembre — Google lance les skills dans l’application Gemini : des instructions enregistrées une fois, rappelées en tapant une barre oblique suivie de leur nom. Gemini peut aussi en créer à partir des conversations et les lancer de lui-même quand un prompt correspond, plusieurs skills se cumulent, et chacune peut embarquer des fichiers de référence (texte brut, PDF, images). Déjà présentes dans Gemini Spark, elles arrivent dans le chat Gemini partout dans le monde, pour tous les niveaux d’abonnement Google AI et, pour l’instant, pour les 18 ans et plus ; les clients Workspace suivront dans les prochaines semaines. Les skills remplaceront les Gems, qui disparaîtront à partir de novembre pour les comptes personnels, en mars 2027 pour Workspace business, enterprise et nonprofit et en juin 2027 pour l’éducation, avec une migration automatique. Opal, l’outil de création de mini-applications, fermera aussi en novembre, tout comme les « Gems by Google Labs », qui ne seront pas migrés.

🔗 Let skills in Gemini tackle your most repetitive tasks (blog Google)

Manus Flex : sa propre clé API dans l’agent Manus

29 septembre — Manus lance Manus Flex, qui permet d’alimenter Manus avec la clé API d’un fournisseur d’inférence pris en charge (bring your own API key). Jusqu’ici, Manus choisissait lui-même le modèle et fournissait le harnais et l’infrastructure d’agent ; avec Flex, la clé d’un fournisseur alimente les mêmes projets, outils, environnements d’exécution et flux de travail d’agent, avec un modèle principal et un niveau d’effort de raisonnement au choix. La facturation se partage : l’inférence est facturée directement par le fournisseur, tandis que les autres services et l’infrastructure mobilisés par une tâche continuent de consommer des crédits Manus. OpenRouter, Fireworks et Modal sont les trois premiers membres du programme partenaire d’inférence (Manus Flex Inference Partner Program). Le billet, publié au lendemain du lancement de Manus 2.0, ne donne ni formule, ni tarif, ni liste de modèles.

🔗 Introducing Manus Flex

Grok Bot confie le code à Cursor et gère les pull requests

30 septembre — Deux jours après Team Bots, SpaceXAI renforce Grok Bot pour le développement logiciel. Dans un fil du compte @bot, l’éditeur annonce que ses Bots peuvent confier des tâches de code à Cursor, gérer les pull requests grâce à des plugins GitHub et Origin (ce dernier n’est pas décrit) et partager des démonstrations vidéo de ce qu’ils construisent. SpaceXAI publie aussi, sous forme de modèles à installer (templates), les Bots de sa propre équipe d’ingénierie, chacun livré avec ses skills, ses routines et ses connecteurs. Le fil ne précise ni formule, ni tarif, ni date, et aucun billet ne l’accompagne sur x.ai. Le lien avec Cursor n’est pas neuf : Grok Bot for Enterprise était offert deux semaines aux clients Grok et Cursor Enterprise début septembre ; ce qui change, c’est qu’un Bot délègue lui-même le travail de code.

🔗 Fil de @bot sur X


Robotique et modèles du monde : Praxis-1 de Runway, MolmoAct 2 d’Ai2 et Physis-Lang de NVIDIA

Runway présente Praxis-1, un modèle d’action du monde à poids ouverts

30 septembre — Runway présente Praxis-1, son premier modèle d’action du monde (world action model) à poids ouverts, destiné à piloter de vrais robots. Il repose sur le même pré-entraînement vidéo que ses modèles de monde, comme Solaris ou GWM Worlds 2, et se veut un modèle de politique généraliste pour les développeurs et chercheurs en robotique. Le pari de Runway : les démonstrations robotiques sont rares, la vidéo quasi illimitée. Une même politique passe d’un studio à une cuisine sans réentraînement dans ses démonstrations. Rien n’est encore téléchargeable : Praxis-1 est en test chez Noble Machines, Standard Bots et Ultra, chacun sur son propre matériel, et sa sortie publique, poids compris, est annoncée dans les prochains mois.

Mesure publiée par RunwayRésultat annoncé
Corrélation entre simulation dans le modèle de monde et résultats réels0,95
Erreur de placement finale après ajustement, avec de la vidéo web16,1 cm
Même erreur avec de la vidéo de robot téléopéré16,0 cm

🔗 Praxis-1 sur Runway Research

MolmoAct 2 d’Ai2 en tête de Reality Check, après affinage par l’organisateur du banc

30 septembre — Ai2 annonce que MolmoAct 2, son modèle de robotique entièrement ouvert, arrive premier en réussite globale sur Reality Check, un banc indépendant de manipulation en conditions réelles, avec une nuance de taille : les modèles y sont affinés par l’organisateur, Poke & Wiggle, sur les tâches du banc. Lancé la veille par cette société, Reality Check compte 14 400 exécutions sur de vrais robots, sur des stations FR3 Duo installées au Deutsches Museum de Munich, dans dix environnements (trier des vis, brancher un connecteur DC, ouvrir une boîte à outils au tournevis…). Deux axes restent « à venir » : des objets placés hors de la zone d’entraînement et un mi-entraînement sur 100 heures de données des stations.

Modèle évaluéRéussite globaleRéussite après environ 10 démonstrations par environnementRéussite après environ 300 démonstrations par environnement
MolmoAct 228 %4 %44 %
Pi 0.521 %5 %33 %
DiT-Flow19 %2 %29 %
GR00T N1.712 %4 %19 %

🔗 Tweet d’Ai2 · Classement Reality Check

Physis-Lang : des légendes qui expliquent la physique aux modèles de monde

29 septembre — Des chercheurs de NVIDIA, du MIT et de l’université d’Oxford publient Physis-Lang, un cadre qui ajoute du raisonnement physique aux légendes de vidéos pour améliorer les modèles de monde. Les légendes rendent explicites les causes, les lois en jeu et les effets ; un critique spécialisé repère les affirmations manquantes ou non étayées, un agent affine les consignes de légendage, et les échecs du modèle servent à chercher les vidéos qui combleront ses lacunes. Selon NVIDIA, ajouter ce raisonnement au seul prompt, sans réentraînement, améliore de 5,62 points le score PhyGenBench de Cosmos 3. Avec entraînement, Physis-Lang sur Cosmos3-Super et Cosmos3-Nano prend les deux premières places du classement Physics-IQ Verified en image vers vidéo (48,2 et 43,3, contre 42,7 pour le précédent meilleur score). PhyGenBench et VideoPhy-2 sont notés par GPT-5.5, et Veo 3.1 garde un léger avantage sur l’ensemble complet de VideoPhy-2.

Benchmark de physique vidéoCosmos3-NanoVeo 3.1Physis-Lang sur Cosmos3-Nano
PhyGenBench61,6765,6371,04
Physics-IQ Verified40,2334,9943,41
VideoPhy-2 Hard48,3158,4362,36
VideoPhy-2, ensemble complet60,4168,8768,02

🔗 Page du projet Physis-Lang · Annonce de @NVIDIAAI sur X


Modèles ouverts : Hunmin-397B-A17B-CUA et JEV-27B-VL

Hunmin-397B-A17B-CUA greffe les capacités d’agent de Qwen-CUA sur un MoE de 397 milliards de paramètres

30 septembre — Sur le blog communautaire de Hugging Face, hojun Lee détaille Hunmin-397B-A17B-CUA, un modèle d’utilisation d’ordinateur (computer use) publié sous Apache-2.0 par l’organisation mncai, avec une réserve posée par les auteurs eux-mêmes : les évaluations sont faites maison, avec une seule exécution pour les bancs d’agent, et ne sont pas comparables aux classements publiés (la base y obtient 48,16 sur OSWorld, contre 62,2 annoncés sur OSWorld-Verified). Le modèle repose sur Qwen3.5-397B-A17B, un mélange d’experts à 17 milliards de paramètres actifs, et tout le projet a tenu sur un seul nœud de huit B200. L’équipe a calculé la différence de poids entre sa base et Qwen-CUA, déjà spécialisé, et n’en a greffé qu’une version de rang réduit sur une sélection de modules : ce transfert seul fait passer OSWorld-316 de 48,84 à 68,25, sans reprendre la faiblesse de Qwen-CUA en ancrage visuel. Un affinage puis un apprentissage par renforcement GRPO ajoutent 4,3 points.

Banc d’évaluation (protocole maison)Base Qwen3.5-397BHunmin-CUAQwen-CUA (source)
OSWorld, 360 tâches48,1670,4577,12
WindowsAgentArena, 153 tâches41,7750,8556,68
ScreenSpot-Pro72,7475,6162,20
KMMLU-Pro (coréen)77,9176,1271,41

🔗 Billet Hunmin-CUA · Poids sur Hugging Face

AutoTrust AI publie JEV-27B-VL, un modèle de décision ouvert qui juge aussi des images

30 septembre — AutoTrust AI publie sous Apache-2.0 JEV-27B-VL, la version dotée de vision de JEV-27B, son modèle de décision ouvert présenté le 27 septembre. On lui montre des images et du texte, on pose une question, et il répond en une passe avec une probabilité calibrée pour chaque option, en une centaine de millisecondes ; quand la question l’exige, il raisonne pas à pas en regardant les images. Sa tête de décision n’a pourtant vu aucune image pendant l’entraînement. Test principal : sur MicroLens, un jeu public d’application de vidéos courtes, il classe 20 vidéos candidates pour 200 utilisateurs à partir des seules vignettes, et fait jeu égal en AUC avec un filtrage collaboratif appris sur 59 045 utilisateurs, avec un meilleur taux de bonne vidéo dans le top 5. Les auteurs rappellent que ce résultat vient d’un seul jeu de 200 utilisateurs.

Méthode de recommandation sur MicroLensAUCBonne vidéo dans le top 5
JEV-27B-VL, vignettes seules, sans données d’interaction0,72759 %
Filtrage collaboratif appris sur 59 045 utilisateurs0,72849 %
JEV-27B-VL, titres seuls0,64946 %
Ordre aléatoire0,48921 %

🔗 Billet JEV-27B-VL


Classements : l’Open TTS Leaderboard de Hugging Face et AURORA de LILT

Hugging Face lance l’Open TTS Leaderboard, un classement ouvert de la synthèse vocale

30 septembre — Hugging Face lance l’Open TTS Leaderboard, un classement de la synthèse vocale (text-to-speech, TTS) centré sur les modèles ouverts et multilingues. Le Hub compte plus de 8 000 modèles TTS, mais les arènes de vote qui font référence suivent mal le rythme et sous-représentent les modèles ouverts : selon le billet, seuls 16 des 92 modèles classés par Artificial Analysis sont à poids ouverts. Le classement remplace donc les votes par des mesures objectives : l’intelligibilité (taux d’erreur par mot ou par caractère entre le texte demandé et sa transcription par Qwen3 ASR), la vitesse (inférence groupée et délai avant le premier son, sur H200 et sur processeur) et la fidélité d’une voix clonée (similarité WavLM). Évaluer un modèle prend quelques heures au lieu de quelques semaines de votes. En anglais, Kokoro-82M, supertonic-3 et s2-pro de Fish Audio mènent ; en multilingue, OmniVoice, s2-pro et Fun-CosyVoice3-0.5B. Les auteurs préviennent que ni le naturel ni l’expressivité ne sont mesurés, et publieront leurs scripts d’évaluation « bientôt ».

🔗 Billet de l’Open TTS Leaderboard · Le classement sur Hugging Face

LILT lance AURORA, un classement multilingue des tâches d’agent

30 septembre — LILT lance AURORA, un classement qui mesure les modèles de pointe sur des tâches d’agent non anglaises, toutes conçues et vérifiées par des experts natifs, sans traduction automatique. Quatre bancs l’ouvrent : un Terminal-Bench multilingue de 324 tâches de code en dix langues, une version multilingue de τ³-bench pour le support client, MultiChallenge pour le suivi d’instructions en contexte long et GAIA-v2-LILT pour le raisonnement agentique. Claude Opus 5.5 mène le Terminal-Bench multilingue et arrive en tête de τ³-bench dans chacune des cinq langues. Sur GAIA, les modèles gagnent en moyenne 20,7 points sur la version auditée par LILT par rapport à une traduction automatique : pour LILT, cet écart mesure l’erreur introduite par la traduction. Un même dialogue consomme aussi environ 1,4 fois plus de tokens en coréen ou en arabe qu’en anglais.

Modèle évalué (Terminal-Bench multilingue, extrait)Réussite moyenne
Claude Opus 5.5 (effort high)76,4 %
Claude Opus 5 (effort high)73,5 %
Gemini 3.8 Flash67,3 %
GPT-6 Sol64,8 %
Command A+4,3 %

🔗 Billet AURORA de LILT · Le classement AURORA


Secteur public et entreprises : Claude for Government, l’agent d’achat d’Anthropic et OpenAI avec America’s SBDC

Claude for Government passe en disponibilité générale

30 septembre — Claude for Government sort de bêta : Anthropic annonce sa disponibilité générale pour les agences fédérales et les agences des États américains. La plateforme, en bêta publique depuis juillet, fournit les capacités de code et de travail agentique de Claude dans un environnement autorisé FedRAMP High, avec des fonctions comparables à celles des clients commerciaux ; le CLI Claude Code et Claude for Microsoft 365 y arrivent en accès anticipé. Pas de licence par siège : les agences paient l’usage par tranches fixes, avec un plafond ferme qui empêche de dépasser le budget engagé, et les correspondances de groupes SCIM fixent, par niveau de siège, limites de débit, plafonds en dollars et modèles autorisés. Côté contrôle, les opérations sensibles côté Anthropic exigent une approbation à deux personnes, les exports d’usage ne contiennent que des données de mesure et l’historique des conversations reste sur l’appareil géré par l’agence. Anthropic ne publie aucun tarif.

🔗 Claude for Government is now generally available

Chez Anthropic, un agent bâti sur Managed Agents accueille les demandes commerciales

30 septembre — Anthropic raconte comment son équipe commerciale a refait l’accueil des demandes entrantes, des dizaines de milliers par mois, avec un agent d’achat bâti sur Claude Managed Agents, en bêta. Présent sur les pages Contact Sales et Pricing, dans claude.ai et dans les e-mails, il pose quelques questions, recommande un forfait et un nombre de sièges, puis mène à l’achat, passe la main à un commercial avec tout l’historique, ou se contente de répondre ; le client peut choisir un humain dès le départ. Selon le billet, signé Carl Johnson, l’agent tient des milliers de conversations par jour ; les prospects qu’il transmet deviennent des opportunités plus de deux fois plus souvent qu’avec l’ancien formulaire et concluent environ cinq jours plus vite, et la part des conversations qui exigent un commercial pour conclure a baissé d’environ moitié. Un seul ingénieur a construit la première version en quelques semaines ; l’agent oriente souvent les petites équipes vers le forfait Team plutôt qu’Enterprise, ce qu’Anthropic a choisi d’assumer.

🔗 How Anthropic’s sales team rebuilt inbound with Claude Managed Agents

OpenAI s’associe à America’s SBDC et publie un rapport sur les petites entreprises

30 septembre — OpenAI s’associe à America’s SBDC, le réseau national des centres de développement des petites entreprises américains, qui accompagne 1 million d’entrepreneurs par an. Dans une première phase, via le programme de formateurs communautaires d’OpenAI Academy (Community Trainer Program) lancé en pilote le 23 septembre, OpenAI prévoit de former environ 150 conseillers, qui animeront des ateliers de trois heures dans les réseaux SBDC, avec l’objectif de toucher au moins 1 000 petites entreprises en présentiel. Le même jour, le rapport « Small Businesses, Bigger Capabilities » chiffre l’usage : sur la semaine du 9 au 15 septembre, environ 4 millions de salariés d’entreprises de moins de 500 personnes ont utilisé les produits d’OpenAI, dont près d’un sur cinq dans une entreprise de moins de 10 salariés. En août, les tokens de sortie agentiques, ceux de ChatGPT Work et de Codex notamment, représentaient deux tiers des tokens de sortie des petites entreprises, contre un tiers en avril.

🔗 Billet d’OpenAI sur les petites entreprises


Runway Ads : un moteur autonome pour la publicité à la performance

30 septembre — Runway lance Runway Ads, qui prend en charge de bout en bout la partie créative des campagnes payantes. On connecte un compte publicitaire et un kit de marque : l’outil, bâti sur Runway Agent, génère des créations vidéo et image, publie les variantes approuvées sur Meta, Google et TikTok, relit leurs performances et produit la vague suivante autour de ce qui a attiré la dépense. Il localise chaque création selon des règles fixées par l’équipe, texte à l’écran compris, la redimensionne pour chaque format, la soumet à un contrôle de marque automatique et respecte les limites de budget. L’approbation humaine est activée par défaut ; la publication automatique peut être ouverte par campagne ou par type de variante.

Indicateur interne de Runway, depuis juilletRésultat publié dans le billet
Publicités par semainede 77 à environ 900
Retour sur dépense publicitairedoublé
Conversionenviron +34 %, taux de clic stable
Coût par abonné−41 %

Runway Ads est pour l’instant en pilote chez des partenaires entreprise sélectionnés. Le tweet d’annonce promet un déploiement large dans les prochaines semaines et affirme que l’outil a aussi permis d’ajouter 100 millions de dollars d’ARR (revenu annuel récurrent) depuis juillet, un chiffre absent du billet.

🔗 Billet Runway Ads · Tweet de @runwayml


ElevenLabs valorisée 22 milliards de dollars après une offre de rachat de 300 millions

30 septembre — ElevenLabs a finalisé une offre de rachat d’actions (tender offer) de 300 millions de dollars destinée à ses salariés, qui la valorise à 22 milliards de dollars, le double de sa valorisation lors de la série D de février. L’opération est menée par Wellington et T. Rowe Price ; EQT, Goldman Sachs, GIC, OTPP, Sapphire Ventures et BDT & MSD entrent au capital, aux côtés d’investisseurs existants comme Andreessen Horowitz, Lightspeed et ICONIQ. Les clients entreprises représentent 55 % du chiffre d’affaires : ElevenAgents traite plus de 15 millions de conversations par semaine, trois fois plus qu’en février, et son revenu annuel récurrent a plus que triplé sur la période. Selon une analyse de ses clients, les agents vocaux résolvent les demandes 31 % plus vite que les agents de chat. L’entreprise compte plus de 800 salariés, quatre ans après un premier tour à 9 millions de dollars de valorisation.

🔗 Billet d’ElevenLabs


Vera Rubin NVL72 en production chez CoreWeave, Cognition mesure jusqu’à 4,8 fois plus de débit

30 septembre — À l’occasion de CoreWeave Fully Connected, à San Francisco, NVIDIA détaille le passage en production de Vera Rubin NVL72 chez CoreWeave : la plateforme, avec le réseau Spectrum-X Ethernet 102.4T, est disponible sur CoreWeave Cloud, qui a reçu ses premières baies de production plus tôt dans le mois. Cognition, l’éditeur de Devin, est le premier client à y faire tourner des charges de production : lors de premiers tests sur des tâches tirées de FrontierCode, il a mesuré jusqu’à 4,8 fois plus de débit total de tokens pour l’inférence de SWE-2 qu’avec GB200 NVL72. CoreWeave proposera aussi le CPU Vera, conçu pour les agents : 128 CPU et 11 264 cœurs par baie, de quoi faire tourner plus de 11 000 environnements isolés simultanés, avec des bacs à sable d’agents qui démarrent plus de trois fois plus vite. CoreWeave lance enfin CoreWeave Forge, qui réunit Weights & Biases, OpenPipe et marimo pour reboucler de la production vers l’entraînement ; son apprentissage par renforcement sans serveur (serverless RL) est annoncé 1,4 fois plus rapide, pour 40 % de coût en moins.

🔗 Billet NVIDIA sur CoreWeave et Vera Rubin


Agents de code et outils de développement : Claude Code 2.1.286, Zed 1.22.0, Gemini CLI, VS Code 1.140, HydraFusion et un serveur MCP pour gcloud

Claude Code 2.1.286 : signets dans VS Code, relances plafonnées et mode bare resserré

30 septembre — Claude Code 2.1.286, publié à 19 h 10 UTC, compte 88 entrées, dont 49 correctifs. L’invite de permission indique sa position quand plusieurs demandes s’empilent (« 2 of 5 »), et l’extension VS Code gagne des signets (bookmarks) pour garder des réponses de Claude dans un panneau latéral, une ligne Questions qui reprend les questions posées par Claude et les réponses choisies, et des aperçus d’options dans les cartes de question. Deux changements de comportement comptent : une seule limite couvre désormais les relances d’un appel de modèle, soit 14 requêtes au plus avec les réglages par défaut, et --bare ne connecte plus que les serveurs MCP nommés en ligne de commande, sans rappels système ni tâches d’arrière-plan. Si un skill nommé verify existe, Claude est invité à le lancer juste avant chaque commit, sauf pour la documentation ou les tests, et les plugins refusent les sources npm qui sont des dépôts git ou des dossiers. Enfin, quand l’API refuse le modèle par défaut, Claude Code réessaie une fois sur le modèle précédent du même niveau au lieu d’échouer à chaque tour.

🔗 Notes de version de Claude Code 2.1.286

Zed 1.22.0 : un modèle par sous-agent

30 septembre — Zed publie sa version stable 1.22.0, centrée sur les sous-agents : l’outil spawn_agent accepte un paramètre facultatif model, pour lancer un sous-agent sur un autre modèle que celui configuré ou hérité du parent, et la carte de chaque sous-agent affiche le modèle utilisé. Les sous-agents compactent aussi leur contexte automatiquement, ce qui leur permet, selon Zed, de tenir des tâches plus longues. Côté modèles, GPT-6.1 Sol arrive en BYOK avec une clé API OpenAI, Grok 4.7 passe en stable comme modèle recommandé chez SuperGrok et xAI, et la liste des modèles OpenCode Zen et Go est récupérée à la volée. La version corrige une fuite d’environ 2 Mo de mémoire par commande terminée dans le terminal et change un raccourci : la fermeture du dock actif passe à ctrl-alt-w sur toutes les plateformes. Au total, 18 nouveautés et 37 correctifs.

🔗 Notes de version de Zed 1.22.0

Gemini CLI : v0.62.0 en stable, et une préversion qui exécute les plans sans confirmation

29 septembre — Gemini CLI publie deux versions en soirée (UTC). La v0.62.0 passe en stable à 21 h 17 : ses 19 entrées reprennent la préversion et les nightlies présentées du 16 au 24 septembre (titres structurés des appels d’outils MCP, conservation du jeton d’actualisation OAuth (refresh token), Gemini 3.8 Flash et 3.5 Flash Lite). La nouveauté est dans la préversion v0.63.0-preview.0, publiée à 20 h 58 : en mode non interactif, l’agent rédige et exécute désormais son plan sans attendre de confirmation (PR 29539), alors que les consignes du Plan Mode lui faisaient répondre par un simple message d’alignement, sans aucun appel d’outil. Une limite maxChars de 0 ou moins désactive aussi la troncature des sorties d’outils (PR 29542). La nightly du 30 septembre ouvre la série 0.64.0 : en mode ACP, le CLI renseigne enfin l’usage standard, alors que des clients comme Zed ou OpenHands surestimaient la facturation d’environ 3 fois, selon la PR 29549.

🔗 Gemini CLI v0.63.0-preview.0 · Gemini CLI v0.62.0

VS Code 1.140 adopte le harnais Copilot

30 septembre — Visual Studio Code 1.140 sort en stable avec le harnais Copilot (Copilot harness) : fondé sur le Copilot SDK, il donne à l’agent de VS Code le comportement et les capacités de l’app GitHub Copilot et de Copilot CLI, et tourne dans un processus hôte dédié, fondé sur l’Agent Host Protocol, si bien qu’une même session peut être rejointe depuis plusieurs fenêtres ; les notes préviennent qu’il est peut-être déjà sélectionné par défaut pour certains utilisateurs. En expérimental, les sessions multi-dossiers donnent à chaque chat son propre dossier ou worktree, et l’agent peut déléguer une session à un hôte distant, choisi selon le système, la mémoire, le nombre de CPU et le modèle. Trois contrôles arrivent pour l’entreprise : l’explication, dans le chat, des versions minimales exigées par l’administrateur, un niveau par défaut du mode Auto fixé par un réglage géré (autoTier), et l’ajout de l’identité de l’utilisateur aux données OpenTelemetry de Copilot, option désactivée par défaut.

🔗 Notes de version de VS Code 1.140

HydraFusion arrive dans VS Code et l’app GitHub Copilot

30 septembre — GitHub étend HydraFusion, l’orchestration multi-modèles lancée le 4 septembre dans Copilot CLI, à VS Code (à partir de la version 1.140, ou Insiders) et à l’app GitHub Copilot, toujours en préversion de recherche. HydraFusion se choisit dans le sélecteur comme un modèle, mais n’en est pas un : il traite le choix du flux de travail comme un problème d’optimisation et retient l’un de trois schémas. En mode Single, un seul modèle résout la tâche ; en mode Cascade, un modèle efficace rédige et un contrôle qualité accepte le résultat ou escalade vers un modèle plus fort ; en mode Critique, un critique en lecture seule, issu d’une autre famille de modèles, relit, puis le rédacteur révise une fois. Là où le mode Auto choisit un modèle par requête, HydraFusion coordonne plusieurs modèles dans un même tour. Il est ouvert en Copilot Pro, Pro+, Business et Enterprise, un administrateur devant activer les préversions en Business et Enterprise ; GitHub ne publie pas de nouveau chiffre.

🔗 HydraFusion in VS Code and the GitHub Copilot app

Google Cloud ouvre en préversion un serveur MCP distant qui exécute gcloud et bq

Google Cloud ajoute à ses serveurs MCP distants gérés le Google Cloud CLI remote MCP server, en préversion publique. Il regroupe des centaines de commandes des outils en ligne de commande gcloud et bq (BigQuery) derrière deux outils MCP, run_gcloud_command et run_bq_command. Google justifie le choix de la ligne de commande par deux arguments : une commande encapsule des opérations en plusieurs étapes que l’API obligerait à orchestrer, et les modèles ont été largement entraînés sur la documentation publique de ces commandes. Le serveur distant évite d’installer le CLI dans l’environnement de l’agent, ce qui ouvre ces opérations aux plateformes d’agents hébergées sur le web, comme Gemini Enterprise. Les commandes s’exécutent dans un bac à sable isolé, derrière un proxy au réseau restreint et sans identifiants ambiants (ambient credentials), chacune avec les droits IAM de l’identité appelante, authentifiée par Agent Identity ou OAuth 2.0 ; Model Armor peut filtrer prompts et réponses, et chaque appel peut être consigné dans les journaux d’audit. Le serveur n’est pas facturé en soi : seules les ressources créées et les éventuels transferts de données le sont.

🔗 Empower your agents with the Google Cloud CLI remote MCP server (blog Google Cloud)


Brèves

  • Codex CLI 0.159.2 — Publiée le 29 septembre à 23 h 57 UTC, cette version ne contient qu’un correctif rétroporté : sous Windows, les fenêtres de console ne clignotent plus quand Codex lance des processus d’arrière-plan ou des commandes dans son bac à sable. 🔗 source
  • Plaid dans Amp — Les modes d’Amp qui utilisent GPT-6 Astra gagnent Plaid, fondé sur le palier ultrarapide d’OpenAI : requêtes jusqu’à 6 fois plus rapides pour un coût par token multiplié par 6, réservé à l’inférence fournie par Amp ; les sous-agents restent en vitesse fast ou standard, et Amp ne publie aucun prix. 🔗 source
  • Warp et Factories as Code — Warp présente la configuration de ses usines logicielles comme « le Terraform des agents » : un dépôt décrit agents, automatisations, accès et mesure. Le format factory.yaml date de fin août ; le guide interactif détaille l’accès fédéré à AWS ou GCP, les webhooks et les intégrations Slack, Linear ou Jira. 🔗 fil de Warp · 🔗 guide de configuration
  • Devin chez Crosby — Dans une étude de cas de Cognition, le cabinet d’avocats new-yorkais Crosby, une douzaine d’ingénieurs pour plus de 50 avocats, confie à Devin la première réponse aux incidents : 20 à 40 bugs et alertes examinés par jour, en environ 5 minutes pour la plupart, et au moins 50 % de bruit Sentry en moins. 🔗 source
  • claude.dev — Anthropic présente officiellement claude.dev comme la maison des développeurs qui construisent avec Claude : plongées techniques, guides Claude Code et API, rubriques Agents, Engineering, Playbooks et Skills, et une page Terminal en surprise cachée. Des billets du site étaient déjà relayés depuis le 22 septembre. 🔗 source
  • Sites de ChatGPT modifiables — Selon les notes de version du 29 septembre, un Site publié se modifie avec Edit site et se planifie depuis Automations sur Plus et Pro ; en Enterprise, des Sites privés peuvent s’appuyer sur les applications connectées, avec un réglage Allow use in Sites par plugin, désactivé par défaut. 🔗 notes de version de ChatGPT · 🔗 notes Enterprise et Edu
  • Kimi Work 3.2.15 — La version du 30 septembre ouvre la co-édition humain-IA des documents Notion et Feishu dans le navigateur intégré, replie par défaut le déroulé de l’agent et corrige la corruption de fichiers lors de l’édition simultanée d’un PPT. 🔗 source
  • Cue gère les finances — L’application d’agents personnels lancée avec Manus 2.0 suit désormais abonnements et tendances de dépenses et met les comptes bancaires en pilote automatique, via Plaid ; ni pays, ni formule, ni conditions précisés. 🔗 source
  • GPT-6.1 Sol dans Genspark — Genspark ouvre GPT-6.1 Sol dans AI Chat, Code Agent et Claw au lendemain de son lancement, en reprenant l’argumentaire d’OpenAI (une intelligence proche d’Astra pour un cinquième de son prix API), sans forfait ni coût en crédits précisés. 🔗 source
  • Qwen3.8-27B-pi — Thomas Kim publie sous Apache-2.0 un affinage de Qwen3.8-27B pour le harnais Pi qui remet dans l’ordre les niveaux d’effort : sur Terminal-Bench 2.1, le niveau medium égale la base en xhigh (67 tâches sur 89) avec environ 41 % de tokens de sortie en moins. 🔗 source
  • Qwen3.8-27B chez Nebius — Qwen relaie l’arrivée de son modèle dense de 27 milliards de paramètres sur Nebius Token Factory, annoncée le 28 septembre, pour le code, la recherche et les flux agentiques ; ni prix ni débit communiqués. 🔗 source
  • Bekko System One v0 — Yuichi Tateno publie trois modèles de décision de 17M, 68M et 400M de paramètres, dont les deux plus petits tournent dans un navigateur, et le banc S1MB : le 400M obtient 50,60 contre 59,59 pour Jev 1.13, mais 54,48 contre 96,27 en généralisation. 🔗 source
  • ZooWork Instinct Tuned 4B — SRP publie sous Apache-2.0 un modèle de décision de 4 milliards de paramètres, bâti sur Qwen3.5-4B, qui note les options en une passe sans décoder : 198 sur 231 (85,71 %) sur les tâches publiques de JevBench, utilisées pendant le développement, précisent les auteurs. 🔗 source
  • Transformers v5.18.0 — Hugging Face ajoute quatre architectures, Nemotron 3 Diarization et NemotronH Omni de NVIDIA, HyperCLOVAX Vision V2 de NAVER et GTE, et signale six changements cassants. 🔗 source
  • TaskSmith — Adithya S K, qui travaille sur les environnements d’apprentissage par renforcement chez Hugging Face, publie un orchestrateur qui transforme une pull request en environnement RL vérifiable : 50 environnements tirés de TRL, PEFT, Accelerate, Diffusers et Transformers, livrés en tâches Harbor. 🔗 source
  • TraceML 0.4.1 — L’outil open source mesure désormais tout le groupe d’une mise à jour d’optimiseur ; sur ResNet-50 et un GPU T4, l’attente des données passe de 23 % du pas à moins de 2 ms après réglage du chargement, pour un surcoût médian de 0,35 %. 🔗 source
  • Transformeur bouclé — Sur un modèle jouet de 54 106 paramètres et 260 cas vérifiables, à budget égal de 80 passes de bloc, une boucle apprend les 260 cas, deux boucles 125,3 et huit 37,0 en moyenne : multiplier les passes n’a pas rendu l’apprentissage plus économique. 🔗 source
  • Une évaluation qui sait dire non — Le tutoriel d’Eric Mey montre, sur le sentiment de critiques de films (SST-2), une évaluation qui rejette un modèle pourtant meilleur de 7 points sur des données réservées, parce qu’un comportement critique se dégrade ; ses scripts tournent en moins d’une minute sur processeur. 🔗 source
  • 10 000 assurés synthétiques — Intelligent Actuaries publie sous CC-BY-4.0 une étude synthétique des chutes et rachats d’assurance vie : 10 000 assurés fictifs dans dix marchés, soit 27 692 enregistrements police-année 2023-2025 au format de l’enquête SOA-LIMRA. 🔗 source
  • cuObject et SCADA Server SDK — NVIDIA passe en disponibilité générale les bibliothèques cuObject d’accès au stockage objet par RDMA, sans passer par la mémoire du CPU, et lance le SCADA Server SDK, prototypé par IBM avec Storage Scale, dans une initiative Storage-Next de plus de 40 acteurs. 🔗 source
  • NeMo Relay et Hermes Agent — Un tutoriel de NVIDIA cosigné par Teknium, de Nous Research, trace un agent Hermes : sur 108 exécutions, des correctifs d’outils font passer Qwen3 Coder 30B de 19 à 22 réussites sur 27, au prix de 4,9 appels de modèle au lieu de 3,8. 🔗 source
  • OpenShell pour OpenClaw Enterprise — NVIDIA propose son environnement open source OpenShell pour gouverner les agents d’OpenClaw Enterprise, plan de contrôle open source pour agents persistants annoncé la veille par la fondation OpenClaw avec Red Hat, NVIDIA et OpenAI. 🔗 source
  • Essais de GitHub Advanced Security — Les clients GitHub Team peuvent lancer eux-mêmes un essai de GitHub Code Security et GitHub Secret Protection, depuis la page Overview de l’organisation, la page de facturation ou un Risk Assessment ; durée non précisée. 🔗 source
  • GHE.com et X25519 — À partir du 7 octobre 2026, GitHub Enterprise Cloud avec résidence des données refusera les clients TLS qui ne proposent que X25519 pour l’accord de clés ; P-256 et P-384 restent pris en charge et SSH n’est pas concerné. 🔗 source
  • Deux études de cas chez Runway — La marque française de boissons Bonjour a produit plus de 500 variantes publicitaires avec Runway et réaffecté plus de 50 000 euros de production ; la World Juggling Federation a confié à une seule personne l’habillage d’une émission d’une heure pour ESPN. 🔗 Bonjour · 🔗 World Juggling Federation
  • Ad Variants chez Luma — Luma met en avant une fonction qui décline une publicité terminée en plusieurs tailles et pour plusieurs marchés au sein d’une même campagne, sans tarif, forfait ni date de lancement, et sans billet. 🔗 source
  • Microduck en production — Pollen Robotics annonce que 10 950 Microduck, son petit robot bipède à 399 dollars entraîné en simulation, à la pile d’apprentissage par renforcement open source, sortiront de la ligne entre le 10 décembre et le 10 janvier, par lots hebdomadaires. 🔗 source
  • Cognition recrute — L’éditeur de Devin accueille Chris Degnan, ancien CRO de Snowflake, comme directeur des revenus, au lendemain de l’arrivée d’Alex Stamos comme responsable de la sécurité des systèmes d’information (CISO). 🔗 Chris Degnan · 🔗 Alex Stamos
  • Claude Founder House — Anthropic organise des journées pour fondateurs à San Francisco pendant la SF Tech Week (du 6 au 8 octobre, à la Terra Gallery) et à Stockholm le 14 octobre, avec conférences, ateliers et créneaux avec son équipe Applied AI. 🔗 source
  • AI Engineer Paris — Mistral fait le bilan de l’événement tenu la semaine précédente à Station F : plus de 900 participants, 60 intervenants, 57 conférences et 22 partenaires, sans annonce de produit. 🔗 source
  • Bourses doctorales NVIDIA — Les candidatures au Graduate Fellowship Program 2027-2028 sont ouvertes jusqu’au 30 octobre 2026, avec jusqu’à 60 000 dollars par doctorant ; plus de 220 bourses ont été accordées depuis 2002. 🔗 source

Ce que ça signifie

La sécurité fixe désormais le calendrier des modèles de frontière. Gemini 4 Argon prolonge la logique du Fairwind Program : les défenseurs cyber de confiance le reçoivent d’abord, sans garde-fous cyber, et les autres suivront « dès que possible », sans date, le temps de renforcer les protections. Le même jour, OpenAI montre l’autre face du problème : ce qu’il faut protéger n’est plus seulement le modèle, mais aussi son raisonnement. Qu’elle soit ou non le fait d’un seul acteur, la campagne dont OpenAI attribue le noyau à des individus associés à Moonshot AI fait de la trace de raisonnement un actif à défendre, avec des parades techniques et un partage d’informations entre laboratoires et gouvernements.

Une bonne part des chiffres du jour vient de mesures conçues ou conduites par ceux qui annoncent. Cohere évalue Embed 5 avec la métrique qu’il publie le même jour, et prévient lui-même que ses modèles pourraient paraître moins bons à l’ancienne mesure ; HeyGen s’appuie sur un Elo interne, Hunmin sur un protocole maison, avec une seule exécution pour les bancs d’agent, et sur Reality Check, c’est l’organisateur qui a affiné les modèles. À l’inverse, Perplexity soumet son modèle à l’aveugle sur un banc privé de turbopuffer, et l’Open TTS Leaderboard comme AURORA remplacent les votes ou la traduction automatique par des tâches et des mesures vérifiables. Avant de comparer deux scores, il faut regarder qui les a produits.

La génération d’images et de vidéos se juge de plus en plus sur l’usage et sur le coût. Ideogram 4.5 ne promet pas une image plus belle, mais une image qui supporte des retouches en série ; HeyGen Video se vend à la seconde, moins cher que tous les modèles de sa grille, et montre qu’un modèle de base comme MiniMax H3 peut donner des déclinaisons spécialisées, de HeyGen à Creatify. Runway Ads boucle la chaîne jusqu’à la dépense publicitaire, et la valorisation d’ElevenLabs, doublée depuis février, repose sur la demande des entreprises en agents conversationnels.

Côté développeurs, le harnais devient un produit à part entière, distinct du modèle. VS Code adopte le harnais de Copilot pour aligner son agent sur l’app et le CLI, HydraFusion coordonne plusieurs modèles dans un même tour, Zed laisse l’agent choisir un modèle par sous-agent et Manus ouvre son harnais aux clés API de fournisseurs tiers. Gemini CLI exécute désormais ses plans sans humain en mode non interactif, Claude Code resserre --bare pour les usages scriptés, et Google Cloud expose gcloud et bq aux agents dans un bac à sable, avec les droits IAM de l’appelant. La demande se lit jusque dans l’infrastructure : le premier client de Vera Rubin NVL72 en production chez CoreWeave est Cognition, l’éditeur de Devin.


Sources