Anthropic ajoute deux fonctions à Claude, Claude Dashboards pour des tableaux de bord tenus à jour et Claude Motion pour des animations écrites en code, et fait sortir Docs, Slides et Design de bêta sur tous les forfaits, Free compris. Le même jour, l’entreprise lance sa Cyber Mission, avec un programme de défense des infrastructures critiques et OSS Scanner, qui offre aux projets open source des scans gratuits par ses modèles les plus puissants. OpenAI déploie de son côté le palier Ultrafast pour GPT-6.1 Sol, jusqu’à 8 fois plus rapide que le mode Standard, tandis qu’Anthropic et NVIDIA s’engagent dans la Genesis Mission, à hauteur de 150 millions et de 1 milliard de dollars.
Claude Dashboards et Claude Motion en bêta, Docs, Slides et Design sur tous les forfaits
8 octobre — Anthropic ajoute deux fonctions à Claude. Avec Claude Dashboards, en bêta sur les forfaits payants, on connecte une plateforme de données de l’entreprise (Amazon Redshift, BigQuery, ClickHouse, Databricks ou Snowflake) ou un autre connecteur, comme les opportunités Salesforce, puis on pose une question en langage courant : Claude écrit la requête, construit le tableau de bord et le tient à jour quand les données changent. Un clic sur un chiffre affiche la requête qui le produit, et chaque graphique indique quand ses données ont été actualisées. Anthropic le destine aux questions rapides et exploratoires ; pour aller plus loin, le tableau de bord part vers Amplitude, Grafana, Hex, Mixpanel, Omni, Perplexity, PostHog ou Sigma, en attendant Looker, monday.com et Tableau.
Claude Motion, en bêta sur Team et Enterprise, vise les courtes animations : une vidéo explicative de 30 secondes tirée d’un rapport trimestriel, un graphique animé dans une présentation ou une démonstration de produit. Comme aucun modèle de génération vidéo n’intervient, l’animation ne contient ni séquences ni personnes générées par IA.
Claude Motion turns reports, charts, or product walkthroughs into short animations. Claude writes each one as code, with no video model involved, so you can change any word, number, or timing, then export an MP4. In beta on Team and Enterprise plans.
🇫🇷 Claude Motion transforme des rapports, des graphiques ou des démonstrations de produit en courtes animations. Claude écrit chacune d’elles en code, sans aucun modèle vidéo, si bien que vous pouvez modifier n’importe quel mot, nombre ou minutage, puis exporter un MP4. En bêta sur les forfaits Team et Enterprise. — @claudeai sur X
Le même jour, Claude Docs, Slides et Design perdent l’étiquette bêta et passent sur tous les forfaits, Free compris. Selon Anthropic, plus de 45 millions de documents, présentations et designs ont été créés depuis leur arrivée dans les conversations, le 16 septembre. La sortie de bêta apporte la prise en charge de CMEK pour les artefacts, le choix des modèles d’artefacts par les administrateurs, l’édition à plusieurs avec Claude, le partage hors de l’organisation si l’administrateur l’autorise, des exports PowerPoint et PDF fidèles à l’éditeur, l’envoi direct vers Google Slides et la modification depuis l’application mobile.
| Fonction concernée | Statut au 8 octobre | Forfaits concernés |
|---|---|---|
| Claude Dashboards | Bêta | Forfaits payants |
| Claude Motion | Bêta | Team et Enterprise |
| Claude Docs, Slides et Design | Sortie de bêta | Tous, Free compris |
| claude.ai/design (site autonome) | Ouvert jusqu’au 14 décembre | — |
Conséquence pratique : le site autonome claude.ai/design, désormais intégré à Claude, reste ouvert jusqu’au 14 décembre. Les systèmes de design (design systems) d’une organisation se migrent en une fois depuis la page Artifacts, mais les conversations et commentaires du site autonome, ainsi que ses liens publics, disparaîtront à sa fermeture. En Enterprise, Dashboards et Motion sont désactivés par défaut, tandis que Docs, Slides et Design s’activeront par défaut le 15 octobre.
🔗 Billet Claude : Dashboards et Motion · Fil @claudeai
Runway et Luma, partenaires de lancement de Claude Motion
8 octobre — Deux acteurs de la vidéo générative se présentent comme partenaires de lancement de Claude Motion. Chez Runway, toute animation peut être exportée pour y ajouter des séquences générées, retoucher des plans en décrivant le changement voulu et faire assembler par Runway Agent un montage plus long autour de l’animation ; un même 16:9 peut aussi y être décliné en formats vertical et carré. Chez Luma, les animations s’ouvrent directement grâce au connecteur Luma (MCP) ajouté dans Claude : les modèles vidéo Ray et Uni les restylisent en conservant le mouvement, les recadrent en 9:16, 1:1, 4:3 ou 21:9, et l’agent Luma en produit d’autres versions. Ni Runway ni Luma ne précisent de tarif ou de coût en crédits. Anthropic cite aussi Adobe, Descript, HeyGen, Higgsfield et invideo parmi les outils où prolonger une animation, Canva et Captions étant annoncés pour bientôt.
🔗 Billet de Runway · Billet de Luma
Anthropic Cyber Mission : un programme pour les infrastructures critiques et OSS Scanner pour l’open source
8 octobre — Deux jours après avoir élargi son Cyber Verification Program, Anthropic lance l’Anthropic Cyber Mission, présentée comme un engagement de long terme pour sécuriser les systèmes dont tout le monde dépend. Le constat de départ vient de Project Glasswing : trouver des vulnérabilités n’a jamais été aussi facile, mais les vérifier, les hiérarchiser et les corriger reste difficile. La mission démarre sur deux terrains, les infrastructures critiques et les logiciels open source ; d’autres domaines sont annoncés, sans date.
Pour les infrastructures critiques, le Critical Infrastructure Defense Program (CIDP) apporte des modèles Claude de frontière, des ingénieurs sur site et la recherche d’Anthropic sur les menaces aux prestataires des exploitants de technologies opérationnelles : automates, logiciels de contrôle et réseaux industriels de l’électricité, de l’eau ou des transports, qu’on ne peut souvent pas arrêter pour appliquer un correctif. Onze partenaires fondateurs y participent : Accenture, Booz Allen, CrowdStrike, Deloitte, Dragos, Hitachi, Insane Cyber, Nozomi Networks, Palo Alto Networks, PwC et Rockwell Automation. Le programme commence par une petite cohorte et doit s’étendre à d’autres partenaires et secteurs dans les prochains mois.
Pour l’open source, OSS Scanner, inspiré d’OSS-Fuzz de Google, offre gratuitement aux projets inscrits des scans périodiques par les modèles les plus puissants d’Anthropic, Claude Mythos compris. Chaque rapport comprend un reproducteur, une explication et, quand il existe, un correctif candidat, mais il part sans relecture humaine : Anthropic attend un taux de vrais positifs au-dessus de 90 % et prévient que certains rapports contiendront des erreurs, comme une sévérité mal évaluée. Le service répond au goulet d’étranglement décrit par l’équipe Frontier Red Team : les vulnérabilités trouvées dépassent de loin ce que des humains peuvent trier.
| Indicateur publié par Anthropic | Valeur publiée |
|---|---|
| Vulnérabilités candidates trouvées en six mois | Plus de 29 000 |
| Vulnérabilités revues et triées à la main | Environ 6 000 |
| Vulnérabilités critiques ou élevées vérifiées (48 projets) | 97 |
| Retenues au niveau exigé pour la divulgation coordonnée (CVD) | 85, soit 88 % |
| Réelles mais en double, ou invalides | 11 et 1 |
| Part des vulnérabilités trouvées par les LLM sur le banc CyberGym | Moins de 20 % au début de l’an dernier, plus de 85 % cette année |
wolfSSL indique que, sur 74 rapports reçus, tous sauf deux étaient valides et cinq sont devenus des CVE. L’inscription passe par une pull request sur le dépôt GitHub anthropics/oss-scanner, réservée aux mainteneurs principaux de projets jugés critiques, au cas par cas, et le Defender Advantage Fund lancé en août garde le service gratuit. La prévision d’Anthropic est prudente : d’ici deux ans, l’IA favorisera la défense, mais pas forcément à court terme, puisque l’exploitation coûte moins cher alors que la vérification, la divulgation et la correction restent lentes.
🔗 Billet Anthropic : Anthropic Cyber Mission · Billet Frontier Red Team sur OSS Scanner · Dépôt anthropics/oss-scanner
Ultrafast pour GPT-6.1 Sol : jusqu’à 8 fois plus rapide, à 12 et 60 dollars par million de tokens
8 octobre — Annoncé « pour bientôt » le 29 septembre, le palier Ultrafast arrive sur GPT-6.1 Sol. OpenAI Developers indique qu’il se déploie le jour même dans l’API, dans Codex et dans ChatGPT Work, avec une intelligence présentée comme proche de GPT-6 Astra. OpenAI le destine aux travaux où chaque seconde compte : déboguer une panne, faire naviguer des agents dans des applications ou proposer des expériences en direct.
Ultrafast is rolling out today for GPT-6.1 Sol in the API, Codex, and ChatGPT Work. Near-Astra intelligence at up to 8x faster speeds than Sol Standard, so you can build as fast as the ideas come.
🇫🇷 Ultrafast se déploie aujourd’hui pour GPT-6.1 Sol dans l’API, Codex et ChatGPT Work. Une intelligence proche d’Astra, jusqu’à 8 fois plus rapide que Sol en mode Standard, pour construire aussi vite que viennent les idées. — @OpenAIDevs sur X
Dans l’API, il suffit d’appeler gpt-6.1-sol avec service_tier: "ultrafast" dans la Responses API. Le mode est ouvert à tous les utilisateurs de l’API, sous réserve des limites de débit, en traitement global et avec résidence des données aux États-Unis et dans l’Union européenne, alors que GPT-6 Astra en Ultrafast reste limité à la résidence américaine. Le tarif suit la règle déjà appliquée à Astra : six fois le prix Standard, soit 12 dollars par million de tokens en entrée et 60 dollars en sortie, cinq fois moins que GPT-6 Astra en Ultrafast (60 et 300 dollars).
| Mode de traitement de gpt-6.1-sol | Prix en entrée | Entrée en cache | Écriture de cache | Prix en sortie |
|---|---|---|---|---|
| Standard, contexte court | 2,00 dollars | 0,10 dollar | 2,50 dollars | 10,00 dollars |
| Fast, contexte court | 4,00 dollars | 0,20 dollar | 5,00 dollars | 20,00 dollars |
| Ultrafast, contexte court | 12,00 dollars | 0,60 dollar | 15,00 dollars | 60,00 dollars |
| Ultrafast, contexte long | 24,00 dollars | 1,20 dollar | 30,00 dollars | 90,00 dollars |
Tarifs par million de tokens, page Pricing de l’API au 8 octobre.
Dans Codex et ChatGPT Work, l’accès est réservé au forfait Pro 500, aux espaces Enterprise éligibles facturés à l’usage et aux offres Edu à crédits. En Enterprise, Ultrafast est désactivé par défaut et les propriétaires de l’espace de travail doivent l’activer, pour certains utilisateurs ou pour tous. La documentation de Codex détaille le coût : les limites incluses dans l’abonnement sont décomptées 8 fois plus vite qu’en mode Standard, et les crédits achetés comme l’usage Enterprise à la demande sont facturés six fois plus cher. Les autres forfaits en libre-service n’y ont pas accès au lancement, même avec des crédits achetés.
🔗 Changelog de l’API OpenAI · Tarifs de l’API OpenAI · Ultrafast dans Codex (documentation)
Science : 150 millions de dollars d’Anthropic et 1 milliard de NVIDIA pour la Genesis Mission, une carte du ciel en ultraviolet
Deux engagements dans la Genesis Mission, le programme fédéral américain qui veut accélérer la découverte scientifique par l’IA, ont été annoncés le 8 octobre au même sommet, « Science: A New Golden Age », organisé à Washington par l’Office of Science and Technology Policy (OSTP) de la Maison-Blanche. Le même jour, Anthropic montre ce que Claude Science peut produire pour un astrophysicien.
Anthropic : 150 millions de dollars sur trois ans et Claude pour plus de 15 agences fédérales
8 octobre — Anthropic engage 150 millions de dollars sur trois ans dans la Genesis Mission. Le financement doit rendre Claude accessible à plus de 15 agences membres de la mission, dont la NASA, les National Institutes of Health et la National Science Foundation. Concrètement, Anthropic fournira Claude, Claude Code et des crédits API à plusieurs centaines de projets de recherche, travaillera avec les agences et les laboratoires nationaux sur les priorités de l’administration, dont l’énergie de fusion et l’informatique quantique, et assurera formation et support technique. L’engagement prolonge le partenariat noué en décembre 2025 avec le Département de l’Énergie ; en juillet, Google DeepMind (40 millions de dollars) et OpenAI (17 millions de dollars) avaient annoncé leurs propres engagements dans la mission.
🔗 Billet Anthropic : engagement dans la Genesis Mission · Tweet @AnthropicAI
NVIDIA : 1 milliard de dollars sur cinq ans pour la science américaine
8 octobre — Au même événement, NVIDIA annonce des engagements d’une valeur de 1 milliard de dollars sur cinq ans, pour développer la capacité des États-Unis en recherche et développement sur la superintelligence dans des domaines comme l’informatique quantique, la santé et la sécurité énergétique. Le communiqué cite trois volets, sans répartir le montant : le soutien aux établissements de recherche universitaires, des investissements pour accélérer le leadership américain en informatique quantique et le soutien aux fournisseurs cloud qui servent les missions du gouvernement. NVIDIA dit aussi collaborer à plusieurs projets financés lors de la phase 2 de la Genesis Mission, annoncés le même jour, en informatique quantique, fusion, conception d’accélérateurs et microélectronique, et rappelle son partenariat avec le DOE, qui comprend le plus grand supercalculateur scientifique du département, à l’Argonne National Laboratory.
La première carte complète du ciel en ultraviolet, produite avec Claude Science
8 octobre — Le blog Anthropic Science raconte comment Brice Ménard, astrophysicien à l’université Johns Hopkins et chercheur chez Anthropic, a produit avec Claude Science ce qu’Anthropic présente comme la première carte complète du ciel en ultraviolet. Le relevé spatial GALEX (NASA, 2003-2013) n’en couvrait qu’environ deux tiers, en quelque 38 000 observations. Claude a orchestré des agents qui ont rassemblé et calibré entre eux les relevés publics, puis comblé le tiers manquant par reconstruction (inpainting), à partir de la relation entre l’ultraviolet et les autres longueurs d’onde. Sur des zones masquées volontairement, les estimations tombent à environ 10 % des mesures réelles.
The work would have taken humans weeks of work, but, with Claude, just took a few days while Ménard worked on other projects.
🇫🇷 Ce travail aurait demandé des semaines à des humains, mais, avec Claude, il n’a pris que quelques jours pendant que Ménard travaillait sur d’autres projets. — @AnthropicAI sur X
Usages interdits et abus : la politique d’utilisation 2026 d’Anthropic et deux opérations d’influence démantelées par OpenAI
Deux publications du 8 octobre montrent ce que les laboratoires interdisent et comment ils traquent les abus : Anthropic réécrit sa politique d’utilisation, OpenAI détaille deux opérations d’influence qu’elle a bannies.
Anthropic publie la version 2026 de sa politique d’utilisation, en vigueur le 12 novembre
8 octobre — Anthropic publie la mise à jour annuelle de sa politique d’utilisation (Usage Policy), qui entrera en vigueur le 12 novembre. Il s’agit surtout de clarifications, nourries par les abus observés. Une nouvelle section regroupe les règles sur les campagnes trompeuses et l’activité artificielle, jusque-là dispersées, et vise toute activité trompeuse, politique ou commerciale, y compris la construction d’outils pour des opérations d’influence. La section électorale, renommée « ne pas porter atteinte aux processus démocratiques » (Do Not Undermine Democratic Processes), abandonne l’interdiction générale du ciblage personnalisé des électeurs, qui bloquait des usages civiques comme l’information des électeurs dans d’autres langues. Le texte précise aussi que l’interdiction des armes couvre leurs logiciels et composants ainsi que l’armement de drones, interdit de suivre des personnes sans leur consentement et proscrit, dans les cas extrêmes seulement, les comportements abusifs soutenus et gratuits envers les modèles.
🔗 Billet Anthropic : mise à jour 2026 de la politique d’utilisation
OpenAI démantèle Dark Clark et Bogus Bylines, dont sa première opération de catégorie 5
8 octobre — OpenAI publie un rapport sur deux opérations d’influence clandestines qu’elle a bannies, qui faisaient vivre de fausses entités (false front) avec l’aide de ses modèles. « Dark Clark », d’origine russe, visait l’Amérique latine : ses opérateurs rédigeaient surtout leurs rapports internes avec ChatGPT et pilotaient un pseudo-centre de recherche, le Social Research Center, animé par un personnage fictif, « Mia Clark ». « Bogus Bylines », d’origine iranienne, a placé près de 100 articles sous sept fausses signatures de journalistes occidentaux dans une douzaine de médias en ligne, dont l’un comptait près de 2 millions d’abonnés sur Facebook. OpenAI dit avoir exposé 30 opérations de ce type en deux ans et demi.
| Opération démantelée | Origine des comptes | Cible principale | Catégorie sur l’IO Breakout Scale (1 à 6) |
|---|---|---|---|
| Dark Clark | Russie | Amérique latine | 5, une première selon OpenAI |
| Bogus Bylines, articles | Iran | Médias en ligne internationaux | 4 |
| Bogus Bylines, commentaires | Iran | Réseaux sociaux | 2 |
🔗 Rapport d’OpenAI sur les opérations à fausse façade
Claude Haiku 5.5 chez les tiers : GitHub Copilot l’ouvre dès la formule Pro, Devin le mesure à 58,4 %
Lancé le 7 octobre, Claude Haiku 5.5 est arrivé le jour même dans deux outils de code, qui le comparent chacun à Claude Sonnet 5.
GitHub Copilot : Haiku 5.5 sur toutes les formules payantes, Pro compris
7 octobre — Un peu plus de deux heures après son lancement par Anthropic, Claude Haiku 5.5 arrive en disponibilité générale dans GitHub Copilot pour les formules Pro, Pro+, Max, Business et Enterprise : Pro compris, comme Claude Sonnet 5.5 et contrairement à GPT-6.1 Sol fin septembre. Il se choisit sur dix surfaces, de VS Code à Xcode. GitHub le destine aux sous-agents, aux modifications rapides et aux tâches dans le terminal ; selon ses premiers tests, il a égalé Claude Sonnet 5 sur de nombreuses tâches de code avec nettement moins de tokens et d’étapes, sans chiffre publié. Il est facturé au tarif public : 0,10 dollar par million de tokens en entrée et 0,50 dollar en sortie jusqu’à 100 000 tokens d’entrée, puis 0,50 et 2,50 dollars, soit dix fois moins que Claude Haiku 4.5 sur le premier palier.
🔗 Claude Haiku 5.5 dans GitHub Copilot · Modèles et tarifs de GitHub Copilot
Devin : 58,4 % sur FrontierCode 1.1, devant Claude Sonnet 5
7 octobre — Cognition ouvre Claude Haiku 5.5 dans Devin. Sur FrontierCode 1.1, son benchmark propriétaire qui note les modèles sur des tâches d’ingénierie réelles selon la qualité du code et sa capacité à être fusionné, Haiku 5.5 obtient 58,4 %, devant Claude Sonnet 5, pour environ un huitième de son coût par tâche selon Cognition, qui ne donne pas de montant précis. Il rejoint aussi les acolytes (sidekicks) de Devin Fusion, qui associe un modèle principal à un modèle d’appoint : avec Claude Opus 5.5 en modèle principal et Haiku 5.5 en appoint, Fusion conserve un score de 66,2 tout en réduisant le coût et la latence.
| Modèle évalué par Cognition | Score FrontierCode 1.1 Extended |
|---|---|
| Claude Sonnet 5 | 56,2 |
| Kimi K3 | 58,2 |
| Claude Haiku 5.5 | 58,4 |
| GPT-6.1 Sol | 60,4 |
| Claude Sonnet 5.5 | 64,4 |
| Claude Opus 5.5 | 65,3 |
Agents de code : Claude Code 2.1.295, Codex CLI 0.162.0, Antigravity CLI 1.3.1, VS Code 1.141 et Delta 0.19
Cinq outils d’agents de code évoluent : Claude Code durcit ses hooks, Codex CLI gère des worktrees, Antigravity CLI repense la relecture des modifications, VS Code range les sessions d’agents en grille et Delta s’ouvre au travail en équipe.
Claude Code 2.1.295 : des hooks qui bloquent quand ils échouent
8 octobre — Claude Code a connu deux versions dans la journée. La 2.1.294 corrige les hooks prompt et agent rédigés comme des consignes en langage naturel, qui pouvaient laisser passer ce qu’ils devaient bloquer. La 2.1.295 compte 143 entrées, dont 97 correctifs. Avec la nouvelle option onFailure: "block" des hooks command et HTTP, un hook qui ne démarre pas, expire ou renvoie un code inattendu bloque l’action au lieu de la laisser passer ; plusieurs correctifs vont dans le même sens, pour les gardes des mods et les options --tools et --restricted. Claude Code prend aussi en charge le Program Status Protocol (OSC 7501), qui permet aux terminaux compatibles d’afficher si l’agent travaille, attend ou a terminé, et les descriptions d’outils MCP chargées par la recherche d’outils passent de 2 048 à 16 384 caractères.
🔗 Claude Code 2.1.295 · Claude Code 2.1.294
Codex CLI 0.162.0 : worktrees gérés et tâches épinglées
8 octobre — Codex CLI 0.162.0, première version stable depuis la 0.161.0 de la veille, liste 225 PR. Quand la fonction worktrees est activée, Codex dispose d’outils pour créer et lister des worktrees Git gérés à partir de projets locaux de confiance, et le centre de commande des agents permet d’épingler une tâche avec la touche p, dans un groupe « Pinned » partagé quand le serveur le permet. Le terminal gagne /copy pour parcourir et copier les blocs de la transcription, Ctrl+Insert pour copier une sélection et un réglage de vitesse de défilement, et les URL deviennent cliquables jusque dans les approbations et les invites MCP. Les fournisseurs de modèles personnalisés compatibles avec la Responses API peuvent déclarer l’accès web en direct et la compaction distante. Côté correctifs, apply_patch préserve les fins de ligne CRLF, le bac à sable Linux est durci et les versions Windows reçoivent un installeur PowerShell signé.
🔗 Notes de version de Codex CLI 0.162.0
Antigravity CLI 1.3.1 : relecture repensée dans /diff, verbosité moyenne par défaut
7 octobre — La CLI d’Antigravity a publié cinq versions entre le 2 et le 7 octobre. La 1.3.1 soigne la relecture de code dans le terminal : dans la vue fichier de /diff, les flèches gauche et droite ouvrent le fichier voisin à sa première modification, chaque fichier retient sa position, n et N enchaînent sur le fichier suivant ou précédent, et l’en-tête indique où l’on se trouve. Ses dix correctifs touchent notamment /rewind dans les très longues conversations, les plugins sous Windows et les sessions par clé GEMINI_API_KEY, qui réessaient quand la connexion à l’API Gemini tombe. La 1.3.0 du 6 octobre fait passer la verbosité par défaut de « high » à « medium », qui regroupe appels d’outils et réflexions en résumés concis ; /config permet de revenir en arrière. Plus tôt, la 1.2.16 confiait la génération d’images à un sous-agent intégré et la 1.2.15 apportait des binaires Android pour Termux.
🔗 Changelog d’Antigravity, onglet CLI
VS Code 1.141 : sessions d’agents en grille et nettoyage des worktrees
7 octobre — VS Code 1.141 se concentre sur les sessions d’agents de Copilot. La fenêtre Agents peut disposer plusieurs sessions en grille, et la commande Chat: Open Worktree Cleanup affiche l’espace disque occupé par les worktrees des sessions inactives pour les supprimer, à la demande ou automatiquement une fois la pull request fusionnée. Les conversations lancées dans Copilot CLI ou dans l’app GitHub Copilot apparaissent dès leur première requête, sans recharger l’éditeur, et une conversation Codex ouverte dans l’app ChatGPT ou dans Codex CLI peut s’y poursuivre avec son historique : en choisissant un modèle Copilot, on continue avec son abonnement GitHub Copilot, par exemple après avoir atteint sa limite d’usage ChatGPT. Côté entreprise, le bac à sable du harnais Copilot peut être imposé par les réglages gérés, en préversion, et ce harnais devient progressivement le choix par défaut des utilisateurs dont les expérimentations sont activées.
🔗 Notes de version de VS Code 1.141
Delta 0.19 : mentions entre coéquipiers et boîte de réception
7 octobre — Zed Industries publie Delta 0.19.0, son environnement pour coder à plusieurs avec des agents, suivi le 8 octobre d’une 0.19.1 corrective. On mentionne désormais un coéquipier dans un message ou un commentaire en tapant @ suivi de son nom d’utilisateur, et la notification arrive dans une nouvelle boîte de réception (Inbox). L’agent @delta lit et modifie une grande partie des réglages depuis la conversation. Un réglage, Agent Thread Creation, empêche les agents de créer des conversations de premier niveau sans couper les sous-agents, l’agent peut fusionner les worktrees de plusieurs fils, et les commandes de la CLI s’exécutent sans ouvrir de fenêtre. Au total, les notes listent 11 nouveautés, 22 améliorations et 45 correctifs. Le 8 octobre, un billet relayé par Zed raconte comment l’équipe a remplacé Google Docs par Delta pour ses documents internes.
🔗 Notes de version de Delta · Billet de Delta sur l’abandon de Google Docs
Médias génératifs : Nano Banana 2.1, Brand Kit et ElevenReader au Brésil chez ElevenLabs, SemanTok de Stability AI
Quatre annonces autour de l’image, de la vidéo et de la voix : un modèle d’images deux fois moins cher chez Google, une charte graphique réutilisable et une application de lecture audio chez ElevenLabs, et une recherche sur la génération vidéo chez Stability AI.
Nano Banana 2.1 en disponibilité générale dans l’API Gemini, deux fois moins cher
6 octobre — Google a fait passer Nano Banana 2.1 (gemini-nano-banana-2.1) en disponibilité générale dans l’API Gemini et Google AI Studio, sans billet de blog. Ce modèle de génération et d’édition d’images met à jour Nano Banana 2, avec une meilleure qualité visuelle, un meilleur rendu du texte, des personnages plus cohérents d’un tour à l’autre et des formats panoramiques, de 1:4 à 8:1, sans artefacts de tuilage en 2K et 4K. Il accepte jusqu’à 14 images de référence et s’ancre dans la recherche Google. Le prix par image est divisé par deux en 1K et 2K, et Google déprécie Nano Banana 2 (gemini-3.1-flash-image), sans date d’arrêt.
| Prix de sortie | Nano Banana 2.1 | Nano Banana 2 |
|---|---|---|
| Image 1K | 0,0336 dollar | 0,067 dollar |
| Image 2K | 0,0504 dollar | 0,101 dollar |
| Image 4K | 0,113 dollar | 0,151 dollar |
| Million de tokens d’image | 30 dollars | 60 dollars |
🔗 Notes de version de l’API Gemini · Fiche de Nano Banana 2.1
Brand Kit d’ElevenLabs : la charte graphique rangée dans l’espace de travail
8 octobre — ElevenLabs ajoute Brand Kit à ElevenCreative, sa suite de création. Couleurs, polices, logos avec leurs règles d’usage, images de référence et règles de marque, y compris ce que la marque ne fait jamais, forment un seul objet de l’espace de travail, que l’on appelle par @ dans Image & Video, dans Flows ou auprès de l’agent ElevenCreative. Selon le fil d’ElevenLabs, un kit se crée en quelques minutes en collant l’adresse d’un site, ou en téléversant les ressources de l’organisation ; toute l’équipe génère alors à partir des mêmes consignes, et une agence peut créer un kit par client. ElevenLabs veut étendre les kits à la voix et au son de la marque, sans date. Brand Kit est disponible dès maintenant, sans tarif précisé ; HeyGen (août) et Runway (septembre) proposent déjà des outils comparables.
🔗 Billet ElevenLabs : Brand Kit · Fil @ElevenLabs
SemanTok de Stability AI : un modèle de 201M qui égale un modèle 3,4 fois plus gros
7 octobre — L’équipe Interactive Research de Stability AI présente SemanTok, un tokenizer vidéo pour les modèles de monde (world models) qui génèrent la vidéo token par token, annoncé sur X le 8 octobre. Dans les tokenizers « du grossier au fin » (coarse-to-fine), les premiers tokens décrivent la scène dans son ensemble et les suivants ajoutent les détails ; SemanTok rend ces premiers tokens plus riches en sens, donc plus faciles à prédire. Il injecte pour cela dans son encodeur des caractéristiques DINO figées et ajoute des têtes légères qui les reconstruisent à partir de chaque préfixe de tokens. Selon Stability AI, un modèle autorégressif de 201M de paramètres bâti sur SemanTok égale ou dépasse un modèle VideoFlexTok 3,4 fois plus gros, et les préfixes courts coûtent moins cher à prédire. L’article est sur arXiv ; ni code ni poids ne sont mentionnés.
🔗 Billet de recherche de Stability AI · Article sur arXiv
ElevenReader arrive au Brésil avec la voix de Fábio Porchat et 70 000 livres
8 octobre — ElevenLabs lance au Brésil ElevenReader, son application qui transforme livres, documents et articles en écoute, gratuite sur iOS et Android, avec la voix de l’acteur et humoriste Fábio Porchat. Le catalogue repose sur un partenariat avec Bookwire Brasil : 70 000 titres en portugais du Brésil, sous licence des principaux éditeurs du pays, dont la plupart n’avaient pas d’édition audio. ElevenLabs a aussi produit Dom Casmurro, de Machado de Assis, lu par Fábio Porchat avec une musique originale et un design sonore. Selon le directeur général de Bookwire Brasil, c’est la plus large sélection de livres brésiliens jamais proposée en audio.
| Offre au Brésil | Conditions d’accès |
|---|---|
| Application ElevenReader (iOS, Android) | Gratuite |
| Dom Casmurro lu par Fábio Porchat | Gratuit pour tous |
| 70 000 titres sous licence Bookwire | Avec ElevenReader Ultra, prix non indiqué |
🔗 Billet ElevenLabs : ElevenReader au Brésil
Modèles spécialisés : LightOnOCR-3 pour les documents, Falcon-ASR pour l’arabe, Carbon-A pour les génomes
Trois modèles spécialisés, dont deux à poids ouverts, pour lire des documents, transcrire l’arabe et annoter des génomes.
LightOnOCR-3 : trois modèles OCR ouverts qui repèrent aussi la mise en page
8 octobre — LightOn publie sous licence Apache 2.0 LightOnOCR-3, en trois tailles (0.8B, 1B et 4B). En plus de transcrire une page, les modèles savent en repérer chaque région : avec le prompt d’ancrage visuel (grounding), chaque bloc est précédé d’une boîte englobante étiquetée, les images reçoivent une courte description et les graphiques deviennent des tableaux HTML de données. Sur une H100, le 4B sert 21 % de pages par seconde de plus que Chandra-OCR-2, bâti comme lui sur Qwen3.5. LightOn précise que ses scores sont calculés après une normalisation des sorties, publiée avec le dépôt, qui modifie sensiblement ceux de tous les modèles de tête.
| Banc d’évaluation | LightOnOCR-3-4B | LightOnOCR-3-0.8B | LightOnOCR-3-1B | Référence citée |
|---|---|---|---|---|
| olmOCR-Bench, score global | 86,3 | 85,5 | 84,5 | Infinity Parser Pro (35,1B) 87,6 ; Chandra 2 85,8 |
| ParseBench, cinq catégories | 75,1 | 74,6 | 71,4 | Infinity Parser Pro 74,3 |
| fr-bench-pdf2md, documents français | 74,1 | 70,5 | 69,6 | Chandra 2 69,0 ; MistralOCR4.1 54,1 |
Falcon-ASR : 1,6 milliard de paramètres pour l’arabe émirien, sans poids publiés
7 octobre — Le Technology Innovation Institute (TII) d’Abou Dhabi présente Falcon-ASR, un modèle de reconnaissance vocale de 1,6 milliard de paramètres centré sur l’arabe, et en particulier sur le dialecte émirien. Le même jeu de poids transcrit aussi l’anglais, le français, l’espagnol et le portugais, sans qu’il faille préciser la langue, avec un horodatage de chaque mot. Comme Falcon-OCR-Arabic et Falcon-Emirati présentés la veille, il n’est proposé qu’en démonstration : TII annonce un accès par API et des applications natives, sans publier les poids.
| Évaluation du taux d’erreur sur les mots (WER) | Score de Falcon-ASR | Référence citée |
|---|---|---|
| Moyenne de six jeux arabes (Open Universal Arabic ASR) | 20,92 % | 23,17 %, meilleur résultat publié au 30 septembre |
| Émirien, évaluation interne de TII | 22,73 % | Qwen3-Omni, deuxième, 4,07 points au-dessus |
| Moyenne de sept jeux anglais (Open ASR Leaderboard) | 5,74 % | Aucune référence citée |
Carbon-A : 566 millions de gènes candidats sur 22 617 espèces
8 octobre — L’équipe biologie de Hugging Face (HuggingFaceBio) publie Carbon-A, un modèle de 1,2 milliard de paramètres sous licence MIT qui repère les régions codant des protéines directement dans l’ADN, avec un seul modèle pour mammifères, plantes, champignons et protistes. Sur 42 génomes de référence, il atteint un F1 nucléotidique moyen de 0,944 et devance, selon les auteurs, les sept outils comparés, dont AUGUSTUS, Helixer et Tiberius. L’équipe l’a fait tourner sur les génomes eucaryotes de GenBank pour bâtir la Carbon Annotation Database : 48 167 assemblages de 22 617 taxons et 566 millions de loci codants prédits, soit 11 fois plus de taxons que le corpus d’entraînement. Une validation en laboratoire avec ActiveSite et l’UCSD, par séquençage d’ARN complet, confirme une partie des gènes ; les auteurs précisent que cela prouve la transcription, pas encore la production des protéines. Un nouveau lot est prévu dans trois semaines.
Entraînement par renforcement : les 1 004 environnements de TermGrade et TRL v1.15.0
Deux publications pour l’apprentissage par renforcement : des environnements de terminal notés, et une bibliothèque qui allonge les séquences entraînables.
TermGrade : 1 004 environnements de terminal notés par six modèles
8 octobre — La société ai& publie TermGrade, 1 004 environnements de terminal pour entraîner et évaluer des agents par apprentissage par renforcement. Chaque tâche tourne dans un conteneur Linux avec une consigne et des tests, et n’a été retenue que si sa propre solution de référence passait ses tests : sur 66 165 tâches candidates écrites par DeepSeek-V4-Pro, 1,5 % ont franchi ce filtre. Six configurations de modèles ouverts, de Kimi-K3 à gemma-4-31B-it, ont passé chaque tâche, et les 36 144 tentatives sont publiées, échecs compris. Un modèle apprend le plus des tâches qu’il réussit environ une fois sur deux : entraîné sur 151 tâches de cette zone, gemma-4-31B-it atteint 46,1 sur Terminal-Bench 2.1, soit 3,1 points de plus que le modèle de base, et 2,1 points en moyenne sur cinq entraînements. Tout est publié sous Apache-2.0.
🔗 Billet TermGrade · Collection TermGrade sur Hugging Face
TRL v1.15.0 : une tête LM fusionnée pour des séquences jusqu’à 6,9 fois plus longues
8 octobre — TRL v1.15.0, la bibliothèque d’entraînement de Hugging Face, apporte une tête LM fusionnée (fused LM head) qui calcule directement les log-probabilités et l’entropie de chaque token avec un noyau Triton, sans jamais construire le tenseur complet des logits ; elle est activée par défaut pour SFT, DPO, KTO, GRPO, RLOO et la distillation. À 8 192 tokens, le pic de mémoire baisse de 52 à 82 % selon la méthode. Ces mesures ont été faites sur une B300 bridée à 79 Gio avec les poids aléatoires de gemma-3-1b, dont le vocabulaire compte 262 000 tokens ; le gain est le plus fort pour les petits modèles à grand vocabulaire. La version rompt aussi la compatibilité : fin de Python 3.10, use_liger_kernel déprécié et entraîneur expérimental MiniLLM retiré.
| Méthode d’entraînement | Longueur maximale en v1.14.2 (tokens) | Longueur maximale en v1.15.0 (tokens) | Facteur de gain |
|---|---|---|---|
| DPO | 10 240 | 59 392 | ×5,80 |
| KTO (lot de 2) | 9 216 | 63 488 | ×6,89 |
| GRPO | 28 672 | 114 688 | ×4,00 |
| RLOO | 23 552 | 100 352 | ×4,26 |
| SFT (perte nll) | 20 480 | 107 520 | ×5,25 |
Inférence : llama.cpp dans Windows ML, ML Drift en open source, Together AI sur des B300 d’IBM Cloud
Trois annonces pour faire tourner les modèles, du PC Windows au cluster de GPU.
llama.cpp arrive dans Windows ML, en expérimental
7 octobre — Lors de son événement Windows, Microsoft ajoute à Windows ML, son cadre d’inférence locale, une prise en charge expérimentale de llama.cpp : on récupère un modèle GGUF sur Hugging Face et on l’exécute en local via la même pile Windows ML, à l’aide de nouvelles API dédiées à des tâches précises. Une API d’exécution native de Windows, plus bas niveau, passe aussi en préversion expérimentale. Microsoft dit contribuer directement au projet llama.cpp avec NVIDIA et la communauté : noyaux CUDA optimisés, meilleur ordonnancement entre processeur et GPU, CUDA graphs, décodage spéculatif (Eagle-3, MTP, D-Flash2), exécution sur plusieurs GPU et format NVFP4. Le billet place ces nouveautés sur les PC équipés de puces NVIDIA RTX Spark, comme le Surface Laptop Ultra. Sur X, Georgi Gerganov, de llama.cpp, salue la présence du projet à l’événement Windows et y voit le signe que les piles logicielles et matérielles se rejoignent enfin.
🔗 Billet Microsoft Foundry on Windows · Tweet @ggerganov
ML Drift : le moteur GPU de LiteRT publié en open source
8 octobre — L’équipe Google AI Edge publie en open source, sous licence Apache 2.0, ML Drift, son moteur de calcul GPU pour l’inférence sur appareil. Il masque les différences entre OpenGL ES, OpenCL, Metal et WebGPU, sert de moteur d’accélération GPU à LiteRT, existe en bibliothèque autonome et succède au délégué GPU de TensorFlow Lite, qui ne recevra plus de nouvelles fonctionnalités. Le moteur change de noyaux selon que le LLM lit le prompt ou génère ses tokens, et fournit un guide SKILL.md pour que des agents de code écrivent et vérifient des shaders. Il tourne déjà en production : jusqu’à 40 % de latence par image en moins pour les effets de YouTube Shorts, et jusqu’à 30 % de gain pour Lightroom et Photoshop sur mobile selon le billet ; sur Gemma, Google mesure jusqu’à 12 % de mémoire en moins que d’autres cadres logiciels (frameworks).
🔗 Annonce de ML Drift sur le Google Developers Blog · Dépôt google-ai-edge/ml-drift
Together AI, premier client d’un cluster d’inférence de GPU B300 sur IBM Cloud
6 octobre — Together AI annonce travailler avec IBM et NVIDIA pour étendre sa capacité d’inférence destinée aux entreprises, en commençant par un grand cluster de GPU NVIDIA B300 hébergé sur IBM Cloud et relié par le réseau Ethernet Spectrum-X de NVIDIA. Selon Together AI, c’est le premier cluster d’inférence dédié de cette ampleur sur IBM Cloud, et la société en est le premier client : elle exploite la couche d’inférence, IBM fournit le cloud et NVIDIA les puces et le réseau. Together AI justifie cette extension par la demande en modèles ouverts : elle dit servir chaque mois des centaines de milliers de milliards de tokens à plus d’un million de développeurs. Le billet ne donne ni la taille du cluster, ni de calendrier.
🔗 Billet de Together AI · Tweet @togethercompute
Brèves
- Pilotage plus rapide de Codex — Dans l’application de bureau ChatGPT, Codex prend en compte plus tôt un message de suivi envoyé pendant une tâche, pour corriger une approche ou changer de direction ; le réglage Follow-up behavior choisit si ces messages orientent l’exécution en cours ou attendent la suivante. 🔗 source
- ChatGPT Go dans Warp — Les abonnés à la formule ChatGPT Go peuvent désormais s’en servir dans Warp pour toute question de terminal ou tâche de code ; selon un membre de l’équipe Sign in with ChatGPT d’OpenAI, cité par Warp, l’usage inclus est ouvert aux clients Go, en plus de Plus et Pro, dans toutes les applications partenaires. 🔗 source
- Oracle — Selon une étude de cas d’OpenAI, Oracle compte 130 000 utilisateurs actifs de ChatGPT et plus de 95 000 de Codex ; une recherche sur le marché des talents qui demandait 2 à 4 jours se prépare en 15 à 20 minutes, et Codex traduit des questions métier en requêtes SQL. 🔗 source
- Pollo AI — Cette plateforme de création vidéo, qui revendique plus de 26 millions d’utilisateurs, route les requêtes de son agent avec GPT-5.6, confie les tâches difficiles à GPT-6 Astra et toutes ses images à GPT-Image-2.5, et dit réduire de plus de 50 % le temps passé à choisir un modèle. 🔗 source
- Notes de version de Devin du 7 octobre — Une boîte de notifications réunit les alertes des sessions, avec un envoi au téléphone réglable, l’état de la file de fusion s’affiche dans toute l’application, et les clés privées enregistrées comme secrets sont masquées ligne par ligne dans la sortie des commandes. 🔗 source
- Copilot CLI 1.0.94 — Passée en stable après six préversions, elle ajoute Claude Haiku 5.5 au sélecteur de modèles, transmet le code shell affiché au juge des Assisted Permissions pour éviter des approbations inutiles et permet d’activer un serveur MCP avant sa découverte. 🔗 source
- Gemini CLI v0.65.0-nightly.20261008 — La télémétrie accepte des en-têtes OTLP personnalisés (
telemetry.otlpHeaders), une demande ouverte depuis octobre 2025 ; la CLI ne tourne plus en boucle entre vérification et OAuth, et l’historique se termine toujours par un message de l’utilisateur, ce qui évite une erreur 400 après/rewind. 🔗 source - Le SDK Antigravity 0.1.21 isole les API expérimentales et règle les skills des sous-agents — Première version inscrite au changelog depuis la 0.1.18 du 21 septembre : un décorateur
@betaet un modulegoogle.antigravity.betaséparent les préversions de l’API stable, etskills_configpermet à un sous-agent d’hériter des skills de l’agent parent, de les remplacer ou de s’en passer. 🔗 source - Developer Knowledge API — Google présente l’écosystème de cette API qui sert sa documentation développeur (Google Cloud, Firebase, Android) en Markdown à jour : une commande
gcloud developer-knowledgepréinstallée dans Cloud Shell, une skill pour agents de code reliée à un serveur MCP, avec Antigravity, Claude Code, Cursor et GitHub Copilot cités, et des bibliothèques en sept langages. 🔗 source - AQuA — Google Cloud publie, comme implémentation de référence, cet agent de qualité (Ambient Quality Agent) qui prélève jusqu’à 1 000 sessions d’un agent ADK en production, regroupe les échecs, les suit dans BigQuery et lance un diagnostic des causes avec Gemini 3.8 Flash. 🔗 source
- Les brouillons comptent dans les limites de pull requests — Face aux contributions de faible qualité, GitHub permet d’inclure les pull requests en brouillon dans les limites par utilisateur, alors qu’un contributeur pouvait jusqu’ici en ouvrir sans plafond. 🔗 source
- Archivage des pull requests — Il n’est plus réservé aux administrateurs : les rôles triage, write, maintain et admin peuvent archiver une pull request, ce qui la ferme, la masque du public et bloque toute nouvelle activité, commentaires des administrateurs compris. 🔗 source
- Chronologies de GitHub et lecteurs d’écran — Les lecteurs d’écran parcourent les chronologies des issues et des pull requests comme des listes, avec le nombre d’éléments et la position courante, et annoncent les événements chargés, sur github.com et GitHub Enterprise Server 3.23. 🔗 source
- Paper Reproductions with ML Intern — Abubakar Abid annonce chez Hugging Face une fonction qui confie à des agents la reproduction indépendante des expériences d’un article publié, depuis les Paper Pages, pour produire des artefacts ouverts qui aident à repérer les travaux solides ; ni chiffre ni documentation. 🔗 source
- Le chat de Hugging Face par SSH — Adrien Carreira, responsable de l’infrastructure de Hugging Face, présente un chat avec des modèles ouverts accessible par la commande
ssh chat.hf.co, sans configuration ni clé ; aucune documentation ni liste de modèles ne l’accompagne. 🔗 source - huggingface_hub 2.2.0 — Petite version corrective :
hf jobs statsrenvoie désormais un instantané puis rend la main (-fpour suivre en direct), les téléchargements parallèles passent tous par hf_xet, et deux changements rompent la compatibilité. 🔗 source - swarmlab — Hugging Face a ouvert, sans annonce, ce banc d’essai qui étudie comment des essaims d’agents LLM de différents fournisseurs trouvent la vérité ou se divisent, selon la topologie des échanges, les délais et les rôles ; une ligne de YAML suffit pour tester une hypothèse. 🔗 source
- Darwin-27B-ZTC — VIDRAFT publie sous Apache-2.0 un juge qui renvoie en une seule passe une distribution de probabilités sur les réponses possibles, sans générer de token : 0,743 d’exactitude en zéro-shot sur 2 000 jugements de typed-decisions et un score de Brier de 0,097, selon ses auteurs. 🔗 source
- Superfluid — basecompute publie sous Apache-2.0 ce serveur LLM local, compatible avec les API d’OpenAI, d’Anthropic et d’Ollama, qui fait passer les questions interactives avant le travail des agents : 0,36 seconde de réponse avec huit agents actifs, contre plus de 10 secondes pour llama-server, selon ses auteurs. 🔗 source
- funes 1.8.0 — L’outil qui indexe les sessions des agents de code ajoute un modèle d’embeddings multilingue : sur 30 questions portant sur 2 000 conversations en chinois, la bonne conversation figure dans les huit premiers résultats 30 fois sur 30, contre 23, et le rang réciproque moyen passe de 0,601 à 0,983. 🔗 source
- GLiNER et les langues indiennes — Un billet communautaire montre qu’en gardant les signes combinants dans les mots, sans réentraînement, le F1 moyen en zéro-shot de GLiNER2 passe de 13,2 à 68,0 sur neuf langues indiennes, et celui d’un affinage en hindi de 59,9 à 82,6. 🔗 source
- Multilingual Terminal-Bench — LILT détaille son banc de 324 tâches de code en dix langues : Claude Opus 5.5 y devance Opus 5 d’environ 3 points avec 30 % de tokens en moins, soit un coût par tâche inférieur d’environ 45 % ; Gemini 3.8 Flash y met 41 tours médians par tâche, contre 5 pour GPT-6 Sol. 🔗 source
- Primitives collectives GPU — Milos Kotlar prédit le temps de communication de cinq primitives sur quatre RTX 4090 avec 10,9 % d’erreur moyenne, contre 22,9 % pour un modèle commun, mais avec un pire cas à 61,6 %. 🔗 source
- Best-of-N en raisonnement vidéo — facebookresearch met en ligne, sans annonce et sous licence non commerciale CC BY-NC 4.0, le code de l’étude Selecting or Solving? sur la sélection best-of-N et les jurys de vérificateurs en raisonnement vidéo. 🔗 source
- KDD Cup 2026 Data Agents — NVIDIA détaille le harnais qui a classé son équipe KGMON deuxième avec un petit LLM imposé : données converties en tables SQLite, schéma fourni d’emblée, petit jeu d’outils, lecture ciblée des documents ; le billet ne donne ni score ni nom de modèle. 🔗 source
- Microduck — Matthieu Lapeyre, de Pollen Robotics, annonce plus de trois heures d’autonomie sur une batterie de 2 600 mAh pour ce petit robot bipède équipé de la nouvelle carte électronique maison, avec un processeur qui plafonne à 60 °C au lieu de 114 °C. 🔗 source
- Albums sur Suno — Présentée le 5 octobre, la fonction est en service : on réunit ses morceaux en une sortie complète, on choisit la pochette, on ordonne les titres et on publie au moment voulu ; ni forfait ni limite de titres ne sont précisés. 🔗 source
- HeyGen et Ryan Serhant — HeyGen lance une série vidéo quotidienne présentée par l’avatar officiel de l’agent immobilier Ryan Serhant, vu dans la série Netflix Owning Manhattan, sur Instagram, TikTok et X ; aucun détail financier. 🔗 source
- Runway et la Tech Coalition — Runway rejoint cette alliance contre l’exploitation sexuelle des enfants en ligne et son programme Lantern de partage de signaux entre plateformes, et rappelle ses garde-fous : filtrage des données, tests adverses, hachage, signalement au NCMEC et provenance C2PA. 🔗 source
- SpaceXAI et Omarchy — SpaceXAI devient mécène fondateur de l’Omacom Foundation avec 1,5 million de dollars en tokens Grok ; Grok 4.7 et ses successeurs alimenteront les agents du projet, dont Omabot, qui passe en revue les pull requests. 🔗 source
- Guide des garde-fous de Perplexity — Perplexity publie un guide qui place les garde-fous de l’IA à trois moments (entrée, action des agents, sortie), compare cinq types de protections et illustre sept cas, de l’injection de prompt à l’hallucination ; aucune fonctionnalité nouvelle. 🔗 source
- pplx-decider-v1.1-27b sur OpenRouter — Le modèle de décision à poids ouverts de Perplexity arrive sur OpenRouter au tarif de la Decisions API : 0,02 dollar par million de tokens en entrée, sortie gratuite, contexte de 262 000 tokens. 🔗 source
- Cohere à Ottawa — Cohere ouvre son premier bureau à Ottawa, près du parc Lansdowne, où travaillent déjà près de 30 salariés (commercialisation, ingénierie, infrastructure, sécurité, IA souveraine) ; ni surface ni objectif d’effectif. 🔗 source
Ce que ça signifie
L’assistant produit désormais des objets de travail, plus seulement des réponses. Un tableau de bord Claude Dashboards se met à jour quand les données changent, une animation Claude Motion reste modifiable mot par mot parce qu’elle est écrite en code, et Docs, Slides et Design, sortis de bêta pour tous les forfaits, revendiquent déjà plus de 45 millions de créations. Ces objets circulent ensuite dans les outils existants : le tableau de bord part vers Grafana ou PostHog, l’animation vers Runway ou Luma, qui y ajoutent des plans générés. Le Brand Kit d’ElevenLabs suit la même logique : la charte graphique devient un objet de l’espace de travail, appelé par @, plutôt qu’une consigne à répéter dans chaque prompt.
La sécurité change d’échelle, du côté de la défense comme de l’application des règles. Anthropic constate que trouver des vulnérabilités n’a jamais été aussi facile : plus de 29 000 candidates en six mois, dont environ 6 000 triées à la main. OSS Scanner assume d’envoyer des rapports sans relecture humaine, avec plus de 90 % de vrais positifs attendus, pour desserrer ce goulet d’étranglement. Les règles d’usage se précisent en parallèle : la politique 2026 d’Anthropic regroupe les campagnes trompeuses dans une section dédiée, et OpenAI présente Dark Clark comme la première opération de catégorie 5 qu’elle ait démantelée depuis le début de ses rapports. Dans les outils, Claude Code 2.1.295 laisse désormais un hook défaillant bloquer l’action plutôt que la laisser passer.
La vitesse et le prix deviennent des réglages que l’on choisit. Ultrafast vend GPT-6.1 Sol six fois plus cher pour aller jusqu’à 8 fois plus vite ; selon GitHub et Cognition, Claude Haiku 5.5 égale ou devance Sonnet 5 sur le code, pour environ un huitième du coût par tâche d’après Cognition ; Nano Banana 2.1 divise par deux le prix d’une image 1K. L’inférence s’étale de l’appareil, avec llama.cpp dans Windows ML et ML Drift sur les GPU des téléphones et des ordinateurs, jusqu’au cluster de B300 dont Together AI est le premier client sur IBM Cloud, et TRL réduit de 52 à 82 % le pic de mémoire d’un entraînement à 8 192 tokens.
Enfin, beaucoup de chiffres du jour sont mesurés par ceux qui les publient. FrontierCode est le benchmark propriétaire de Cognition, GitHub dit que Haiku 5.5 égale Sonnet 5 sans publier de chiffre, LightOn calcule ses scores après une normalisation qui modifie ceux de tous les modèles de tête, TII n’évalue Falcon-ASR en émirien que sur un jeu interne et n’en publie pas les poids, et les auteurs de Carbon-A le comparent eux-mêmes à sept outils. La science ouverte apporte un contrepoint : TermGrade publie ses 36 144 tentatives, échecs compris, Carbon-A sa base de 566 millions de gènes candidats, et la carte ultraviolette de Claude Science distingue pixel par pixel ce qui est mesuré de ce qui est prédit. Les 150 millions de dollars d’Anthropic et le milliard de NVIDIA pour la Genesis Mission poussent dans la même direction : mettre ces outils entre les mains des chercheurs.
Sources
- Claude Dashboards et Claude Motion (billet Claude)
- Fil de lancement de Dashboards et Motion (@claudeai)
- Claude Motion (@claudeai)
- Runway et Claude Motion (Runway)
- Luma et Claude Motion (Luma)
- Anthropic Cyber Mission (Anthropic)
- OSS Scanner (Frontier Red Team d’Anthropic)
- Dépôt anthropics/oss-scanner
- Ultrafast pour GPT-6.1 Sol (@OpenAIDevs)
- Changelog de l’API OpenAI
- Tarifs de l’API OpenAI
- Ultrafast dans Codex (documentation)
- Engagement dans la Genesis Mission (Anthropic)
- Annonce de la Genesis Mission (@AnthropicAI)
- NVIDIA commits 1 billion dollars to advance US science (NVIDIA)
- The missing map of the sky (Anthropic Science)
- Carte du ciel en ultraviolet (@AnthropicAI)
- Mise à jour 2026 de la politique d’utilisation (Anthropic)
- Disrupting AI-enabled false front operations (OpenAI)
- Claude Haiku 5.5 in GitHub Copilot (GitHub Changelog)
- Modèles et tarifs de GitHub Copilot
- Claude Haiku 5.5 dans Devin (blog Devin)
- Claude Code 2.1.295
- Claude Code 2.1.294
- Codex CLI 0.162.0
- Changelog d’Antigravity, onglet CLI
- Notes de version de VS Code 1.141
- Notes de version de Delta
- Billet de Delta sur l’abandon de Google Docs
- Notes de version de l’API Gemini
- Fiche de Nano Banana 2.1
- Introducing Brand Kit (ElevenLabs)
- Brand Kit (@ElevenLabs)
- SemanTok (Stability AI)
- Article SemanTok sur arXiv
- ElevenReader au Brésil (ElevenLabs)
- LightOnOCR-3 (blog Hugging Face)
- Falcon-ASR (blog Hugging Face)
- Carbon-A et la Carbon Annotation Database (blog Hugging Face)
- TermGrade (ai&)
- Collection TermGrade sur Hugging Face
- TRL v1.15.0
- llama.cpp dans Windows ML (Microsoft Foundry on Windows)
- llama.cpp à l’événement Windows (@ggerganov)
- ML Drift (Google Developers Blog)
- Dépôt google-ai-edge/ml-drift
- Together AI, IBM Cloud et NVIDIA (blog Together AI)
- Cluster B300 sur IBM Cloud (@togethercompute)
- Notes de version de ChatGPT
- ChatGPT Go dans Warp (@warpdotdev)
- Oracle (étude de cas OpenAI)
- Pollo AI (étude de cas OpenAI)
- Notes de version de Devin du 7 octobre
- Copilot CLI 1.0.94
- Gemini CLI v0.65.0-nightly.20261008
- Changelog d’Antigravity, onglet SDK
- Écosystème de la Developer Knowledge API (Google Developers Blog)
- AQuA, agent de qualité pour les agents ADK (Google Developers Blog)
- Draft pull requests count toward pull request limits (GitHub Changelog)
- Triage role users or higher can now archive pull requests (GitHub Changelog)
- Screen readers can navigate timelines as lists (GitHub Changelog)
- Paper Reproductions with ML Intern (@abidlabs)
- Chat par SSH (@XciD_)
- huggingface_hub 2.2.0
- Dépôt huggingface/swarmlab
- Darwin-27B-ZTC (blog Hugging Face)
- Superfluid (blog Hugging Face)
- funes 1.8.0 (blog Hugging Face)
- GLiNER et les langues indiennes (blog Hugging Face)
- Multilingual Terminal-Bench (blog Hugging Face)
- Temps de communication des primitives collectives GPU (blog Hugging Face)
- Dépôt facebookresearch/best-n-selection-video-reasoning
- Leçons de la KDD Cup 2026 (blog technique NVIDIA)
- Autonomie de Microduck (@matth_lapeyre)
- Albums sur Suno (@suno)
- Série quotidienne de Ryan Serhant (@HeyGen)
- Runway rejoint la Tech Coalition (Runway)
- SpaceXAI, mécène fondateur (omarchy.org)
- AI guardrails (Perplexity)
- pplx-decider-v1.1-27b sur OpenRouter
- Nouveau bureau de Cohere à Ottawa (Cohere)