Mardi 22 septembre, Anthropic et OpenAI lancent chacun un modèle de frontière, à moins de deux heures d’écart : Claude Opus 5.5, présenté comme au niveau de Fable 5.1 pour 40 % de moins qu’Opus 5, puis GPT-6 Sol et GPT-6 Luna, dont les prix d’API baissent de moitié face au tarif promotionnel de GPT-5.6. Les deux familles arrivent le jour même dans GitHub Copilot, Devin et Perplexity, pendant que Claude Code 2.1.280 fait passer les forfaits Pro et Team Standard de Sonnet à Opus. Codex CLI 0.156.0, des limites d’usage relevées chez Anthropic et une série de publications de NVIDIA complètent la journée.
Anthropic lance Claude Opus 5.5, premier modèle de la famille Claude 5.5
22 septembre — Anthropic lance Claude Opus 5.5 (claude-opus-5-5), premier modèle de sa nouvelle famille Claude 5.5 ; Sonnet 5.5 et Haiku 5.5 suivront « dans les prochaines semaines ». Il est disponible dès aujourd’hui sur l’API Claude, Amazon Bedrock, Claude Platform on AWS, Google Cloud et Microsoft Foundry, et devient, dans Claude Code, le modèle par défaut des forfaits payants. Fenêtre de contexte d’un million de tokens, sortie maximale de 128 000 tokens, connaissances fiables jusqu’à juin 2026.
Introducing Claude Opus 5.5, the first model in our new Claude 5.5 family.
It performs at the level of Claude Fable 5.1 for most tasks, and costs 40% less to run than Opus 5.
🇫🇷 Voici Claude Opus 5.5, le premier modèle de notre nouvelle famille Claude 5.5. Il travaille au niveau de Claude Fable 5.1 sur la plupart des tâches et coûte 40 % de moins à faire tourner qu’Opus 5. — @claudeai sur X
Selon Anthropic, ces 40 % se mesurent « aux réglages par défaut » sur des charges typiques et combinent des prix plus bas et moins de tokens par tâche. Les tarifs baissent de 20 % (4 dollars en entrée et 20 en sortie par million de tokens, contre 5 et 25 pour Opus 5) et de 60 % sur les lectures de cache (0,20 dollar). La sortie est générée plus de 30 % plus vite, et un mode rapide (fast mode), en préversion de recherche, promet jusqu’à 2,5 fois plus de vitesse pour 8 et 40 dollars.
| Benchmark (chiffres Anthropic) | Claude Opus 5.5 | Claude Fable 5.1 | GPT-6 Astra |
|---|---|---|---|
| Terminal-Bench 4.0 | 66,4 % | 55,8 % | 57,9 % |
| FrontierCode v1.1 Main | 54,4 % | 50,3 % | 53,3 % |
| GDPval-AA v2.1 (Elo) | 1846 | 1735 | 1542 |
| OSWorld 2.0 | 81,8 % | 80,7 % | — |
| AutomationBench | 40,0 % | 31,4 % | 41,4 % |
| Terminal-Bench-Science 0.1 | 58,7 % | 52,6 % | 64,6 % |
Opus 5.5 prend la tête en code agentique, en travail de bureau et en usage de l’ordinateur, mais GPT-6 Astra reste devant sur AutomationBench et Terminal-Bench-Science. Anthropic précise que ses scores ont été mesurés garde-fous de production actifs, ce qui les abaisse probablement, et juge les marges de benchmark devenues « un guide moins fiable » : à l’usage, l’écart avec Fable 5.1 serait plus étroit que ces chiffres. C’est le premier Opus lancé avec des garde-fous de la classe de Fable 5.1 en cybersécurité, biologie et distillation (la plupart des tâches cyber basculent vers Opus 4.8), et Anthropic reconnaît qu’il semble souvent soupçonner qu’il est évalué.
Pour les développeurs, la migration demande des ajustements : la réflexion adaptative ne peut plus être désactivée, le choix d’outil forcé (tool_choice à any ou tool) renvoie une erreur 400, et l’effort par défaut passe à medium (contre high sur Opus 5). Le texte écrit entre deux appels d’outils revient désormais dans des blocs de réflexion, vides avec l’affichage par défaut.
🔗 Introducing Claude Opus 5.5 · Nouveautés d’Opus 5.5 pour l’API
Claude Code 2.1.280 installe Opus 5.5 et passe Pro et Team Standard sur Opus
22 septembre — Claude Code 2.1.280 est publiée à 16 h 38 UTC, sept minutes après l’annonce d’Opus 5.5. Aucune 2.1.279 n’a vu le jour : le CHANGELOG passe directement de la 2.1.278 du 19 septembre à cette version de 114 entrées.
Le changement le plus visible concerne le modèle. Opus 5.5 devient le modèle Opus par défaut, et les forfaits Pro et Team Standard passent de Sonnet à Opus par défaut, comme l’étaient déjà Max, Team Premium et Enterprise. Les niveaux d’effort enregistrés avant que /effort ne devienne propre à chaque modèle ne s’appliquent plus aux nouveaux modèles comme Opus 5.5, qui démarrent à leur réglage par défaut ; Opus 4.7, Opus 4.8 et Fable 5 cessent, eux, d’imposer leur effort de lancement au-dessus du réglage choisi.
Côté sécurité, une écriture qui passe par un lien symbolique est désormais jugée sur sa destination réelle : la demande d’autorisation nomme l’endroit où elle aboutit, et acceptEdits, les règles d’autorisation et le mode auto n’approuvent plus une écriture qui aboutit hors de l’arborescence. Le mode auto ne refuse plus d’actions en boucle, sans pause, quand un contrôle de sécurité ne rend pas de réponse : les nouvelles tentatives s’espacent et le tour s’arrête après dix refus consécutifs. Les marketplaces de plugins qui imitent un nom réservé sont refusées, et la variable CLAUDE_CODE_MAX_MCP_DESCRIPTION_LENGTH permet de modifier le plafond de 2 048 caractères des descriptions d’outils MCP.
Le reste relève du confort : une touche y ou n isolée ne confirme ni ne ferme plus un dialogue (Entrée et Échap à la place), un double Ctrl+C dans un dialogue ne quitte plus Claude Code, deux ruptures du cache de prompt sont réparées, et l’extension VS Code gagne six commandes tapées (/status, /sandbox, /chrome, /export, /skills, /plan).
| Catégorie d’entrée du CHANGELOG | Nombre d’entrées |
|---|---|
| Correctifs (Fixed) | 69 |
| Améliorations (Improved) | 21 |
| Ajouts (Added) | 12 |
| Changements (Changed) | 10 |
| Retour arrière et retrait | 2 |
| Total | 114 |
Deux guides pour travailler avec Opus 5.5
22 septembre — Anthropic publie aussi deux guides signés Addy Osmani. Le premier, « Ce que coûte une tâche sur Opus 5.5 » (What a task costs on Opus 5.5), rappelle que deux modèles au même prix par token peuvent coûter très différemment sur une même tâche, car chaque tour renvoie toute la conversation. Ses exemples, présentés comme des illustrations fondées sur les tarifs publics : 2,8 millions de tokens d’entrée coûtent 11,20 dollars sans cache et 1,62 dollar avec 90 % lus depuis le cache, et un token de sortie vaut 100 fois une lecture de cache. Il conseille l’effort medium au quotidien, high quand medium cale, puis Fable 5.1 si Opus 5.5 bute deux fois sur le même problème, sachant que changer d’effort ou de modèle vide le cache (qui vit une heure sur un abonnement, cinq minutes par défaut avec une clé API). Sur un benchmark interne de 44 tickets de support, passer d’Opus 4.8 à Opus 5.5 en effort bas a réduit le coût d’environ 18 %, et /claude-api prompt-audit de 9 % de plus.
Le second guide, sur claude.dev, conseille de définir ce que « terminé » veut dire puis de laisser travailler, et de supprimer les consignes du type « réfléchis bien », puisque le modèle réfléchit toujours avant de répondre. Il explique aussi la bascule vers un modèle plus ancien quand un message est signalé par les garde-fous, un comportement réglable dans les applications ou dans /config.
🔗 What a task costs on Opus 5.5 · Getting the most out of Opus 5.5
OpenAI lance GPT-6 Sol et GPT-6 Luna, 50 % moins chers que le tarif promotionnel de GPT-5.6
22 septembre — Moins de deux heures après Anthropic, OpenAI élargit la famille GPT-6 avec GPT-6 Sol et GPT-6 Luna, entraînés avec des méthodes similaires à GPT-6 Astra, qui reste selon l’entreprise son meilleur modèle. Sol vise le code complexe et les flux agentiques, Luna les tâches ciblées à fort volume ; ils succèdent à GPT-5.6 Sol et GPT-5.6 Luna.
We’ve also made caching and inference more efficient, and we’re passing the savings directly to you: 50% lower API prices for Sol and Luna compared with GPT‑5.6 promotional pricing.
🇫🇷 Nous avons aussi rendu la mise en cache et l’inférence plus efficaces, et nous vous reversons directement ces économies : des prix d’API inférieurs de 50 % pour Sol et Luna par rapport au tarif promotionnel de GPT-5.6. — @OpenAI sur X
| Type de tarif (par million de tokens) | GPT-6 Sol | GPT-6 Luna | Tarif GPT-5.6 cité (Sol / Luna) |
|---|---|---|---|
| Entrée | 2 dollars | 0,10 dollar | 4 dollars / 0,20 dollar |
| Entrée en cache | 0,20 dollar | 0,01 dollar | non précisé |
| Sortie | 10 dollars | 0,50 dollar | 20 dollars / 1,20 dollar |
Les deux modèles acceptent 1 050 000 tokens de contexte et produisent jusqu’à 128 000 tokens ; au-delà de 272 000 tokens d’entrée, toute la requête est facturée deux fois plus cher en entrée et 1,5 fois en sortie.
Sur les benchmarks d’OpenAI, qui comparent Sol aux modèles Claude antérieurs à Opus 5.5, Sol obtient 33,2 % sur AutomationBench en effort xhigh pour 0,27 dollar par tâche, devant Claude Opus 5 en effort max (26,9 %, pour un coût 11,1 fois plus élevé) et GPT-6 Astra en effort low (30,3 %). Sur DeepSWE v1.1, il atteint 68,8 %, à 1,1 point du meilleur score de Claude Fable 5, pour un coût par tâche inférieur d’environ 80 % ; Luna y obtient 66,6 %. Les scores des concurrents viennent de rapports publics. Côté alignement, le taux de tromperie mesuré sur des tâches de code conçues pour pousser à la malhonnêteté tombe à 1,3 % pour Sol, contre 10,4 % pour GPT-5.6 Sol.
Les deux modèles arrivent dans ChatGPT Work et Codex pour les abonnés Plus, Pro, Business, Enterprise et Edu, avec un déploiement progressif (activation par l’administrateur en Enterprise) ; Free et Go peuvent utiliser Luna dans l’application de bureau, et les modèles ne sont pas encore proposés dans Chat. Dans l’API, ils s’appellent gpt-6-sol et gpt-6-luna, via Responses et Chat Completions.
🔗 Introducing GPT-6 Sol and Luna
Une mise en cache des prompts repensée pour GPT-6
22 septembre — Billet compagnon du lancement, « Better prompt caching for GPT-6 » détaille le nouveau système de cache de la famille : taux de réussite plus élevés par défaut, remise pouvant atteindre 90 % sur les tokens d’entrée en cache, accordée aux préfixes partagés éligibles réutilisés dans les 30 minutes, et écriture en cache facturée 1,25 fois le tarif d’entrée. Les développeurs gagnent un tableau de bord Prompt Caching, des points d’arrêt explicites (explicit cache breakpoints) pour fixer les préfixes à réutiliser, le préchauffage du cache (prewarming) au démarrage d’une application, et un configuration_update qui change l’effort de raisonnement d’une réponse à l’autre sans casser le cache. GitHub, par la voix de son directeur produit Mario Rodriguez, dit avoir réduit de plus de 50 % la part des tokens de prompt à retraiter ; Strawberry Browser annonce 20 % de coûts en moins.
🔗 Better prompt caching for GPT-6
Le jour même dans les outils : GitHub Copilot, Devin, Perplexity, Cursor et v0
22 septembre — Opus 5.5 et les deux nouveaux GPT-6 n’ont pas attendu : en quelques heures, les principaux outils de code et de recherche les ont ajoutés, souvent avec leurs propres mesures.
GitHub Copilot ouvre Opus 5.5, GPT-6 Sol et GPT-6 Luna
GitHub ajoute les trois modèles le jour de leur lancement, sur dix surfaces : VS Code, Visual Studio, Copilot CLI, l’agent de code, l’application GitHub Copilot, github.com, GitHub Mobile, JetBrains, Xcode et Eclipse. Tous sont facturés à l’usage au tarif public du fournisseur, sans multiplicateur de requêtes premium : les abonnés annuels restés sur l’ancienne facturation par requêtes ne les reçoivent pas. Aucun ne figure encore dans la sélection automatique (Auto).
| Modèle dans Copilot | Formules ouvertes | Entrée et sortie par million de tokens |
|---|---|---|
| Claude Opus 5.5 | Pro+, Max, Business, Enterprise (pas Pro) | 4 et 20 dollars |
| GPT-6 Sol | Pro+, Max, Business, Enterprise | 2 et 10 dollars, puis 4 et 15 au-delà de 272 000 tokens |
| GPT-6 Luna | Pro, Pro+, Max, Business, Enterprise | 0,10 et 0,50 dollar, puis 0,20 et 0,75 au-delà de 272 000 tokens |
Luna est ainsi le seul modèle GPT-6 accessible à Copilot Pro, alors qu’Opus 5.5 n’y est pas ouvert. Selon les premiers tests de GitHub, Opus 5.5 résout les tâches au niveau de Claude Opus 5 avec nettement moins d’étapes et de tokens. GitHub signale aussi qu’Opus 5.5 appose un filigrane (watermark) sur ses sorties texte, sans effet, selon GitHub, sur le sens, la qualité, la lisibilité, le nombre de tokens ni le coût.
🔗 Claude Opus 5.5 dans GitHub Copilot · GPT-6 Sol et GPT-6 Luna dans GitHub Copilot
Devin classe les nouveaux venus sur FrontierCode 1.1
Cognition ouvre Claude Opus 5.5 dans Devin Desktop et Devin CLI le jour de sa sortie et le place premier de son benchmark FrontierCode 1.1 en variante Extended, à 65,3 %, devant Claude Fable 5 (64,9 %) et GPT-6 Astra (64,5 %), pour moins d’un dixième du coût par tâche de Fable 5. Ce 65,3 % ne se compare pas au 54,4 % publié par Anthropic, mesuré sur la variante Main. Quarante-sept minutes plus tard, GPT-6 Sol et Luna arrivent à leur tour : Sol égale GPT-5.6 Sol (60,7 % contre 60,6 %) pour 61 % de coût par tâche en moins et lit environ 17 % de contexte en moins ; Luna (56,1 %) passe sous 0,10 dollar par tâche, le modèle le moins cher du classement selon Cognition.
La veille, le 21 septembre dans l’après-midi (heure du Pacifique), Cognition avait ouvert Grok 4.7 et l’avait mesuré à 59,4 %, sous Grok 4.6 (61,3 %) : solide sur les tâches back-end difficiles en Java, Go et Ruby, il a tendance à déborder du périmètre (over-scope), avec des diffs plus gros que la tâche ne le demande. v0 a ouvert Grok 4.7 dans la foulée, avec 40 % de remise jusqu’au 27 septembre, sans préciser sur quoi elle porte.
| Modèle évalué | Score FrontierCode 1.1 Extended |
|---|---|
| Claude Opus 5.5 | 65,3 % |
| Claude Fable 5 | 64,9 % |
| GPT-6 Astra | 64,5 % |
| Claude Fable 5.1 | 63,6 % |
| SWE-2 | 62,5 % |
| Grok 4.6 | 61,3 % |
| GPT-6 Sol | 60,7 % |
| GPT-5.6 Sol | 60,6 % |
| Grok 4.7 | 59,4 % |
| Gemini 3.7 Flash | 56,3 % |
| GPT-6 Luna | 56,1 % |
En gras, les modèles ajoutés à Devin les 21 et 22 septembre. Scores publiés par Cognition sur la variante Extended.
🔗 Opus 5.5 dans Devin · GPT-6 Sol et Luna dans Devin · Grok 4.7 dans Devin · Grok 4.7 dans v0
Perplexity : Opus 5.5 et GPT-6 Sol dans Computer, quatre modèles dans l’Agent API
Perplexity branche les deux lancements sur le curseur d’effort introduit le 17 septembre dans Computer, son agent multi-étapes. Claude Opus 5.5 devient le cran Standard : sur WANDR, le benchmark interne coût et performance de Perplexity, il obtient 0,610 pour 4,13 dollars par tâche, légèrement au-dessus de Claude Fable 5.1 pour un coût par tâche inférieur de 67,6 %. GPT-6 Sol, disponible aussi dans l’application Perplexity, devient l’option par défaut du cran Light. Les deux messages ne précisent ni les forfaits concernés ni les modèles remplacés.
Côté développeurs, une entrée du changelog de l’API, datée seulement de septembre 2026, ajoute à l’Agent API openai/gpt-6-sol, openai/gpt-6-luna, anthropic/claude-opus-5-5 et xai/grok-4.7, sans tarif dans l’entrée.
🔗 Opus 5.5 dans Computer · GPT-6 Sol dans Computer · Changelog de l’API Perplexity
Cursor et v0 ouvrent Opus 5.5
Cursor le présente comme le nouveau meilleur modèle de CursorBench, à 57,8 % en effort maximal (Max), pour 40 % de coût par tâche en moins qu’Opus 5 : les chiffres d’Anthropic, avec le niveau d’effort précisé. v0 l’ouvre sans détail tarifaire.
🔗 Cursor sur X · v0 sur X
Anthropic relève les limites sur cinq heures et offre une réinitialisation jusqu’au 22 octobre
22 septembre — Avec Opus 5.5, Anthropic relève les limites calculées sur cinq heures des forfaits Pro, Max, Team et Enterprise à la licence (seat-based). Le compte @ClaudeDevs chiffre la hausse pour Claude Code : +20 % sur les limites de session de cinq heures dès aujourd’hui. Les abonnés reçoivent aussi une réinitialisation de limite à garder en réserve et à déclencher au moment de leur choix : elle est disponible dans Réglages → Usage (Settings → Usage) pour Pro, Max et Team, à utiliser jusqu’au 22 octobre.
S’y ajoute l’effet prix : dans Claude Code, Opus 5.5 devient le modèle par défaut des forfaits payants et, moins cher qu’Opus 5, fait aller les limites sur cinq heures et hebdomadaires « 25 % plus loin ». Le guide de coût publié le même jour précise que la baisse est répercutée sur les limites, contexte en cache compris, mais que la baisse supplémentaire du prix des lectures de cache ne concerne que l’API.
🔗 @ClaudeDevs sur X · Réinitialisation et limites
Codex CLI 0.156.0 active la voix et les worktrees par défaut
22 septembre — Publiée à 19 h 51 UTC, Codex CLI 0.156.0 est la première version stable depuis la 0.155.1 du 18 septembre ; son changelog complet recense 525 pull requests depuis la 0.155.0. Elle généralise deux fonctions encore expérimentales dans la 0.155 : les conversations vocales, avec des moteurs audio embarqués pour Linux et Windows, et les worktrees, que le centre de commande des agents sait ouvrir en sessions en filtrant les tâches par statut.
| Nouveauté de la version | Commande ou réglage | Précédent dans Codex CLI |
|---|---|---|
| Conversations vocales par défaut | F8, /voice settings | /voice expérimental (0.155.0, 17 septembre) |
| Worktrees par défaut | centre de commande des agents | expérimentaux depuis la 0.154.0 (9 septembre) |
| Interface plein écran | /tui, au prochain lancement | aucun |
| Tableau de bord d’analytics | /usage | analytics de l’application de bureau (18 septembre) |
| Serveur local d’arrière-plan | /daemon, --no-daemon | aucun |
L’interface plein écran apporte la recherche dans la transcription, la sélection à la souris et la copie par clic droit ; six thèmes intégrés arrivent, et les réponses affichent directement les diagrammes Mermaid et les équations. La version comble aussi plusieurs failles d’isolation du bac à sable (trafic entrant sous Windows, sockets Unix de l’app-server, fcntl modifiants sous macOS). Les notes de version ne mentionnent pas GPT-6 : Sol et Luna se choisissent avec /model ou --model.
Agents de code en terminal : Vibe CLI, Qwen Code et Amp
Vibe CLI 2.25.6 et 2.25.7
22 septembre — Mistral publie Vibe CLI 2.25.7, six correctifs, au lendemain d’une 2.25.6 datée du 21 septembre dans le CHANGELOG mais jamais publiée en release GitHub, qui porte l’essentiel des nouveautés (1 ajout, 3 changements, 17 correctifs). Sous l’option --experimental-harness, on peut joindre des images même quand le modèle actif ne sait pas les lire : un modèle doté de vision chez le même fournisseur les décrit pour l’agent, et la clé vision_model de config.toml permet d’en imposer un autre. Les captures d’interface ainsi décrites incluent un contrat de mise en page (layout contract) pour que l’agent puisse reconstruire l’écran.
Côté sécurité, les commandes Git lancées sans approbation sont durcies : les fetchs sécurisés n’héritent plus des surcharges de chemins de la configuration Git, un checkout non fiable ne peut plus choisir le client SSH ni les hooks, et les options risquées ou les redirections shell glissées dans des commandes en lecture seule exigent une approbation. La 2.25.7 ouvre enfin /teleport aux clés d’API Vibe et workspace, comptes gratuits compris.
🔗 Vibe CLI v2.25.7 · CHANGELOG de Vibe CLI
Qwen Code v0.24.4
22 septembre — Un jour après la v0.24.3, Qwen Code passe en v0.24.4 avec 13 fonctionnalités et 15 correctifs, sans changement cassant. Le serveur qwen serve ouvre désormais des espaces de travail distants via SSH sans installer de démon sur la machine cible, et le bac à sable bubblewrap (bwrap), introduit sous Linux avec la v0.24.0, s’applique au niveau de l’exécution de chaque outil. Dans le Web Shell, l’appairage par QR code devient disponible par défaut quand le serveur, authentifié, écoute ailleurs que sur la boucle locale (loopback), avec des invitations à usage unique qui expirent au bout de 60 secondes, et les diffs d’édition s’affichent avant l’approbation. Côté Java, les exécutions d’outils gérées sont conservées en base via JDBC. Une v0.24.5-preview.0 limitée à deux correctifs a suivi le même jour.
Les runners Amp créent des worktrees Git
22 septembre — Cinq jours après avoir permis à un runner de servir plusieurs répertoires, Amp lui apprend à créer des worktrees Git. Dans le sélecteur, chaque dépôt servi propose l’option New Worktree : on appuie sur Tab, on nomme la branche, et le fil démarre dans un checkout neuf créé à côté du dépôt (~/code/amp donne ~/code/amp-fix-flaky-login-test), sans toucher au checkout principal. Une action dédiée archive ensuite le fil et supprime worktree et branche. Les runners peuvent aussi recevoir les secrets et variables d’environnement (Secrets & Env Vars) configurés sur ampcode.com : désactivée par défaut, l’option s’active avec --amp-env, et une variable modifiée vaut pour le fil suivant, sans redémarrage ni SSH.
Évaluations par des tiers : OpenAI fixe ses règles, l’AISI britannique publie ses résultats
22 septembre — Le même jour, deux publications portent sur l’évaluation des modèles par des organismes extérieurs aux laboratoires.
OpenAI : quatre priorités et sept principes pour les évaluateurs indépendants
Signé Lama Ahmad, le billet engage OpenAI à ouvrir à des évaluateurs indépendants, privés ou associatifs, un accès approfondi à l’entraînement, à l’évaluation et au déploiement de ses modèles, pour qu’ils puissent contester ses hypothèses, repérer des risques manqués et juger eux-mêmes de ses protections. Ces évaluations, distinctes du travail mené avec les gouvernements, dureraient de quelques semaines à plusieurs mois, sans être liées à un lancement.
| Domaine prioritaire | Ce qui est examiné |
|---|---|
| Dossiers de sûreté (safety cases) | L’argumentaire qui montre que les risques d’un modèle sont maîtrisés, de l’entraînement au déploiement externe |
| Protections critiques | Résistance aux jailbreaks, défenses cyber, moniteurs de désalignement, fiabilité du suivi de la chaîne de pensée |
| Preparedness Framework | Tests de capacités (risques chimiques et biologiques, cybersécurité, auto-amélioration de l’IA) et alignement |
| Incidents de désalignement | Enquêtes indépendantes sur les incidents critiques, l’incident Hugging Face de juillet étant cité en exemple |
Sept principes encadrent le tout : périmètre convenu et affirmations enregistrées à l’avance, accès proportionné, méthode transparente, expertise et indépendance (conflits d’intérêts déclarés), sécurité et confidentialité, constats exploitables avec délai de correction avant publication, et publication responsable encadrant le caviardage. OpenAI dit discuter avec plusieurs organismes, sans en nommer aucun.
🔗 Priorities and principles for effective third party assessments
Le UK AI Security Institute publie ses résultats vérifiés avec EvalEval
L’EvalEval Coalition annonce sur le blog Hugging Face que le UK AI Security Institute (AISI), l’organisme public britannique chargé d’étudier les risques de l’IA avancée, publie désormais ses résultats d’évaluation dans les Evaluation Cards, la plateforme ouverte d’EvalEval, avec leur contexte et leur configuration, au format commun Every Eval Ever. La première publication couvre cinq benchmarks (HealthBench, FrontierMath, Humanity’s Last Exam, SWE-Bench Pro et Terminal-Bench 2.0) mesurés sur six modèles, Claude Opus 4, 4.5 et 4.6, GPT-5, GPT-5.2 et GPT-5.4, plus deux évaluations cyber. L’enjeu est la reproductibilité : des références vérifiées, publiées avec leur configuration, aident à comprendre pourquoi deux scores en apparence comparables divergent.
🔗 How UK AISI and EvalEval Are Making Benchmark Results Reproducible
ChatGPT suit le score de crédit Experian aux États-Unis
21 septembre — Annoncée par le compte @ChatGPT le 21 septembre, une nouvelle fonction permet de suivre son score de crédit dans ChatGPT. Depuis l’espace Finances, les abonnés Plus et Pro aux États-Unis connectent leur rapport de crédit Experian et leur score VantageScore 3.0, reçoivent des explications personnalisées sur ce qui influence ce score et sont prévenus quand il évolue. La fonction est disponible sur le web et dans les dernières versions des applications iOS et Android.
OpenAI cite des usages concrets : mesurer l’effet de son crédit sur une demande de location, choisir quelle carte de crédit rembourser en priorité, construire son crédit dans la durée, ou voir comment crédit et budget pèsent sur une location automobile ou un prêt immobilier. La fonction complète les outils de finances personnelles lancés en aperçu en mai pour les abonnés Pro américains, avec la connexion bancaire via Plaid.
Google : Colab entre dans les formules Google AI, l’API Gemini restreint Gemini 2.5
Colab rejoint les formules Google AI
22 septembre — Les abonnés Google AI obtiennent des avantages Colab premium, dont un accès prioritaire à des accélérateurs plus rapides et à des machines plus puissantes. Les abonnés Ultra débloquent en plus l’exécution en arrière-plan ininterrompue et l’accès aux GPU Premium, pour qu’un long entraînement aille à son terme sans garder un onglet ouvert. Le billet parle d’un lancement « à partir d’aujourd’hui », mais précise que les avantages arrivent au cours des prochaines semaines dans les pays où Colab est disponible. Selon la FAQ de Colab, les unités de calcul d’une formule Google AI et d’un abonnement Colab Pro ou Pro+ s’ajoutent au même solde ; les formules Google One limitées au stockage et les essais gratuits n’y donnent pas droit. Ni le billet ni la FAQ ne chiffrent les unités attribuées à chaque formule.
🔗 Colab is now part of your Google AI plan · FAQ Colab
L’API Gemini restreint l’accès à Gemini 2.5
18 septembre — Dans une note du 18 septembre, les notes de version de l’API Gemini limitent l’accès aux modèles Gemini 2.5 aux utilisateurs qui s’en sont activement servis par le passé, pour garantir des performances fiables et conserver de la capacité. Ces modèles ne sont pas dépréciés et restent servis jusqu’à nouvel ordre : la page des dépréciations n’affiche aucune date d’arrêt pour gemini-2.5-pro, gemini-2.5-flash et gemini-2.5-flash-lite, seul gemini-2.5-flash-image s’arrêtant le 2 octobre 2026. Pour tout nouveau projet, Google oriente vers Gemini 3.5 Flash-Lite ou Gemini 3.8 Flash.
🔗 Notes de version de l’API Gemini · Page des dépréciations Gemini
Hugging Face fait tourner les GGUF de llama.cpp dans Transformers
22 septembre — Hugging Face permet désormais d’exécuter efficacement dans Transformers les fichiers GGUF, le format de quantification de llama.cpp. Il suffit de passer le fichier à from_pretrained (paramètre gguf_file) : les poids restent compressés en mémoire et les calculs passent par les noyaux Metal de ggml, distribués depuis le Hub par la bibliothèque kernels. La commande transformers serve expose ensuite le modèle derrière une API compatible OpenAI.
Le périmètre de départ est étroit : Mac Apple Silicon uniquement, architecture Qwen3.5 en versions dense et MoE (plus les checkpoints Qwen3.8 compatibles), une conversation à la fois, et installation depuis la branche main. Quatre noyaux viennent de ggml, un cinquième, écrit par Hugging Face, gère le routage des experts. Sur un MacBook Pro M2 Max, Hugging Face juge Transformers « proche » de llama.cpp, avec des valeurs données seulement en graphique et des mesures non identiques (préremplissage inclus d’un côté, décodage seul de l’autre) ; l’équipe recommande toujours llama.cpp pour l’inférence locale efficace. L’intérêt est ailleurs : manipuler un GGUF avec les outils PyTorch habituels, ou repartir d’un GGUF déquantifié pour un affinage.
| Variante GGUF (Qwen3.5-4B, Unsloth) | Taille du fichier | Compromis indiqué |
|---|---|---|
| BF16 | 8,42 Go | Référence non quantifiée |
| Q6_K | 3,53 Go | Plus de précision |
| Q5_K_M | 3,14 Go | Compromis taille et précision |
| Q4_K_M | 2,74 Go | Point de départ recommandé en local |
🔗 Transformers now runs llama.cpp quants
Kimi : K3 sur Amazon Bedrock et une extension de navigateur renommée
Kimi K3 arrive sur Amazon Bedrock
22 septembre — Moonshot AI annonce l’arrivée de Kimi K3 sur Amazon Bedrock ; la fiche AWS date toutefois ce lancement du 18 septembre. Le modèle à poids ouverts, publié fin juillet avec un contexte d’un million de tokens, y profite des contrôles d’accès, de chiffrement et d’audit de Bedrock. Il est servi en inférence interrégions (cross-Region inference) américaine et globale (us.moonshotai.kimi-k3, global.moonshotai.kimi-k3), et sa mise en cache explicite démarre à 1 024 tokens par point de cache, pour au moins 30 minutes. Les niveaux Priority (1,75 fois le tarif) et Flex (0,5 fois) s’appliquent sur les prix de base.
| Option d’inférence (niveau Standard) | Entrée par million de tokens | Sortie par million de tokens | Lecture de cache |
|---|---|---|---|
| Inférence globale | 3,00 dollars | 15,00 dollars | 0,30 dollar |
| Inférence américaine | 3,30 dollars | 16,50 dollars | 0,33 dollar |
🔗 Fiche Kimi K3 sur Amazon Bedrock · Kimi K3 sur Bedrock, annonce sur X
Kimi WebBridge devient Kimi Browser Extension
22 septembre — L’extension de navigateur apparue en juin avec Kimi Work change de nom et gagne une barre latérale depuis laquelle on discute avec Kimi pour qu’il navigue sur les sites, remplisse des formulaires et mène des tâches à leur terme. Les tâches répétitives s’enregistrent une fois et se sauvegardent comme skill, que Kimi reprend la fois suivante ; l’extension découpe aussi les pages web en commandes. Un service local pilote le Chrome ou l’Edge déjà ouvert via le Chrome DevTools Protocol, et Moonshot affirme que sessions de connexion et contenu des pages ne quittent pas l’appareil. Seule la barre latérale exige un compte Kimi.
🔗 Kimi Browser Extension · Kimi Browser Extension, annonce sur X
SpaceXAI : Grok Bot absorbe la hausse des tickets de son support
22 septembre — SpaceXAI publie un retour d’expérience sur son propre support client, reconstruit autour de Grok Bot, son agent qui travaille dans les outils de l’entreprise. Depuis que Cursor a rejoint SpaceXAI le 14 août, les deux équipes de support ont fusionné et couvrent bien plus de produits. Selon le billet, le volume de tickets a augmenté de 175 % sans aucune embauche, là où il aurait peut-être fallu recruter 200 personnes ; la période de mesure n’est pas précisée.
Le déploiement a été progressif : relié à Plain pour les tickets et à Linear pour les incidents, Grok Bot a d’abord été cantonné aux notes internes, chaque action d’écriture étant validée par un humain, puis a traité les tickets simples avant de répondre directement aux clients dès la fin du premier jour. Il mène aujourd’hui une pré-enquête sur chaque ticket entrant, reproduit les problèmes en vidéo pour l’ingénierie et synthétise chaque jour plus de 20 000 retours produit.
| Indicateur publié par SpaceXAI | Valeur annoncée |
|---|---|
| Hausse des tickets de support | +175 % |
| Embauches évitées (estimation) | 200 |
| Coût par résolution des outils classiques | 1 à 4 dollars |
| Coût par ticket avec Grok Bot, au plus bas | 0,20 à 0,30 dollar |
| Remboursements traités sans humain | 99 % |
🔗 How SpaceXAI is using Grok Bot to scale customer support
Cognition : cap sur l’Amérique latine et nouvelles notes de version de Devin
Cognition s’implante en Amérique latine depuis São Paulo
22 septembre — Dans un billet de son équipe Amérique latine, Cognition revient sur l’annonce faite la semaine précédente au MASP, le musée d’art de São Paulo : l’entreprise s’étend dans la région, avec une équipe basée à São Paulo et des recrutements, notamment d’ingénieurs déployés chez les clients (deployed engineers). Elle s’appuie sur des clients déjà en place, dont Itaú, Nubank, Santander, Natura et EBANX. Chez Itaú, selon Cognition, plus de 75 % des équipes technologiques utilisent Devin, qui a documenté plus de 300 000 dépôts et résolu automatiquement environ 70 % des vulnérabilités ; chez Nubank, la migration d’un monolithe de plusieurs millions de lignes serait passée de plusieurs années à quelques semaines, pour un coût plus de vingt fois inférieur. Ces résultats sont ceux que publie Cognition, sans source tierce.
🔗 Building the Future of Software Engineering in Latin America
Les notes de version de Devin du 21 septembre
21 septembre — Parues après notre édition précédente, les notes de version de Devin font entrer SWE-2, le modèle de code de Cognition sorti le 10 septembre, en préversion de recherche (research preview) dans le sélecteur d’agent : on choisit SWE-2 et un effort (Medium, High ou Max) au démarrage d’une session ou en cours de route, et !swe2 fait de même dans Slack. Les serveurs MCP Microsoft 365 (Mail et Contacts, Calendar, To Do, OneDrive et SharePoint, Teams, annuaire Entra ID) rejoignent la place de marché MCP, en lecture seule par défaut sans périmètre OAuth configuré. Devin Review s’ouvre à Bitbucket Data Center, les plugins peuvent atteindre 20 Mio et 2 500 fichiers, et la CLI autonome npx devin-review est retirée : les copies déjà installées ne fonctionnent plus.
🔗 Notes de version Devin du 21 septembre
Genspark fait entrer son benchmark de présentations dans l’index SII de Fireworks AI
22 septembre — Fireworks AI lance le Specialized Intelligence Index (SII), un index de 20 benchmarks du travail réel répartis en sept domaines (sécurité, juridique, finance, support client, logiciel, santé, productivité) et construits par des praticiens ; Harvey, Doximity, Mercor, Sierra, Decagon et Genspark figurent parmi les douze entreprises présentes. Seul benchmark de la catégorie productivité, le Genspark Slides Benchmark fait produire des présentations à onze modèles sur 200 tâches réelles, dans le harnais de l’agent Genspark Slides ; les notes viennent de l’évaluateur interne de Genspark. Genspark reprend pour Gen-1 Slides, son modèle maison, l’argument d’un prix en entrée d’environ un dix-septième de celui de Claude Opus 5.
| Modèle évalué | Score sur l’index SII | Score du billet Genspark du 10 septembre | Coût par présentation sur l’index |
|---|---|---|---|
| Claude Fable 5.1 | 83,6 % | hors tableau, avance de 0,003 sur Gen-1 Slides dans le texte | non affiché |
| Gen-1 Slides | 82,2 % | 0,821 | 0,44 dollar |
| Claude Opus 5 | 81,0 % | 0,810 | 4,16 dollars |
| Claude Fable 5 | 79,9 % | hors tableau | non affiché |
| GPT-6 Astra | 78,0 % | hors tableau | non affiché |
| Kimi K3 | 72,6 % | 0,723 | 2,00 dollars |
| GPT-5.6 Sol | 67,0 % | 0,668 | 2,01 dollars |
| MiniMax M3 | 56,1 % | 0,563 | 0,34 dollar |
🔗 Specialized Intelligence Index · Annonce de Genspark
Runway lance DIFFUSE, une plateforme de recrutement pour les créatifs formés à l’IA
22 septembre — Runway lance DIFFUSE (diffuse.runway.com), une plateforme ouverte où marques, agences et studios cherchent, contactent et recrutent des talents formés aux outils d’IA générative (AI-native talent). Les créatifs, indépendants, studios boutique ou sociétés de production, y créent un profil et hébergent leur portfolio ; aucun tarif n’est communiqué.
Runway s’appuie sur sa propre étude de plus de 1 000 offres d’emploi créatives publiées par près de 400 entreprises : 17 % mentionnent des compétences en IA ou des outils génératifs, et Runway y serait, selon l’entreprise, de loin l’outil vidéo le plus demandé. Runway reconnaît que l’IA déplace en partie les métiers créatifs, mais affirme qu’une nouvelle main-d’œuvre créative se forme autour de ces outils et que la demande pour elle s’accélère.
🔗 Introducing DIFFUSE · Runway sur X
NVIDIA pour les développeurs : Isaac ROS 5.0, DLSS 5 et RTX Mega Geometry 2.0
Isaac ROS 5.0 mise sur les agents
22 septembre — Dévoilée à la conférence ROSCon de Toronto, Isaac ROS 5.0, la collection de paquets ROS accélérés par GPU de NVIDIA, gratuite et open source, prend en charge ROS Lyrical et Ubuntu 24.04 et couvre toute la gamme Jetson, du Jetson Orin Nano au Jetson Thor. La nouveauté principale vise les agents : des skills Isaac réutilisables pour l’installation et la manipulation, une documentation lisible par les agents, une skill qui aide un agent à affiner le modèle de vision stéréo FoundationStereo pour ses propres caméras, et une skill autonome de saisie-dépose (pick and place). FoundationPose reçoit une bibliothèque d’inférence qui suit la position et l’orientation des objets jusqu’à 5,5 fois plus vite, sans que NVIDIA précise la référence de comparaison.
DLSS 5 détaillé pour les studios, RTX Mega Geometry 2.0 disponible
22 septembre — Déjà disponible dans NBA 2K27, DLSS 5 est détaillé pour les développeurs : son rendu neuronal guidé par la 3D (3D-Guided Neural Rendering) s’insère en dernière étape du pipeline, part de l’image rendue par le moteur et s’appuie sur la couleur et les vecteurs de mouvement pour ajouter éclairage et détails de matériaux, image par image, de façon déterministe, sur une seule GeForce RTX série 50 jusqu’en 4K. Les studios règlent l’intensité de structure (Structure Intensity) et de ton (Tone Intensity) et disposent d’un masquage sémantique par IA. Le même billet ajoute à ACE deux modèles de 600 millions de paramètres, Nemotron Speech 3.5 Streaming (reconnaissance vocale) et Qwen3 TTS (synthèse vocale), publie RTX Kit 2026.3 et rend disponible RTX Mega Geometry 2.0, avec le streaming de clusters à niveau de détail continu pour les maillages très denses.
🔗 Nouveautés pour les développeurs de jeux
NVIDIA et l’inférence : Dynamo-Triton multi-GPU et calcul confidentiel sur B200
Dynamo-Triton 26.07 sert un modèle réparti sur huit GPU
21 septembre — NVIDIA montre comment servir un modèle TensorRT réparti sur plusieurs GPU comme un modèle ordinaire. L’inférence multi-GPU de TensorRT (multi-device inference), entièrement prise en charge à partir de TensorRT 11.0, s’appuie sur NCCL ; Dynamo-Triton 26.07, l’ancien Triton Inference Server, l’active dans son backend TensorRT, et l’application n’appelle qu’un seul point d’accès gRPC. Sur la génération vidéo de Cosmos 3 Nano (1280×720, 189 images, 35 étapes), la latence de bout en bout passe de 156,6 secondes sur un GPU à 34,2 secondes sur huit, soit 4,58 fois moins. NVIDIA précise que le test ne mesure ni le débit sous requêtes simultanées ni le coût par vidéo.
| Configuration testée | Nombre de GPU | Latence moyenne de bout en bout |
|---|---|---|
| Mono-GPU | 1 | 156,595 s |
| CP2 | 2 | 87,999 s |
| CP4 | 4 | 53,093 s |
| CP8 | 8 | 34,183 s |
🔗 Dynamo-Triton et TensorRT multi-GPU
L’inférence confidentielle sur B200 conserve plus de 96 % du débit
22 septembre — NVIDIA mesure ce que coûte son Confidential Computing sur Blackwell, qui fait tourner les charges dans des machines virtuelles à mémoire chiffrée, avec des GPU confidentiels et un NVLink chiffré. Sur un DGX B200 (huit GPU, plateforme Intel TDX) servant DeepSeek-R1 en NVFP4 avec TensorRT LLM, 32 000 tokens en entrée et 1 000 en sortie, le mode confidentiel conserve 96,1 à 98,2 % du débit et n’allonge le temps moyen par token de sortie que de 1,2 à 4,3 %, de 1 à 16 requêtes simultanées. Il a fallu trois adaptations du framework : mémoire paginable plutôt qu’épinglée sur certains transferts, compteur interne du GPU pour l’autotuner de noyaux, et d’autres algorithmes de communication faute de multidiffusion NVLink SHARP dans ce mode. La charge a été choisie pour rendre le surcoût visible ; NVIDIA conseille de comparer les deux modes sur sa propre charge.
🔗 Calcul confidentiel et TensorRT LLM
Brèves
- Zed prépare Delta — Zed annonce pour cette semaine, sans qu’elles soient encore disponibles, des couleurs pour regrouper les fils de Delta, son environnement de code multijoueur avec des agents, et une jauge qui montre la distance avant la compaction automatique du contexte. 🔗 source
- Replit et Handshake — Replit est partenaire fondateur de l’AI Skills Studio de Handshake : trois missions gratuites de 45 minutes mènent à un projet affiché sur le profil Handshake ; OpenAI (10 missions), Google, Figma et Vercel comptent parmi les autres partenaires. 🔗 source
- oMLX rejoint Hugging Face — Jun Kim, créateur d’oMLX, projet de l’écosystème MLX d’Apple, rejoint Hugging Face ; le projet reste sous Apache 2.0, toujours dirigé par lui, devient maintenu et financé, et vise d’abord un passage plus rapide des modèles Transformers vers MLX. 🔗 source
- SnowLLM — Billet communautaire : ce moteur d’inférence sous Apache-2.0 (noyaux livrés en binaire), écrit pour le GPU des Ryzen AI Max, décode jusqu’à 2,3 fois plus vite que llama.cpp (1,9 fois sans décodage spéculatif) et préremplit jusqu’à 9,4 fois plus vite, selon ses auteurs. 🔗 source
- DecisionBench et Bosun v3.1 — Hanno Labs publie DecisionBench 1.0 (43 tâches, 28 domaines) et deux modèles de décision à poids ouverts sur base Qwen3 (0,6 et 1,7 milliard de paramètres), à 83,20 % et 87,29 % sur sa propre suite appliquée ; Jev les devance sur la piste de raisonnement. 🔗 source
- Un Moshi de 600 millions de paramètres — Un développeur raconte sa tentative de modèle vocal full-duplex bâti sur Qwen3-0.6B-Base, entraîné pour 2 à 15 dollars par essai sur B200 : le texte converge, mais la voix reste brouillée, un blocage localisé dans les codebooks acoustiques fins. Projet en pause, aucun poids publié. 🔗 source
- Together AI et GLM-5.2 — Dans une étude de cas du 18 septembre, republiée sur X le 21, Together AI décrit une fintech qui sert ses agents de code sur GLM-5.2 en contexte 256K avec 56 B200 ; un incident de file d’attente de 1 à 3 minutes a été corrigé le jour même par une reconfiguration du routage. 🔗 source
- Gemini CLI — La nightly du 22 septembre, la première avec du code neuf depuis le 19, corrige le plantage
HttpsProxyAgent is not a constructoravec Vertex AI derrière un proxy et émet la mise à jourtool_callavant la demande de permission en mode ACP. 🔗 source - Google Flow — Le compte officiel revendique plus de 25 millions d’utilisateurs par mois et prolonge pour tous les 50 crédits quotidiens supplémentaires, une offre réservée en juillet aux abonnés Google AI jusqu’au 31 août. 🔗 source
- Jigsaw et Sensemaking AI — L’incubateur de Google lance son Partner Program pour déployer dans 30 villes, États et pays sa suite open source de consultation citoyenne, propulsée par Gemini, avec un fonds Google.org, Bloomberg Philanthropies et Packard Foundation au montant non publié. 🔗 source
- 100 000 bourses de formation — En marge de l’Assemblée générale des Nations unies, Google finance 100 000 bourses de formation certifiante à l’IA dans plus de 80 pays via l’AI Skills Coalition du programme AI for Good de l’UIT, distribuées par les gouvernements locaux et le réseau Giga. 🔗 source
- Des agents qui sécurisent le code de Google — Dans un billet du 19 septembre, Google explique analyser avant soumission chaque modification de code de son infrastructure avec des agents bâtis sur son harnais open source Mantis, qui bloquent des centaines de vulnérabilités par mois ; l’agent de tri annonce plus de 92 % de précision en moins d’une minute. 🔗 source
- Copilot CLI 1.0.88 — Les réglages gérés par l’entreprise s’appliquent désormais aux sessions
--acp,--ahp-hostet--server, jusque-là sans politique MCP, permissions ni plugins, et/forkfonctionne pendant un tour ; la 1.0.87 du 21 septembre ajoutait des réglages gérés pour le niveau de routage Auto. 🔗 source - Pika et Seedance 2.5 — Le mode Draft de Seedance 2.5 arrive sur Pika et dans le Pika API Club : des brouillons de clips à partir de 10 cents la seconde, à finaliser ensuite en haute qualité. 🔗 source
- Pika Swap Anything — Nouvelle application Pika qui remplace acteurs, costumes, décor ou accessoires d’une vidéo en conservant le rythme, les mouvements et la narration de la prise d’origine, sans tarif communiqué. 🔗 source
- Suno Studio — La station de production musicale de Suno intègre une suite d’effets audio, dont un compresseur (seuil, ratio, attaque, relâchement, sidechain), inclus dans l’abonnement Premier. 🔗 source
- Sluicebox et Nemotron 3 Ultra — Étude de cas NVIDIA : en passant à Nemotron 3 Ultra, cette jeune pousse d’analyse carbone des chaînes d’approvisionnement réduit ses coûts d’inférence de 51 à 80 % et atteint 87,7 % en extraction de données fournisseurs, contre 84 % pour son modèle précédent. 🔗 source
- Topograph — Boîte à outils open source de NVIDIA qui découvre la topologie réseau d’une grappe de GPU et la publie pour Kubernetes, Slurm et Slinky, afin de placer les charges distribuées au plus près les unes des autres ; elle lit les API de Crusoe, Google Cloud, Lambda, Nebius, Nscale et Oracle Cloud. 🔗 source
- Évaluer un agent — Dans un billet de méthode du 21 septembre, NVIDIA propose six métriques, de l’appel d’outil à la tâche accomplie, et cite Nemotron 3.5 Lightning à 86 % sur PinchBench, 30 % plus rapide que Qwen3.6 35B. 🔗 source
- Qwen-Image-2.1 sur Intel — Annoncée par Intel le 21 septembre et relayée par Qwen le 22, la prise en charge dès le premier jour via OpenVINO vise les GPU Arc Pro B70 et les GPU intégrés des Core Ultra Series 3, avec un notebook dédié. 🔗 source
- Box et Grok 4.7 — Le 21 septembre, jour du lancement de Grok 4.7, Box l’a mis à l’essai dans un aperçu de Box Agent sur un sinistre de 2 millions de dollars : facture en double de 82 000 dollars et avoir manquant de 64 000 dollars repérés ; ni date de disponibilité ni tarif. 🔗 source
- Un chirurgien et Codex — OpenAI Developers publie une vidéo où Brian Pridgen, chirurgien de la main, montre comment il construit ses propres outils avec Codex et passe en revue la littérature scientifique sur PubMed, sans chiffre ni étude écrite. 🔗 source
- ChatGPT dans Word — Annoncé le 17 septembre : un complément Microsoft unique donne accès à ChatGPT dans Word, Excel et PowerPoint, dans le monde entier et sur tous les forfaits, Free compris, avec des limites d’usage ; Business et Enterprise ont un aperçu gratuit de GPT-5.6 Sol dans Word jusqu’au 30 septembre. 🔗 source
- Littératie en IA — Perplexity publie un guide qui fait de l’évaluation des réponses la compétence clé, critique le « théâtre de la formation » et cite Gallup : 38 % d’adoption déclarée, mais 12 % d’usage quotidien au quatrième trimestre 2025. 🔗 source
Ce que ça signifie
Le même jour, Anthropic et OpenAI ont défendu le même argument : non pas un modèle plus puissant à tout prix, mais un niveau proche de leur haut de gamme pour beaucoup moins cher. Opus 5.5 est présenté au niveau de Fable 5.1 pour 40 % de moins qu’Opus 5, GPT-6 Sol comme reprenant une grande partie des forces d’Astra à 2 et 10 dollars par million de tokens. Les deux éditeurs raisonnent désormais en coût par tâche plutôt qu’en prix par token, et font du cache le vrai levier : lectures à 0,20 dollar chez Anthropic, remise jusqu’à 90 % et points d’arrêt explicites chez OpenAI.
L’intégration, elle, se mesure en heures. GitHub Copilot, Devin, Perplexity, Cursor et v0 ont ouvert les nouveaux modèles le jour même, chacun avec sa propre mesure : FrontierCode 1.1 Extended chez Cognition, WANDR chez Perplexity, CursorBench chez Cursor. Ces chiffres ne se superposent pas (65,3 % pour Opus 5.5 en variante Extended, 54,4 % en variante Main), et aucun des deux éditeurs ne compare encore son nouveau modèle à celui de l’autre. Pour un développeur, le bon choix se juge de plus en plus dans son outil et sur ses tâches, plutôt que dans les tableaux de lancement.
Les forfaits deviennent aussi un terrain de différenciation. Anthropic relève ses limites sur cinq heures, offre une réinitialisation et passe Pro et Team Standard sur Opus dans Claude Code ; GitHub réserve Opus 5.5 aux formules supérieures mais ouvre GPT-6 Luna dès Copilot Pro ; Google intègre Colab à ses formules Google AI tout en restreignant Gemini 2.5 pour préserver sa capacité. La répartition du calcul entre les formules pèse désormais autant que le prix affiché.
Enfin, la manière de mesurer bouge elle-même. Anthropic reconnaît que les marges de benchmark guident moins bien qu’avant et qu’Opus 5.5 semble souvent se savoir évalué ; OpenAI fixe des règles pour ouvrir ses modèles à des évaluateurs indépendants ; l’AISI britannique rend ses résultats reproductibles avec EvalEval, et NVIDIA propose de juger un agent sur la tâche accomplie plutôt que sur chaque appel d’outil. Vérifier ce qu’un modèle fait réellement compte désormais autant que son score.
Sources
- Introducing Claude Opus 5.5 (Anthropic)
- @claudeai : lancement de Claude Opus 5.5
- Nouveautés de Claude Opus 5.5 pour l’API
- Claude Code v2.1.280
- What a task costs on Opus 5.5
- Getting the most out of Opus 5.5
- Introducing GPT-6 Sol and Luna (OpenAI)
- @OpenAI : lancement de GPT-6 Sol et Luna
- Better prompt caching for GPT-6
- Claude Opus 5.5 dans GitHub Copilot
- GPT-6 Sol et GPT-6 Luna dans GitHub Copilot
- Claude Opus 5.5 dans Devin
- GPT-6 Sol et Luna dans Devin
- Grok 4.7 dans Devin
- @v0 : Grok 4.7 dans v0
- @perplexity_ai : Opus 5.5 dans Computer
- @perplexity_ai : GPT-6 Sol dans Computer
- Changelog de l’API Perplexity
- @cursor_ai : Opus 5.5 dans Cursor
- @v0 : Opus 5.5 dans v0
- @ClaudeDevs : limites de Claude Code
- @ClaudeDevs : réinitialisation des limites
- Codex CLI 0.156.0
- Vibe CLI v2.25.7
- CHANGELOG de Vibe CLI
- Qwen Code v0.24.4
- One Runner, Many Worktrees (Amp)
- Priorities and principles for effective third party assessments (OpenAI)
- How UK AISI and EvalEval Are Making Benchmark Results Reproducible
- @ChatGPT : score de crédit Experian
- Colab is now part of your Google AI plan
- FAQ Colab
- Notes de version de l’API Gemini
- Page des dépréciations Gemini
- Transformers now runs llama.cpp quants
- Fiche Kimi K3 sur Amazon Bedrock
- @Kimi_Moonshot : Kimi K3 sur Bedrock
- Kimi Browser Extension
- @Kimi_Moonshot : Kimi Browser Extension
- How SpaceXAI is using Grok Bot to scale customer support
- Building the Future of Software Engineering in Latin America (Cognition)
- Notes de version Devin du 21 septembre
- Specialized Intelligence Index (Fireworks AI)
- @genspark_ai : Genspark Slides Benchmark dans le SII
- Introducing DIFFUSE (Runway)
- @runwayml : lancement de DIFFUSE
- Isaac ROS 5.0 (NVIDIA)
- Nouveautés pour les développeurs de jeux (NVIDIA)
- Dynamo-Triton et TensorRT multi-GPU (NVIDIA)
- Calcul confidentiel et TensorRT LLM (NVIDIA)
- @zeddotdev : nouveautés de Delta
- @Replit : AI Skills Studio de Handshake
- Jun Kim rejoint Hugging Face (oMLX)
- SnowLLM
- DecisionBench et Bosun v3.1 (Hanno Labs)
- Shrinking Full-Duplex Speech
- Étude de cas Together AI (Dedicated Model Inference)
- Gemini CLI v0.62.0-nightly.20260922
- @FlowbyGoogle : 25 millions d’utilisateurs
- Sensemaking AI et Jigsaw Partner Program (Google)
- Investing in global talent and AI literacy (Google)
- Using agentic AI to secure infrastructure code (Google Cloud)
- Copilot CLI v1.0.88
- @pika_labs : mode Draft de Seedance 2.5
- @pika_labs : Swap Anything
- About compression (Suno)
- Étude de cas Sluicebox (NVIDIA)
- Topograph (NVIDIA)
- How to evaluate AI agents (NVIDIA)
- Qwen-Image-2.1 sur matériel Intel (OpenVINO)
- @Box : Grok 4.7 dans Box Agent
- @OpenAIDevs : un chirurgien et Codex
- @ChatGPT : ChatGPT dans Word
- AI literacy (Perplexity)