GPT-6 et Intelligent UI arrivent pour tous les utilisateurs de ChatGPT : GPT-6 Sol pour les forfaits payants dès le 7 octobre, GPT-6 Luna pour Free et Go à partir du 8 octobre. Anthropic complète sa famille 5.5 avec Claude Haiku 5.5, à partir de 0,10 dollar le million de tokens en entrée, tandis que l’événement Windows de Microsoft ouvre les précommandes des PC RTX Spark et annonce que GitHub Copilot pourra bientôt confier ses tâches à un modèle local. OpenAI publie aussi 722 manuscrits de résultats mathématiques produits par un modèle interne.
ChatGPT passe à GPT-6 et Intelligent UI pour tous, lit les fichiers audio et prépare College Planner
7 octobre — OpenAI étend GPT-6 à tous les utilisateurs de ChatGPT. Il ne s’agit pas d’un nouveau modèle de base : GPT-6 Sol et GPT-6 Luna étaient déjà proposés aux clients payants depuis septembre (couverts ici le 22 septembre). Cette fois, des versions d’octobre de ces deux modèles, réglées pour la conversation du quotidien, arrivent dans l’onglet Chat : GPT-6 Sol pour Plus, Pro, Business et Enterprise dès le 7 octobre, GPT-6 Luna pour Free et Go à partir du 8 octobre. Elles remplacent GPT-5.6 Sol et GPT-5.6 Luna dans ChatGPT, tandis que Codex et ChatGPT Work restent sur les versions de septembre. OpenAI dit ainsi s’adresser aux plus de 1,2 milliard de personnes qui utilisent ChatGPT chaque semaine.
La nouveauté la plus visible s’appelle Intelligent UI. GPT-6 compose ses réponses avec du texte, des visuels et des éléments interactifs (graphiques, boutons, formulaires, diagrammes interactifs, cartes) et peut créer sur demande un petit outil, comme un calculateur d’épargne, un partage d’addition ou un jeu ; quand un texte simple suffit, ChatGPT s’y tient. OpenAI s’appuie pour cela sur une bibliothèque de composants natifs et sur un compilateur qui affiche l’interface au fil de la génération. Intelligent UI fonctionne de l’effort Instant à Extra High, sans quota séparé, mais ni avec l’effort Pro, confié à GPT-6 Pro (propulsé par GPT-6 Astra), ni dans les anciennes applications de bureau pour macOS et Windows.
Second changement : ChatGPT peut commencer à répondre pendant qu’il réfléchit ou utilise des outils, puis compléter sa réponse sans nouveau prompt. Selon des évaluations internes d’OpenAI, GPT-6 Instant commence à répondre 44 % plus tôt en moyenne que GPT-5.6 Instant sur les questions qui demandent une recherche web, et GPT-6 Extra High démarre dans le même délai que GPT-5.6 Medium, avec un meilleur score global que GPT-5.6 Extra High.
| Forfait ou réglage d’effort | Modèle utilisé dans ChatGPT | Calendrier et précisions |
|---|---|---|
| Plus, Pro, Business et Enterprise | GPT-6 Sol (Instant, Medium, High, Extra High) | Déploiement mondial dès le 7 octobre |
| Free et Go | GPT-6 Luna | À partir du 8 octobre |
| Effort Pro (Pro 100 et 200 dollars, Business, Enterprise) | GPT-6 Pro, propulsé par GPT-6 Astra | Sans Intelligent UI |
| ChatGPT Work et Codex | Versions de septembre de GPT-6 Sol et GPT-6 Luna | Aucun changement |
Côté sécurité, la fiche système publiée le même jour classe ces versions en capacité « High » en cybersécurité ainsi qu’en biologie et chimie au titre du Preparedness Framework, sans atteindre ce seuil en auto-amélioration ; elles reprennent les garde-fous de GPT-5.6, avec une meilleure résistance aux tentatives de contournement (jailbreaks), y compris sur plusieurs tours. Dans l’API, l’instantané chat-latest pointe désormais vers ce nouveau modèle de ChatGPT, OpenAI recommandant la famille GPT-6 pour la production.
GPT-6 and Intelligent UI, now rolling out in ChatGPT for everyone. Intelligent UI in ChatGPT delivers fast, interactive answers that make everyday questions more visual, complex topics easier to grasp, and interactive tools for your task available on the spot.
🇫🇷 GPT-6 et Intelligent UI se déploient maintenant dans ChatGPT pour tout le monde. Dans ChatGPT, Intelligent UI fournit des réponses rapides et interactives qui rendent les questions du quotidien plus visuelles, les sujets complexes plus faciles à saisir, et met à disposition sur-le-champ des outils interactifs adaptés à votre tâche. — @OpenAI sur X
🔗 GPT-6 and Intelligent UI for everyone · Fiche système, mise à jour d’octobre · GPT-6 and other models in ChatGPT
Les fichiers audio dans ChatGPT
6 octobre — ChatGPT accepte désormais les fichiers audio en pièce jointe. On joint un enregistrement à une conversation pour obtenir une transcription, un résumé ou des réponses sur son contenu, ou pour transformer une réunion, un entretien ou un cours en notes structurées, voire en brouillon d’e-mail de suivi. La fonction est réservée aux abonnements et espaces de travail payants, Enterprise compris : le forfait Free n’y a pas accès « pour l’instant ». Les formats acceptés sont WAV, MP3, OGG, FLAC, AAC, M4A et PCM, ainsi que WebM et MP4 s’ils ne contiennent que de l’audio, jusqu’à 512 Mo par fichier. OpenAI prévient que les transcriptions peuvent contenir des erreurs, que l’identification des locuteurs reste peu fiable et que les performances varient selon les langues.
🔗 Notes de version ChatGPT · Uploading files and audio to ChatGPT
ChatGPT for Teens : premiers chiffres d’usage et College Planner à venir
7 octobre — OpenAI fait un premier point d’étape sur ChatGPT for Teens, l’expérience appliquée par défaut aux comptes identifiés comme ayant moins de 18 ans. Selon l’entreprise, près de 1,2 million d’ados ont utilisé les Learning Visualizations en une semaine et plus de 180 000 le Study Mode ; ils y passent en moyenne moins de 15 minutes par jour, et moins de 2 % dépassent trois heures consécutives. La nouveauté annoncée, College Planner, arrivera « bientôt », d’abord aux États-Unis pour les lycéens de la 10e à la 12e année qui visent une université en quatre ans : un même plan y réunira exigences de candidature, échéances, tâches et démarches d’aide financière, bourses comprises. OpenAI soutient aussi College Advising Corps et, pendant trois ans, le Digital Wellness Lab du Boston Children’s Hospital, sans communiquer de montant.
🔗 Helping teens learn, plan, and shape the future of AI
Claude Haiku 5.5, environ 75 % moins cher que Haiku 4.5 selon Anthropic
7 octobre — Quinze jours après Opus 5.5 et neuf jours après Sonnet 5.5, Anthropic complète la famille Claude 5.5 avec Claude Haiku 5.5 (claude-haiku-5-5). Le modèle vise les tâches à fort volume et sensibles au coût (résumés, compactions de contexte, requêtes de base de données, classification), le rôle de sous-agent d’Opus 5.5 et de Sonnet 5.5 sur le code, et les usages où la vitesse compte, comme le support client en direct ou le pilotage d’un navigateur : c’est le modèle le plus rapide d’Anthropic à vitesse standard, les Opus en Fast Mode restant plus rapides. C’est aussi le premier Haiku doté d’un réglage d’effort (medium par défaut), avec un contexte de 1 million de tokens et jusqu’à 128 000 tokens en sortie.
Le tarif suit deux seuils. Jusqu’à 100 000 tokens de prompt, Haiku 5.5 coûte 0,10 dollar par million de tokens en entrée et 0,50 dollar en sortie, soit 90 % de moins que Haiku 4.5 ; au-delà, il passe à 0,50 et 2,50 dollars, 50 % de moins. Les « environ 75 % » d’économie mis en avant sont une moyenne calculée par Anthropic : 90 % des requêtes envoyées à Haiku 4.5 restaient sous le seuil, et le nouveau découpage en tokens (tokenizer) compte environ 30 % de tokens en plus pour un même texte.
| Type de tarif (par million de tokens) | Haiku 5.5 jusqu’à 100 000 tokens de prompt | Haiku 5.5 au-delà de 100 000 tokens | Haiku 4.5 |
|---|---|---|---|
| Tokens d’entrée | 0,10 dollar | 0,50 dollar | 1 dollar |
| Tokens de sortie | 0,50 dollar | 2,50 dollars | 5 dollars |
| Lectures de cache | 0,01 dollar | 0,05 dollar | 0,10 dollar |
| Écritures de cache | 0,125 dollar | 0,625 dollar | 1,25 dollar |
Sur les benchmarks publiés par Anthropic, l’écart avec Haiku 4.5 est large, et Haiku 5.5 devance GPT-6 Luna d’OpenAI partout où les deux figurent. Il reste en revanche derrière Sonnet 5.5, qu’Anthropic recommande toujours, avec Opus 5.5, pour le code agentique complexe.
| Benchmark évalué (chiffres d’Anthropic) | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| Terminal-Bench 4.0 (code agentique) | 39,2 % | 0,0 % | 16,4 % | 70,6 % |
| OSWorld 2.1, sous-ensemble hors ligne | 72,4 % | 15,7 % | 48,9 % | 83,9 % |
| Humanity’s Last Exam, sans outils | 45,9 % | 10,2 % | — | 56,9 % |
| FrontierCode 1.1, Main | 46,4 % | — | 42,4 % | 52,1 % (effort Xhigh) |
| Chartography, sans outils | 46,4 % | 6,4 % | 29,1 % | 61,6 % |
Six clients ont témoigné de leurs essais anticipés : HubSpot cite 92,8 % sur sa suite CRM, son meilleur score à ce jour, AlphaSense 0,84 contre 0,76 pour Haiku 4.5 sur 400 requêtes, et Box 11 points de plus pour environ moitié moins de latence. La migration depuis Haiku 4.5 demande du travail : le guide liste onze changements, dont la fin de budget_tokens, des paramètres temperature, top_p et top_k et du préremplissage, et la commande /claude-api migrate de Claude Code en automatise une partie. Côté sécurité, Anthropic décrit des garde-fous cyber plus restrictifs que ceux de Haiku 4.5 mais un peu moins que ceux de ses autres modèles récents : davantage de tâches défensives autorisées qu’avec Sonnet 5.5, tests d’intrusion toujours bloqués.
Le lancement s’accompagne d’une baisse de prix : les lectures de cache de Sonnet 5.5 passent de 0,20 à 0,10 dollar par million de tokens dès le 7 octobre, ce qui rend le modèle environ 20 % moins cher sur la plupart des tâches agentiques, selon Anthropic. Haiku 5.5 est disponible dès maintenant sur l’API Claude, Amazon Web Services, Google Cloud et Microsoft Azure, ainsi que dans Claude Code.
Introducing Claude Haiku 5.5: the cheapest, fastest, and most capable small model we’ve ever released. On average, it costs around 75% less to run than Claude Haiku 4.5.
🇫🇷 Voici Claude Haiku 5.5 : le petit modèle le moins cher, le plus rapide et le plus performant que nous ayons jamais publié. En moyenne, il coûte environ 75 % de moins à faire tourner que Claude Haiku 4.5. — @claudeai sur X
🔗 Annonce de Claude Haiku 5.5 · Guide de migration vers Haiku 5.5
Haiku 5.5 dans Cursor : 48,4 % sur CursorBench
7 octobre — Cursor ouvre Claude Haiku 5.5 dès le jour du lancement, à activer dans ses réglages de modèles. Selon Cursor, il coûte 10 fois moins cher que Claude Haiku 4.5 sur les requêtes courtes. Sur CursorBench, le classement que Cursor publie sur son site, Haiku 5.5 en effort Max se place 10e avec 48,4 % de réussite pour 1,12 dollar par tâche, juste devant Sonnet 5.5 en effort High, dont Cursor a recalculé les coûts le 7 octobre pour tenir compte de son nouveau tarif, et devant Opus 5 en effort Max. Il travaille toutefois davantage : 325 934 tokens et 163 étapes par tâche en moyenne, contre 37 391 tokens et 41 étapes pour Sonnet 5.5 en effort High.
| Configuration testée par Cursor | Rang au classement | Score CursorBench | Coût par tâche |
|---|---|---|---|
| Opus 5.5, effort Max | 1 | 57,8 % | 13,43 dollars |
| Haiku 5.5, effort Max | 10 | 48,4 % | 1,12 dollar |
| Sonnet 5.5, effort High | 11 | 47,8 % | 1,20 dollar |
| Opus 5, effort Max | 13 | 46,6 % | 11,95 dollars |
| Haiku 5.5, effort Low | 54 | 30,9 % | 0,08 dollar |
🔗 Annonce de Cursor sur X · Classement CursorBench
Un crédit API mensuel de 100 à 500 dollars pour les forfaits Max et Team
7 octobre — Annoncé dans le même billet que Haiku 5.5, un crédit mensuel utilisable sur la Claude Platform arrive pour les abonnés Max et Team, avec un déploiement étalé sur quelques jours. Il sert à construire ses propres outils, applications et agents avec l’API ; selon @ClaudeDevs, il fonctionne avec tous les modèles, Haiku 5.5 compris, dans son propre code comme dans des outils tiers.
| Forfait concerné | Crédit API mensuel |
|---|---|
| Max 5x | 100 dollars |
| Max 20x | 200 dollars |
| Team, siège Standard | 20 dollars par siège |
| Team, siège Premium | 100 dollars par siège |
| Plafond d’une équipe Team | 500 dollars, mis en commun |
| Free, Pro et Enterprise | Non éligibles |
Sur Team, les crédits des sièges s’additionnent dans une réserve commune : trois sièges Standard et deux Premium donnent par exemple 260 dollars par mois. Le crédit couvre tous les modèles de l’API Claude, y compris l’API Message Batches, ainsi que le Playground de la Console, Claude Managed Agents et le Claude Agent SDK. Il ne couvre pas Claude Code en usage interactif (terminal, IDE, application de bureau ou web), ni l’usage supplémentaire au-delà des limites du forfait, ni les modèles Claude servis par Amazon Bedrock, Google Cloud Vertex AI ou Microsoft Foundry, et il ne modifie pas les limites d’usage de Claude, Claude Code ou Cowork.
Pour le réclamer, il faut un abonnement actif depuis au moins sept jours sur un forfait éligible, puis lier une organisation de la Claude Console depuis les réglages de facturation de claude.ai, sans ajouter de moyen de paiement. Une seule organisation peut être liée, et seul le support peut la changer. Le crédit se renouvelle à chaque cycle de facturation, n’est pas reportable et passe avant les crédits achetés ; une fois épuisé, les appels s’arrêtent jusqu’au crédit suivant, sauf si l’organisation a acheté des crédits ou activé la recharge automatique, et rien n’est facturé sur l’abonnement Claude. En mai, Anthropic avait annoncé un crédit mensuel pour l’usage programmatique à partir du 15 juin ; la page d’aide précise que le nouveau crédit ne correspond pas à ces « crédits Agent SDK », qu’elle dit indisponibles.
🔗 Page d’aide : crédits API mensuels des forfaits Max et Team · Annonce de @ClaudeDevs
IA locale sous Windows : NVIDIA ouvre les précommandes des PC RTX Spark et présente en avant-première DGX Station for Windows
7 octobre — NVIDIA et Microsoft profitent de l’événement Windows AI and Surface, organisé à San Francisco avec un échange entre Jensen Huang et Satya Nadella, pour lancer commercialement RTX Spark, la puce pour PC Windows annoncée à Build le 2 juin. Les précommandes des ordinateurs portables sont ouvertes depuis le 7 octobre, pour une disponibilité le 16 octobre ; des mini-PC suivront en novembre. Acer, ASUS, Dell, HP, Lenovo, Microsoft, MSI et Gigabyte préparent des machines, et Microsoft présente un Surface Laptop Ultra construit autour de la puce. Le billet de NVIDIA n’indique aucun prix.
RTX Spark associe un GPU Blackwell RTX et un CPU Grace reliés à 600 Go/s, pour un pétaflop de calcul IA en FP4 et jusqu’à 128 Go de mémoire unifiée. NVIDIA met en avant l’exécution locale de gros modèles, sans envoi de données vers le cloud ni compteur d’usage, avec la même pile CUDA que sur ses serveurs. La puce vise aussi les créateurs (NVFP4, encodage AV1 et 4:2:2 matériel) et les joueurs, avec des jeux en 1440p au-delà de 100 images par seconde grâce à DLSS 5.
Pour l’entreprise, NVIDIA présente en avant-première DGX Station for Windows, annoncée elle aussi à Build en juin, qu’elle décrit comme le premier supercalculateur IA de bureau de l’écosystème Windows : de quoi faire tourner en local des modèles de l’ordre de mille milliards de paramètres sans quitter Windows, les outils Linux restant accessibles par WSL. Il n’y a ni date ni prix, seulement une inscription pour être prévenu. De son côté, Microsoft fait passer en disponibilité générale Microsoft Execution Containers (MXC), l’infrastructure qui fait tourner les agents en arrière-plan sous le contrôle de Windows.
| Élément comparé | RTX Spark | DGX Station for Windows |
|---|---|---|
| Puce | GPU Blackwell RTX (jusqu’à 6 144 cœurs) et CPU Grace (jusqu’à 20 cœurs) | Superpuce GB300 Grace Blackwell Ultra Desktop |
| Mémoire | Jusqu’à 128 Go, unifiée | 748 Go, cohérente |
| Calcul IA en FP4 | 1 pétaflop | Jusqu’à 20 pétaflops |
| Disponibilité annoncée | Portables en précommande, disponibles le 16 octobre ; mini-PC en novembre | Avant-première, sans date ni prix |
🔗 Billet NVIDIA sur l’événement Windows
Développer en local sous Windows : Copilot routera vers MAI Code 1.1 Flash, son bac à sable passe en disponibilité générale, Replit prépare une application de bureau
7 octobre — GitHub Copilot saura bientôt choisir seul entre un modèle qui tourne sur la machine du développeur et un modèle dans le cloud. Selon le billet de Microsoft et GitHub publié sur le blog Microsoft Command Line, ce routage arrive « d’ici la fin du mois » : il n’est pas encore disponible. GitHub le présente comme l’étape suivante de Project HydraFusion, son orchestrateur qui répartit déjà les tâches entre plusieurs modèles, et met en avant une économie de crédits IA, sans la chiffrer.
Deux usages sont prévus dans Copilot CLI, l’app GitHub Copilot et VS Code. Le mode Auto choisira, tour après tour, entre inférence locale et cloud selon le contexte de la tâche et l’état du cache ; le développeur pourra aussi désigner lui-même un modèle local, MAI Code 1.1 Flash via le fournisseur Windows ML ou n’importe quel modèle exposé par un point d’accès local (endpoint) compatible avec l’API d’OpenAI. Le billet le rappelle : une inférence locale ne rend pas la session hors ligne.
La démonstration tourne sur un Surface Laptop Ultra équipé de RTX Spark. Microsoft AI y fait fonctionner une version locale de MAI Code 1.1 Flash, un mélange d’experts (mixture-of-experts) spécialisé dans le code, de 137 milliards de paramètres dont 6,8 milliards actifs. Quantifié à environ 3,3 bits par poids, il pèse 53 Go, 80 % de moins que la variante cloud, avec un pic mémoire de 75,5 Go à 256 000 tokens de contexte.
| Benchmark évalué (tests Microsoft du 5 octobre) | MAI Code 1.1 Flash | Version quantifiée sur l’appareil | GPT OSS 120B (version GGUF d’Unsloth) |
|---|---|---|---|
| SWE-Bench Verified (500 tâches) | 72,6 % | 70,80 % | 32,0 % |
| Terminal-Bench 2.1 (89 tâches) | 62,9 % | 66,29 % | 23,6 % |
Microsoft précise que ces tests ont tourné sur un environnement d’exécution llama.cpp pour Windows ARM64 et que les résultats varient selon l’appareil et la configuration. Une première brique est déjà disponible dans le terminal : depuis la préversion 1.0.94-0 de Copilot CLI, la commande /model découvre les modèles d’une instance Ollama locale. Rien n’est ajouté sans confirmation, Ollama et le modèle doivent déjà être installés, et seuls les modèles qui gèrent l’appel d’outils et le flux continu (streaming) sont proposés.
🔗 Bringing local models and sandboxed tools to Windows and GitHub Copilot · Discover local models in GitHub Copilot CLI
Le bac à sable local de Copilot en disponibilité générale
7 octobre — Le bac à sable local de GitHub Copilot sort de la préversion publique ouverte le 2 juin : il passe en disponibilité générale dans Copilot CLI, l’app GitHub Copilot et les sessions VS Code qui passent par Agent Host, sans coût supplémentaire. Les outils et commandes lancés par Copilot s’exécutent alors avec un accès restreint aux fichiers, au réseau, aux identifiants Git et GitHub CLI et à d’autres capacités du système, selon des politiques fixées par le développeur ou son organisation ; une entreprise peut imposer des réglages que les développeurs ne peuvent pas assouplir, quel que soit le modèle utilisé. Le moteur, Microsoft eXecution Container (MXC), est une bibliothèque open source de l’équipe Windows qui s’appuie sur ProcessContainer sous Windows, Seatbelt sous macOS et bubblewrap sous Linux, sans machine virtuelle. Ses limites sont écrites : les outils de fichiers intégrés sont contrôlés par Copilot lui-même et non par le système, et les serveurs MCP distants restent hors du bac à sable local.
🔗 Local sandboxing for GitHub Copilot now generally available
Replit construit les applications en local sous Windows
7 octobre — Replit annonce, avec Microsoft, la préversion d’une application de bureau qui construit et exécute les applications directement sur l’ordinateur de l’utilisateur, sous Windows. Replit proposait déjà une application de bureau : la nouveauté tient à cette construction locale, où chaque build tourne dans son propre bac à sable, fondé sur Microsoft Execution Containers et sur OpenShell, l’environnement d’exécution open source de NVIDIA. L’accès anticipé passe par une liste d’attente, sans date ni tarif, et aucune version pour macOS n’est évoquée. Replit a présenté cette préversion sur scène pendant l’événement Windows du 7 octobre.
🔗 Annonce de Replit sur X · Liste d’attente de la préversion
OpenAI publie 722 manuscrits de résultats mathématiques produits par un modèle interne
6 octobre — OpenAI publie d’un coup un large ensemble de résultats mathématiques produits par un modèle interne de pointe, qui n’est pas disponible publiquement. Annoncé le 6 octobre au soir, le dépôt GitHub openai/math rassemble 722 manuscrits regroupés en 372 familles classées par discipline : un résultat principal peut y être accompagné d’arguments complémentaires, de conséquences ou de preuves alternatives.
La grande majorité des résultats provient d’une même procédure : environ 4 000 problèmes posés au modèle, avec en moyenne l’équivalent de trois heures de réflexion de ChatGPT Pro par résultat. OpenAI explique avoir élargi ses évaluations à des problèmes de recherche ouverts après avoir saturé ses évaluations mathématiques existantes. Deux travaux font exception à cette procédure : une région sans zéro de la fonction zêta de Riemann, dont la rédaction a été retouchée par un humain pour la lisibilité, et la preuve d’un cas particulier de la conjecture de Hodge, celui des variétés abéliennes CM.
| Indicateur publié par OpenAI | Valeur annoncée |
|---|---|
| Manuscrits publiés | 722 |
| Familles de résultats | 372 |
| Problèmes posés au modèle | Environ 4 000 |
| Calcul moyen par résultat | Environ trois heures de réflexion de ChatGPT Pro |
| Résumés de raisonnement publiés | 10 |
Tous les résultats ne sont pas vérifiés de la même façon. De nombreuses démonstrations sont formalisées en Lean, un langage qui permet de vérifier une preuve par ordinateur, mais pas toutes : OpenAI prévient que « certains résultats non formalisés pourraient comporter des erreurs », promet de les corriger rapidement et ajoutera de nouvelles formalisations au fil de l’eau. Les dix résumés du raisonnement du modèle portent sur des sujets comme l’exposant d’irrationalité de π, les conjectures de Mahler, la conjecture de finitude directe de Kaplansky en caractéristique deux ou l’isomorphisme des facteurs de groupes libres.
La publication elle-même a été préparée avec le groupe consultatif indépendant sur les mathématiques et l’IA de l’Institute for Advanced Study : protocoles de révision et de citation, corrections publiées comme nouvelles versions, historique conservé. OpenAI annonce aussi le financement d’ateliers, de conférences et de programmes consacrés à ces résultats, et dit travailler à un accès « responsable » des scientifiques au modèle qui les a produits, sans calendrier.
We’re releasing a broad range of new mathematical results produced by an internal frontier model. We’ve been consulting with the independent Advisory Group on Mathematics and Artificial Intelligence at the Institute for Advanced Study, and we have drawn on their advice and public recommendations to inform how we release these results.
🇫🇷 Nous publions un large éventail de nouveaux résultats mathématiques produits par un modèle interne de pointe. Nous avons consulté le groupe consultatif indépendant sur les mathématiques et l’intelligence artificielle de l’Institute for Advanced Study, et nous nous sommes appuyés sur ses conseils et ses recommandations publiques pour décider de la manière de publier ces résultats. — @OpenAI sur X
🔗 Partager les progrès de l’IA en mathématiques · Dépôt openai/math sur GitHub
Perplexity publie pplx-embed-v2-late, des embeddings multivecteurs pour le texte et les images
7 octobre — Perplexity Research publie pplx-embed-v2-late, deux modèles d’embeddings à interaction tardive (late interaction) de 0.6B et 9B paramètres, disponibles sur Hugging Face sous licence MIT. Là où un embedding dense comprime chaque document en un seul vecteur, ces modèles de type ColBERT conservent un vecteur de 128 dimensions par token et notent chaque paire requête-document par MaxSim : chaque token de la requête est rapproché du token le plus proche du document. Ils cherchent dans du texte, des images et des pages rendues (PDF, diapositives, scans) sans passer par l’OCR, ce qui préserve tableaux, figures et mise en page.
Les deux tailles partagent un même espace d’embeddings, parce qu’elles sont distillées token par token depuis un professeur interne de 18B, tiré d’une base de 27B. Un corpus indexé avec le 9B peut donc être interrogé par des requêtes encodées avec le 0.6B : sur ViDoRe v3 en images, cette configuration atteint 63,5 %, contre 62,3 % avec le 0.6B des deux côtés, sans coût supplémentaire à la requête. Le 0.6B, élagué à partir de Qwen3.5-0.8B, sert ainsi d’encodeur de requêtes léger, jusque sur l’appareil.
| Benchmark évalué (mesures de Perplexity) | Score du 9B | Score du 0.6B | Point de comparaison |
|---|---|---|---|
| 72 tâches spécialisées (nDCG@10) | 81,3 % | 78,0 % | Le 9B devance de 1,6 point le modèle suivant |
| Q2D-Web, recherche web (Recall@1000) | 74,8 % | 73,6 % | nemotron-embed-8b : 69,3 % |
| ViDoRe v3 en images (nDCG@10) | 65,2 % | 62,3 % | Seul EVIE devance le 9B |
| BrowseComp+ (agent GPT-OSS-120B) | 64,0 % | — | Meilleur ColBERT suivant : 4,9 points de moins |
| MADQA (agent Gemini 3.5 Flash) | 92,4 % | 90,1 % | Mixedbread Agentic Search : 93,4 % |
Le 9B ne gagne pas partout, et Perplexity l’écrit : EVIE, de Tencent, le devance sur ViDoRe v3 en images, gemini-embedding-2 sur MIRACL-Vision et sur le benchmark interne PPLX-Q2I, et Mixedbread Agentic Search obtient un meilleur score sur MADQA, un écart que Perplexity juge compris dans son intervalle de confiance. L’éditeur reconnaît aussi que le stockage et le coût de notation augmentent avec la longueur des documents. Un rapport technique est annoncé « plus tard cette année », et Perplexity prévoit d’ouvrir progressivement ses embeddings à interaction tardive, denses et contextuels sur sa plateforme API, sans date.
🔗 Billet de Perplexity Research · pplx-embed-v2-late-9b sur Hugging Face
Agents de code : Claude Code 2.1.293, Codex CLI 0.161.0, Cursor sur iOS, Antigravity 2.21.0 et Warp Factories
Cinq outils d’agents de code évoluent : Claude Code adopte Haiku 5.5, Codex CLI se connecte aux serveurs MCP depuis le terminal, Cursor se pilote depuis un iPhone, Antigravity regroupe les actions de son agent et Warp s’ouvre aux outils de Microsoft.
Claude Code 2.1.293 passe à Haiku 5.5 par défaut
7 octobre — Publiée quelques minutes après l’annonce de Haiku 5.5, la version 2.1.293 de Claude Code en fait le modèle Haiku par défaut sur l’API Anthropic. Elle ajoute un champ agentType à la charge utile de subagentStatusLine, pour distinguer les sous-agents personnalisés, et une option isDeferred qui expose dès le départ le schéma des outils déclarés par des mods. L’essentiel tient en 38 correctifs sur 56 entrées : Claude pouvait situer après une compaction ses dernières actions d’avant celle-ci, puis retirer ou refaire un travail terminé ; les règles limitées à un chemin et les CLAUDE.md imbriqués se chargent aussi quand Claude lit un fichier avec cat ou grep dans Bash ; une fuite mémoire des connexions MCP HTTP disparaît. Deux changements récents sont annulés (le message de refus du mode auto de la 2.1.281, un correctif des sessions cloud de la 2.1.290), et la limite de règles de canal de Claude Tag passe de 20 à 50.
🔗 Claude Code 2.1.293 sur GitHub
Codex CLI 0.161.0 met Daybreak derrière une option
7 octobre — Codex CLI 0.161.0 est la première version stable depuis la 0.160.1 du 5 octobre. La commande /mcp login <name> permet de se connecter à un serveur MCP sans quitter la session de terminal en cours, et les conversations vocales gagnent le choix du micro, du haut-parleur et des canaux d’entrée. Daybreak, la gamme cyber d’OpenAI, passe derrière une option : la bascule /daybreak et l’état Daybreak dans la ligne de statut restent masqués tant que l’utilisateur ne l’active pas avec --enable cli_daybreak (ou features.cli_daybreak=true), et sans elle le routage Cyber automatique est omis. Pour un seul tour, codex exec --cyber-access-program choisit un programme d’accès Cyber. Côté Amazon Bedrock, le multi-agent V2 et l’effort de raisonnement Ultra arrivent sur les modèles compatibles, et Bedrock Mantle accepte les régions AWS GovCloud. Les correctifs portent sur les permissions, la reprise de fil et la détection d’une base SQLite corrompue.
🔗 Codex CLI 0.161.0 sur GitHub
Cursor pilote depuis iOS les agents de l’ordinateur
6 octobre — L’application iOS de Cursor affiche désormais les agents qui tournent en local sur l’ordinateur : on voit ce que fait chacun et on peut lui répondre, et le tweet d’annonce cite aussi le lancement de nouvelles tâches. Les agents ne quittent pas la machine, l’application s’y connecte : l’ordinateur doit donc rester allumé et en ligne, et un réglage Keep this computer awake empêche sa mise en veille, machine branchée et écran ouvert. La fonction est activée par défaut, sauf dans les organisations Enterprise, où un administrateur doit l’activer ; l’appairage se valide dans l’application de bureau, et les agents cloud ne sont pas nécessaires. L’application iOS sortie fin juin mettait en avant les agents cloud : ce sont maintenant les agents locaux qui deviennent accessibles depuis le téléphone.
Antigravity 2.21.0 regroupe les actions de son agent
6 octobre — L’application Antigravity de Google passe en version 2.21.0, avec 9 améliorations et 14 correctifs. La recherche avancée retrouve une conversation d’après son contenu, avec ⌘+K (Ctrl+K sous Windows). L’onglet des tâches planifiées (Scheduled Tasks) devient Automations : on y lance une automatisation tout de suite avec Run Now, ou l’on demande à l’agent de guider la création d’une nouvelle avec Create with Prompt. Les modifications de fichiers, commandes de terminal et lectures que l’agent effectue entre deux réponses sont désormais regroupées en une seule ligne repliable, accompagnée d’un court résumé. Parmi les correctifs, une vidéo MP4 ou MOV tronquée lue par l’agent pouvait faire échouer toute la suite de la conversation, et un fichier de réglages enregistré avec le Bloc-notes de Windows ou PowerShell cessait de fonctionner. Le changelog prévient qu’une version peut mettre quelques jours à atteindre tous les utilisateurs.
Warp Factories s’ouvre à Microsoft Teams et Azure DevOps
7 octobre — Warp ouvre Warp Factories, sa plateforme d’usines logicielles (software factories), à Microsoft Teams et à Azure DevOps Services. Dans Teams, mentionner l’application Warp dans un canal ou un fil configuré confie la tâche à l’usine avec le contexte de la conversation ; elle rend compte de son avancement dans le même fil et y renvoie ses pull requests pour relecture. Dans Azure DevOps, on mentionne l’usine depuis un élément de travail (work item) ou une pull request, ou l’on déclenche des exécutions sur leurs événements ; chaque usine reçoit sa propre identité pour les opérations Git, avec un accès limité aux dépôts choisis. Les deux intégrations sont disponibles pour tous les clients de Warp Factories. Warp présente cette double prise en charge native comme une première dans l’industrie ; Devin s’intégrait déjà à Teams et à Azure DevOps Server.
API et plateformes : les toolsets computer use et browser use des SDK Claude, Grok 4.7 sur Microsoft Foundry
Deux annonces pour les développeurs qui bâtissent sur des modèles hébergés : Anthropic simplifie le pilotage d’un ordinateur ou d’un navigateur, et Grok 4.7 arrive en disponibilité générale chez Microsoft.
Les toolsets computer use et browser use des SDK Claude
7 octobre — Les SDK Python et TypeScript de Claude intègrent, en bêta, les ensembles d’outils (toolsets) computer use et browser use. Jusqu’ici, l’API indiquait ce que Claude voulait cliquer ou taper, et il fallait écrire sa propre boucle pour traduire chaque action en commande. Le SDK prend désormais cette boucle en charge : le développeur sous-classe BetaAbstractBrowserToolset20260801 ou BetaAbstractComputerToolset20260801, écrit une méthode par action, et le SDK route les appels, applique les politiques d’URL et de fichiers fournies, demande les approbations et construit les résultats renvoyés au modèle. Anthropic ne fournit ni navigateur ni pilote prêt à l’emploi : on branche sa propre automatisation ou un pilote de Browser Use, Browserbase, E2B ou Daytona, et un exemple minimal en Chrome DevTools Protocol est publié dans le dépôt claude-quickstarts. L’exécution de JavaScript et l’envoi de fichiers sont désactivés par défaut, et sans politique d’URL, aucune adresse n’est vérifiée.
🔗 Fil de @ClaudeDevs sur X · Documentation des toolsets du SDK
Grok 4.7 en disponibilité générale sur Microsoft Foundry
7 octobre — Grok 4.7, le modèle de SpaceXAI sorti le 21 septembre, est disponible sur Microsoft Foundry, a annoncé @SpaceXAI dans la nuit. La documentation de Microsoft le classe en disponibilité générale, parmi les modèles vendus directement par Azure : texte et image en entrée, contexte de 500 000 tokens (entrée et sortie combinées), appel d’outils, accès par Chat Completions ou par la Responses API, et effort de raisonnement de low à xhigh, high par défaut. Microsoft s’engage à proposer les modèles Grok en disponibilité générale, à partir de Grok 4.7, pendant au moins six mois ; Grok 4.6 y figure toujours en préversion. La page de tarifs Azure ne listait pas encore Grok 4.7 le 7 octobre au soir. Après Amazon Bedrock (28 septembre) et Google Cloud en préversion (1er octobre), Grok 4.7 est ainsi proposé chez les trois grands fournisseurs de cloud.
🔗 Deploy and use Grok models in Microsoft Foundry
Modèles ouverts : Open d1 de Liquid AI, Bolmo d’Ai2 dans Nature avec Bwen 8B et Blama 8B
Deux publications à poids ouverts, l’une pour décider vite en périphérie de réseau, l’autre pour lire le texte octet par octet.
Open d1, les modèles de décision ouverts de Liquid AI
7 octobre — Liquid AI ouvre sa famille de modèles de décision avec Open d1 : deux modèles à poids ouverts, d1-3B (texte et image) et d1-omni-600M (texte avec image ou audio), ce dernier en version de recherche précoce. Ils ne génèrent pas de texte : ils attribuent en une seule passe une probabilité à chaque réponse permise. Selon Liquid AI, d1-3B obtient 48,57 au Decision Index 0.2.1, le meilleur score sous 10 milliards de paramètres, devant Decider 35B-A3B (47,11), et 82,9 de moyenne sur sept jeux publics. Mesurée avec NVIDIA, sa latence pour une question va de 8 ms sur une RTX 4090 à 50 ms sur un Jetson Orin Nano, de quoi viser la périphérie de réseau (edge). Aucun banc vision ni audio n’est publié. Les poids sont sur Hugging Face sous la licence propre de Liquid AI (lfm1.0), avec des versions GGUF ; le d1 du 29 septembre n’était accessible que par API.
🔗 Billet de Liquid AI sur Hugging Face
Bolmo d’Ai2 dans Nature, avec Bwen 8B et Blama 8B
7 octobre — Ai2 publie dans Nature, en ligne le 7 octobre, la méthode derrière Bolmo, sa famille de modèles entièrement ouverts qui lisent directement les octets plutôt que des sous-mots. Lire les octets évite les angles morts d’un vocabulaire fixe (orthographe, chaînes inhabituelles, certains systèmes d’écriture), mais exigeait jusqu’ici un entraînement complet depuis zéro. La conversion en octets (byteifying) part au contraire d’un modèle à sous-mots déjà performant et le transforme par un entraînement supplémentaire court. Bolmo 1B et 7B, tirés d’Olmo, datent de décembre ; Ai2 présente aussi Bwen 8B (tiré de Qwen 3 8B, licence Apache-2.0) et Blama 8B (tiré de Llama 3 8B, licence llama3), dont les dépôts existent depuis le 26 août, ainsi que des points de contrôle « Stage 1 » où seul le nouvel étage octets est entraîné. Selon Ai2, les deux modèles approchent leurs modèles d’origine et Bwen 8B dépasse Bolmo 7B, sans chiffre publié.
SynthID Detector ouvert à tous pour vérifier images, vidéos et sons
7 octobre — Google ouvre à tout le monde SynthID Detector, l’outil qui repère les filigranes invisibles SynthID dans les contenus générés par IA. Présenté l’an dernier dans une version préliminaire destinée aux professionnels des médias, il est accessible sur synthid.com, dans le monde entier et en anglais. On y dépose une image, une vidéo ou un fichier audio. La vérification couvre les contenus de Google et ceux de ses partenaires OpenAI, NVIDIA et Kakao, et bientôt Apple. Le portail prévient que ce n’est pas un détecteur d’IA généraliste : un contenu issu d’un modèle sans SynthID, ou lourdement modifié, peut ressortir « non détecté ». Google revendique plus de 180 milliards d’images et de vidéos et 240 000 ans d’audio filigranés depuis 2023, contre 100 milliards et 60 000 ans annoncés en juillet, et plus d’un million de vérifications par jour dans Search, l’application Gemini et Chrome.
🔗 Google expands SynthID Detector for AI content
Sécurité : le classifieur de GitHub pour les secrets divulgués
7 octobre — GitHub met en service un classifieur ModernBERT affiné, dédié aux secrets divulgués et construit avec Microsoft Applied Sciences : il lit le code autour d’une valeur pour repérer les identifiants probables, y compris des mots de passe sans format reconnaissable. Il évalue un lot de candidats en moins de 2 ms et pourrait, selon GitHub, « plus que doubler » les secrets bloqués au push. Dès maintenant, les alertes de mots de passe détectés par IA basculent sur ce modèle, sans surcoût. La protection des pushes par IA, en préversion privée, doit arriver « plus tard ce mois-ci » pour les organisations éligibles, et les vérifications de la commande /security-review de Copilot entreront « bientôt » en préversion privée, les deux contre des crédits IA. L’essai d’Erin Havens, responsable produit sécurité chez GitHub, rappelle qu’une pull request sur trois implique un agent IA et que la protection des pushes n’arrête qu’environ 30 % des nouveaux secrets détectés.
🔗 Secret protection must scale with software
Infrastructure : GitHub reconstruit Git pour l’activité des agents
6 octobre — GitHub reconstruit son infrastructure Git pour suivre le rythme du développement agentique. Selon le billet d’ingénierie de Brian Celenza, l’activité Git totale est passée de 218,2 à 473,3 milliards d’événements par mois entre septembre 2025 et août 2026 ; développeurs et agents ont produit 7,38 milliards de commits en septembre 2026, plus de cinq fois plus qu’un an plus tôt, et les pushes ont été multipliés par 4,9. L’architecture actuelle, Spokes, réplique chaque dépôt sur plusieurs serveurs et valide chaque mise à jour par un vote à la majorité : ajouter des copies pour les lectures ralentit donc les écritures. La nouvelle architecture sépare stockage et calcul, avec les données de référence dans Azure Blob Storage et des processus légers (workers) qui servent les lectures depuis un cache. Dans ses benchmarks internes, GitHub mesure jusqu’à 35 fois plus de débit d’écriture, sans date de bascule.
🔗 Building Git infrastructure for agent-scale development
IA vocale : ElevenLabs signe un protocole d’accord avec un État indien
7 octobre — À l’occasion de son Summit de Bengaluru, ElevenLabs a signé son premier protocole d’accord (MOU) avec le gouvernement d’un État indien, pour un pilote d’IA vocale. L’entreprise ne nomme pas l’État et ne donne ni calendrier, ni périmètre, ni montant : l’annonce tient en un tweet, sans billet de blog. Le chiffre qui l’accompagne éclaire l’enjeu : sur l’année écoulée, ElevenAgents a mené plus de 100 millions de conversations en Inde, dont plus de 70 % en hindi, kannada, tamoul et télougou. Le Summit a réuni plus de 500 dirigeants d’entreprise, développeurs et partenaires.
🔗 Annonce de @ElevenLabs sur X
Recherche : PivotOPD, la méthode de NVIDIA pour rattraper l’erreur décisive d’un agent
7 octobre — Les chercheurs de NVIDIA présentent PivotOPD, une méthode d’entraînement pour les agents qui enchaînent plusieurs tours d’action. Leur constat : sur ALFWorld, 59 % des échecs de trois modèles Qwen3 contiennent une « erreur pivot », commise tôt, après laquelle l’agent poursuit dans la mauvaise direction. PivotOPD prolonge la distillation sur politique (on-policy distillation) : à chaque erreur pivot, un modèle enseignant indique la bonne action, puis une action de rattrapage pour les tours suivants, si bien que l’élève apprend à éviter l’erreur et à s’en remettre. Face à 13 méthodes de référence, il obtient la meilleure moyenne sur ALFWorld, WebShop et Search-based QA avec des élèves Qwen3 de 1.7B et 8B, et rattrape 72,7 % des 72 erreurs pivots rejouées, contre 20,3 % pour la distillation standard. Le gain se transfère au code : un élève Nemotron-3.5 passe de 62,8 % à 66,0 % sur SWE-Bench Verified. L’article est sur arXiv ; le code est annoncé prochainement.
Optimisation : mPDLP répartit les programmes linéaires géants sur plusieurs GPU dans cuOpt
7 octobre — NVIDIA ajoute à cuOpt, sa bibliothèque open source d’optimisation, mPDLP, un solveur de programmation linéaire réparti sur plusieurs GPU reliés par NVLink, pour les grands problèmes de planification (chaînes logistiques, réseaux électriques). En regroupant sur un même GPU les variables et contraintes interdépendantes, il limite les échanges et divise jusqu’à 6 fois la mémoire de pointe par GPU. Sur un nœud DGX B200, l’accélération atteint 11,4 fois sur le calcul PDLP et 4,2 fois de bout en bout ; face à D-PDLP, mPDLP est 1,2 à 2,5 fois plus rapide sur la plupart des grands problèmes, mais plus lent sur les trois plus grandes instances et sur les petits problèmes. Kinaxis résout 3,3 fois plus vite une chaîne logistique de plus de 135 millions de variables sur huit H100, PSR plus de 5 fois plus vite un modèle énergétique de 185 millions de variables sur huit B200.
Robotique : des robots assemblent les plateaux de test GB300
7 octobre — Le Seattle Robotics Lab de NVIDIA raconte comment il apprend à des robots à assembler les plateaux de test des GB300, qui vérifient les modules avant expédition. Deux gestes ont été retenus avec Foxconn, qui fabrique ces systèmes : poser et visser en 16 points une barre omnibus, et brancher quatre connecteurs montés sur des câbles souples. L’exigence fixée avec Foxconn est de 99,5 % de réussite, en deux fois le temps d’un opérateur qualifié au plus, sans collision. Les robots s’en approchent sans l’atteindre : plus de 95 % de réussite en 160 secondes pour la barre, contre 124 visées, et 90 à 95 % pour les connecteurs, à 40 secondes par câble. L’équipe combine une chaîne classique de perception et de commande, l’estimation de pose DOPER et un apprentissage par renforcement dans Isaac Lab, corrigé sur le robot réel. NVIDIA promet de publier DOPER et son orchestrateur TALOS, sans date.
🔗 Billet du blog technique NVIDIA sur les plateaux GB300
Brèves
- L’app iOS de ChatGPT 1.2026.272 — Elle affiche les aperçus de pages directement dans les réponses, ouvre les liens de tâches Codex dans l’application et, côté Codex Mobile, repense le sélecteur d’approbation et accélère le flux des longs fils. 🔗 source
- Radisson Hotel Group — Selon une étude de cas d’OpenAI, son plugin ChatGPT, construit en six semaines avec Accenture Song, convertit environ 1,5 fois mieux que sa recherche organique sur juillet-août 2026, et 54 % des événements de paiement et de réservation de sa campagne publicitaire dans ChatGPT sont attribués à de simples vues d’annonces. 🔗 source
- Jump Trading — La société de trading quantitatif confie à des agents GPT-6 Astra des analyses qui peuvent tourner plusieurs jours en croisant de nombreuses sources de données, avec une revue humaine en bout de chaîne ; l’étude de cas d’OpenAI ne publie aucun chiffre de gain. 🔗 source
- Extensions de plugins ChatGPT — Dans le fil de son tutoriel vidéo, OpenAI Developers cite Adobe, Canva, Figma, Shopify, Instacart et Atlassian parmi les entreprises qui s’en servent, en plus de tldraw et MagicPath ; présentées le 29 septembre, elles lancent un plugin depuis la barre latérale, gèrent les mentions @ et ajoutent des visionneuses de fichiers. 🔗 source
- Every et Claude Managed Agents — L’équipe d’Every a construit sur Claude Managed Agents un agent d’entreprise que chacun utilise dans Slack pour partager ses skills à chaque nouveau modèle, puis l’a ouvert à ses abonnés ; Anthropic relaie un entretien vidéo, sans chiffre. 🔗 source
- Zed 1.23 et préversion 1.24.1 — La 1.23 passe en stable avec son aperçu des fichiers JSONL et NDJSON, et la préversion 1.24.1 permet de glisser un onglet de terminal dans l’Agent Panel, accepte les modèles Amazon Bedrock personnalisés avec outils, images et réflexion, crée des tags Git et allège d’environ 23 % le binaire Linux. 🔗 source
- Puck, le méta-agent d’Amp — Il accepte désormais plusieurs conversations séparées : le bouton + en ouvre une, un clic sur son nom permet de passer de l’une à l’autre, et celles restées inactives trois jours sont rangées à part. 🔗 source
- Copilot CLI 1.0.93 — Passée en stable, elle applique les changements de configuration des serveurs MCP entre deux tours, sans redémarrer la session, et ouvre à tous le bac à sable des commandes via /sandbox et —sandbox ; le SDK Copilot 1.0.17 passe lui aussi en stable. 🔗 source
- Les métriques d’usage de Copilot — Elles sous-comptaient l’activité des agents depuis que plusieurs IDE font passer leurs sessions par le Copilot SDK ; le correctif exige une mise à jour (VS Code 1.139.0 dès maintenant, Visual Studio 18.12 en octobre, JetBrains fin octobre, Eclipse et Xcode d’ici novembre), et les données perdues ne seront pas récupérées. 🔗 source
- Gemini CLI v0.65.0-nightly.20261007 — Cette version nocturne ouvre la série 0.65.0 avec cinq correctifs, dont deux contre des pertes de données : les réglages de projet passent en lecture seule dans un dossier non fiable, où
gemini mcp addpouvait vider.gemini/settings.json, et quitter aussitôt une session reprise ne supprime plus son historique. 🔗 source - Transformers.js 4.3.1 — Au lendemain du lancement d’EmbeddingGemma 2, la bibliothèque calcule ses embeddings multimodaux (740 millions de paramètres, 768 dimensions) directement dans le navigateur, en WebGPU ou WASM, ou sous Node.js. 🔗 source
- RL Environment Explorer — Adithya S K, de Hugging Face, présente ce Space de FineEnvs pour parcourir, visualiser et lancer les environnements d’apprentissage par renforcement du Hub (OpenEnv, Harbor, MiMo, Verifiers, NeMo Gym) : plus de 12 millions d’entrées de tâches, surtout issues de quelques grands environnements OpenEnv. 🔗 source
- Seb-9B — Stas Veretennikov publie ce modèle de décision local sous licence Apache-2.0 (texte, JSON ou image, jusqu’à 20 options), qui obtient 0,792 de moyenne sur 17 suites publiques contre 0,786 pour Jev 1.13 ; l’auteur a mené toutes les mesures et précise que ses données d’entraînement comprenaient la partie entraînement de l’un des bancs, sans ses cas de test. 🔗 source
- Nemotron aux olympiades 2026 — NVIDIA détaille la recette commune (affinage supervisé, apprentissage par renforcement, boucle qui génère, vérifie et corrige) derrière 535,4 sur 600 à l’IOI 2026, en participation non officielle, et 30 sur 42 à l’IMO 2026, pour un seuil d’or de 29, et publie le banc Nemotron-IMO-Bench de 200 problèmes. 🔗 source
- Instadocs: AI Gone Wild — Netflix annonce pour le 12 octobre ce documentaire qui reconstitue la cyberattaque subie par Hugging Face en juillet, menée selon Netflix par des agents autonomes créés par des chercheurs d’OpenAI. 🔗 source
- Runway dans l’annuaire d’applications de ChatGPT — Une fois le plugin installé et le compte Runway connecté, une mention @Runway dans une conversation lui confie une génération d’images ou de vidéos ; Runway ne précise ni tarif ni coût en crédits. 🔗 source
- Face Swap de Luma — La fonction remplace le visage d’un personnage dans un plan existant pour itérer sans tout recommencer ; l’annonce tient en deux tweets, sans page produit, tarif ni précision sur le modèle. 🔗 source
- DSX Air — NVIDIA montre comment tester les changements d’une usine IA sur ce jumeau numérique : des agents appliquent la modification, vérifient configuration, sécurité et isolation, puis rendent un rapport, le passage en production restant soumis à une validation humaine ; billet de méthode, sans chiffre. 🔗 source
- cuPhoton — Un tutoriel de NVIDIA applique cette boîte à outils open source à l’analyse d’images astronomiques sur GPU, de la lecture des fichiers FITS à la revue des candidats ; les gains annoncés, jusqu’à 14 900 fois, portent sur certaines opérations et non sur le traitement de bout en bout. 🔗 source
- Cosmos et SynthID — Les contenus générés par les modèles NVIDIA Cosmos sur build.nvidia.com portent le filigrane SynthID et peuvent désormais être vérifiés par chacun avec le détecteur ouvert par Google. 🔗 source
- Le SDK TypeScript de SpaceXAI 0.2.3 — Il ajoute un niveau de service
fast, interchangeable avecpriority, et l’identifiantgrok-imagine-video-1.5-lite, un modèle vidéo allégé absent des notes de version : selon les données de la page des modèles, il n’accepte pas l’audio en entrée et coûte quatre fois moins par seconde quegrok-imagine-video-1.5en 480p. 🔗 source - Guide RAG vs. LLM — Perplexity publie un guide pédagogique qui présente RAG et LLM comme complémentaires, distingue trois types de RAG (naïf, modulaire, avancé) et précise quand un LLM seul suffit ; aucune fonctionnalité ni chiffre nouveau. 🔗 source
Ce que ça signifie
Les petits modèles deviennent le produit de masse. À partir du 8 octobre, c’est GPT-6 Luna qui répond aux utilisateurs gratuits de ChatGPT, et Anthropic place Haiku 5.5 à 0,10 dollar le million de tokens en entrée sous 100 000 tokens de prompt, tout en divisant par deux le prix des lectures de cache de Sonnet 5.5. Ces modèles encaissent le gros du volume : conversations du quotidien, sous-agents, résumés, compactions. Le classement de Cursor rappelle toutefois que le prix au token ne dit pas tout : en effort Max, Haiku 5.5 consomme près de neuf fois plus de tokens par tâche que Sonnet 5.5 en effort High, pour un coût par tâche à peine plus bas (1,12 dollar contre 1,20). Le crédit API mensuel des forfaits Max et Team invite de son côté les abonnés à essayer ces modèles dans leur propre code.
L’IA redescend aussi sur le poste de travail. Les portables RTX Spark arrivent le 16 octobre, DGX Station for Windows promet jusqu’à 20 pétaflops sur un bureau, et Copilot doit confier lui-même certaines tâches à MAI Code 1.1 Flash en local d’ici la fin du mois. Replit construit désormais les applications sur la machine de l’utilisateur. Des agents qui exécutent du code sur un ordinateur personnel posent une question de sécurité, et la même brique revient partout : Microsoft Execution Containers (MXC), en disponibilité générale sous Windows, isole aussi bien les commandes de Copilot que les builds de Replit. GitHub, de son côté, déploie un classifieur dédié aux secrets divulgués et reconstruit son infrastructure Git, parce qu’une pull request sur trois implique déjà un agent et que les commits ont été multipliés par plus de cinq en un an.
La réponse devient aussi une interface. Avec Intelligent UI, ChatGPT répond par des graphiques, des formulaires ou un petit outil construit à la demande, et commence à répondre avant d’avoir fini de réfléchir. Côté développeurs, les SDK de Claude prennent en charge la boucle du computer use et du browser use, et Cursor permet de suivre depuis un iPhone les agents qui travaillent sur l’ordinateur et de leur répondre. Dans ces trois cas, le texte n’est plus qu’une partie de l’échange : l’IA affiche, clique et rend compte, l’utilisateur supervise.
Enfin, beaucoup de chiffres du jour sont mesurés par ceux qui les publient : les benchmarks de Haiku 5.5 par Anthropic, ceux de MAI Code 1.1 Flash par Microsoft, Q2D-Web par Perplexity, qui l’a conçu, les scores d’Open d1 par Liquid AI, et le débit d’écriture multiplié par 35 par les tests internes de GitHub. OpenAI prévient elle-même que des résultats non formalisés de ses 722 manuscrits peuvent contenir des erreurs, et ses gains de rapidité pour GPT-6 viennent d’évaluations internes. Ces mesures restent utiles pour situer les produits les uns par rapport aux autres ; les évaluations extérieures, comme le classement CursorBench, où un éditeur d’outils mesure le modèle d’un autre, permettront de les recouper.
Sources
- GPT-6 and Intelligent UI for everyone (OpenAI)
- Annonce de GPT-6 pour tous (@OpenAI)
- Fiche système GPT-6 Sol et GPT-6 Luna, mise à jour d’octobre
- GPT-6 and other models in ChatGPT
- Notes de version ChatGPT
- Uploading files and audio to ChatGPT
- Helping teens learn, plan, and shape the future of AI (OpenAI)
- Annonce de Claude Haiku 5.5 (Anthropic)
- Lancement de Claude Haiku 5.5 (@claudeai)
- Guide de migration vers Haiku 5.5
- Haiku 5.5 dans Cursor (@cursor_ai)
- Classement CursorBench
- Crédits API mensuels des forfaits Max et Team (support Claude)
- Annonce du crédit API (@ClaudeDevs)
- RTX Spark et DGX Station for Windows (blog NVIDIA)
- Bringing local models and sandboxed tools to Windows and GitHub Copilot (Microsoft Command Line)
- Discover local models in GitHub Copilot CLI
- Local sandboxing for GitHub Copilot now generally available
- Préversion de l’application de bureau Replit (@Replit)
- Liste d’attente de l’application de bureau Replit
- Partager les progrès de l’IA en mathématiques (OpenAI)
- Dépôt openai/math
- Annonce des résultats mathématiques (@OpenAI)
- Multimodal embeddings beyond a single vector (Perplexity Research)
- pplx-embed-v2-late-9b sur Hugging Face
- Claude Code 2.1.293
- Codex CLI 0.161.0
- Remote control for local agents (changelog de Cursor)
- Changelog d’Antigravity
- Warp Factories, Microsoft Teams et Azure DevOps (blog de Warp)
- Toolsets computer use et browser use dans les SDK (@ClaudeDevs)
- Documentation des toolsets du SDK Claude
- Deploy and use Grok models in Microsoft Foundry
- Open d1 (Liquid AI sur Hugging Face)
- Bolmo dans Nature (Ai2)
- Google expands SynthID Detector for AI content
- Secret protection must scale with software (GitHub)
- Building Git infrastructure for agent-scale development (GitHub)
- Protocole d’accord avec un État indien (@ElevenLabs)
- PivotOPD (NVIDIA Research)
- mPDLP dans cuOpt (blog technique NVIDIA)
- The machines that make the machines (blog technique NVIDIA)
- Changelog ChatGPT et Codex, ChatGPT pour iOS 1.2026.272
- Radisson Hotel Group brings hotel discovery into ChatGPT (OpenAI)
- How Jump Trading is scaling quant research with ChatGPT (OpenAI)
- Extensions de plugins ChatGPT (@OpenAIDevs)
- Every et Claude Managed Agents (@claudeai)
- Zed v1.24.1-pre
- Many, Many Pucks (Amp)
- Copilot CLI 1.0.93
- Update your IDE to restore agent activity in Copilot usage metrics
- Gemini CLI v0.65.0-nightly.20261007
- Transformers.js 4.3.1
- RL Environment Explorer (@adithya_s_k)
- Seb-9B head to head (blog Hugging Face)
- Nemotron à l’IOI et à l’IMO 2026 (blog Hugging Face)
- Instadocs: AI Gone Wild (@netflix)
- Runway dans ChatGPT (@runwayml)
- Face Swap (@LumaLabsAI)
- Validate AI factory changes with digital twins and AI agents (blog technique NVIDIA)
- Faster scientific image analysis with NVIDIA cuPhoton
- Cosmos et SynthID (@NVIDIAAI)
- SDK TypeScript de SpaceXAI 0.2.3
- RAG vs. LLM (Perplexity)