Rechercher

Meta publie six articles de mathématiques écrits avec Muse Spark, Perplexity lance sa Decisions API, Anthropic ouvre la Claude Frontier Academy

Vendredi 2 octobre, Meta publie six articles de mathématiques élaborés par des chercheurs avec son modèle Muse Spark ; selon Meta, cinq d’entre eux répondent à des questions de recherche restées ouvertes. Anthropic engage 100 millions de dollars pour former 10 000 ingénieurs de déploiement avec la Claude Frontier Academy et publie Claude Code 2.1.288, tandis que NVIDIA annonce un DGX Spark de 64 Go à partir de 4 999 dollars. Deux annonces de la veille au soir complètent la journée : la Decisions API de Perplexity, qui répond par des probabilités avec un modèle publié en poids ouverts, et le satellite de Google qui emporte ses premières TPU en orbite.


Meta publie six articles de mathématiques écrits avec Muse Spark, Ai2 ouvre AstaBrief, l’IA de Google prévoit la grippe

2 octobre — Meta publie sur son blog de recherche six articles de mathématiques élaborés par des chercheurs avec Muse Spark, son modèle maison. Selon Meta, cinq d’entre eux apportent une réponse à des questions de recherche jusque-là ouvertes, sans que le billet précise lequel fait exception. Les mathématiciens ont travaillé ces derniers mois avec Muse Spark 1.1 et 1.2 en mode Thinking, directement dans l’interface de chat de meta.ai, sans échafaudage de recherche sur mesure (custom research scaffold).

Following gold-medal-level performance from our AI models across five competitions in mathematics, physics, and chemistry, we asked a harder question: can AI contribute when a problem is genuinely open and without an existing solution path?

🇫🇷 Après des performances de niveau médaille d’or de nos modèles d’IA dans cinq compétitions de mathématiques, de physique et de chimie, nous nous sommes posé une question plus difficile : l’IA peut-elle contribuer quand un problème est réellement ouvert et qu’aucun chemin vers sa solution n’existe ? — @AIatMeta sur X

Le protocole affiché est strict : une équipe de mathématiciens guide la recherche, un second groupe relit le travail, et chaque article signale les passages rédigés principalement par les chercheurs ou par l’IA. L’apport du modèle varie fortement d’un article à l’autre, du calcul d’appoint à la rédaction de sections entières :

Domaine mathématiqueRésultat annoncé par MetaApport de Muse Spark selon Meta
ProbabilitésSeuil strict pour ajuster un ellipsoïde passant par des points gaussiens aléatoires en grande dimensionStratégies de preuve
Équations différentiellesExplosion en temps fini des solutions radiales d’énergie négative de l’équation de Schrödinger non linéaire biharmonique à masse critique, question ouverte depuis 2015Calculs, test d’arguments, révision de la preuve
Théorie des groupesUn groupe semi-abélien n’est pas forcément monomial : contre-exemple d’ordre 384 à une conjecture de M. Kida (2024)Programme de recherche écrit en GAP, qui a trouvé le contre-exemple
OptimisationRègle exacte indiquant quand une relaxation par cycles capture le problème d’origineReformulation probabiliste, contre-exemple, stratégie de preuve
Physique arithmétiqueLa fonction à deux points de la théorie des cordes p-adique égale une fonction hauteur, sur une classe de courbes bien plus large que la courbe de TatePreuves candidates, trois sections techniques rédigées
Algèbre non associativeContre-exemple de dimension 3 à une conjecture sur les algèbres d’évolution résolublesContre-exemple et caractérisations alternatives

Meta reconnaît que trois de ces problèmes ont aussi été résolus ailleurs : trois travaux publiés en août sur le seuil gaussien, un contre-exemple à la conjecture de Kida signalé le 16 septembre par l’agent IA Nilradical, et des contre-exemples sur les algèbres d’évolution par Hu et Wen. Selon Meta, ses propres résultats ont été obtenus indépendamment, par d’autres approches. L’annonce suit celle d’OpenAI, qui disait le 21 septembre qu’un modèle interne avait résolu plus de 100 problèmes ouverts ; Meta insiste sur l’usage d’un modèle grand public, tel quel, et sur la transparence quant à la part de l’IA, toutes les preuves restant vérifiées, corrigées et réécrites par des mathématiciens.

🔗 Solving Open Research Problems Together (Meta AI Research)

AstaBrief 8B : Ai2 ouvre un modèle qui rédige des rapports scientifiques cités

2 octobre — Ai2 ouvre AstaBrief 8B, un modèle qui transforme une question de recherche et des extraits de littérature en rapport scientifique cité. Il alimente désormais le mode Fast de la fonction « Generate a report » d’Asta, la plateforme agentique d’Ai2 pour la science, à côté du mode Thinking propulsé par Claude. La recette reste simple : Qwen3-8B, un affinage supervisé (SFT) sur 47 000 exemples produits par le pipeline ScholarQA, puis une optimisation directe des préférences (DPO) sur environ 6 000 paires, sans apprentissage par renforcement. Les poids, sous licence Apache-2.0 selon la fiche du modèle, et les données d’entraînement sont publiés : un laboratoire peut le faire tourner sur son propre matériel.

Le modèle écrit son rapport en une seule passe. Sur tout le pipeline d’Asta, un rapport prend en moyenne 51,1 secondes en mode Fast contre 178,5 en mode Thinking, soit environ 3,5 fois plus vite. Dans une petite étude humaine (14 questions, 3 chercheurs), DR Tulu l’emporte en préférence globale, mais deux chercheurs sur trois préfèrent AstaBrief pour l’exactitude des citations. Ai2 prévient que l’essentiel de l’entraînement et de l’évaluation date de 2025 et n’a pas été refait face aux modèles actuels.

🔗 Open-sourcing AstaBrief (Ai2)

Grippe : un modèle conçu avec l’IA de Google premier sur 39 dans l’évaluation FluSight des CDC

30 septembre — Google annonce qu’un modèle de prévision de la grippe conçu avec son IA a été le meilleur de la saison 2025-2026 dans FluSight, le dispositif des Centres pour le contrôle et la prévention des maladies (CDC) américains qui agrège chaque semaine, d’octobre à mai, les prévisions d’admissions hospitalières. Le rapport de fin de saison des CDC le confirme : sur les 39 modèles retenus parmi les 53 soumis par 34 équipes, le premier des modèles individuels est Google_SAI-FluEns, avec un WIS relatif de 0,56 (un score d’erreur : plus il est bas, meilleure est la prévision), devant trois modèles à 0,58, dont OHT_JHU-nbxd. L’ensemble FluSight, que les CDC utilisent pour leur communication publique, arrive 7e.

Ces prévisions ont été développées avec Empirical Research Assistance (ERA), un outil d’IA de Google qui génère des algorithmes d’optimisation pour différents domaines scientifiques, ouvert à des testeurs de confiance. L’article de recherche associé décrit un système autonome qui écrit, évalue et améliore son propre code de prévision par une recherche arborescente guidée par un LLM ; il a aussi produit des modèles pour le COVID-19 et le virus respiratoire syncytial (VRS).

🔗 Billet de Google Research · Rapport FluSight 2025-2026 des CDC


Perplexity lance la Decisions API et ouvre pplx-decider-v1-27b, llama.cpp sert les modèles de décision

1er octobre — Perplexity ouvre une nouvelle API, la Decisions API, et publie sous licence Apache 2.0 le modèle qui la fait tourner, pplx-decider-v1-27b. L’annonce est passée en soirée par @perplexitydevs, le compte développeurs de l’entreprise. Au lieu de rédiger une réponse, ce modèle de décision (decision model) renvoie une distribution de probabilités sur un ensemble fixe de réponses : il lit du texte, du JSON ou des images, mais n’écrit pas de réponse, ne génère pas de code et n’explique pas son raisonnement.

Trois types de questions sont prévus : noul renvoie la probabilité d’un oui, choice choisit parmi 1 à 255 options avec une probabilité pour chacune et un indice de confiance, score place le contenu sur une grille de 10 niveaux au plus. Une requête peut poser jusqu’à 128 questions sur un même contenu et doit rester, questions comprises, sous 262 144 tokens en entrée. Le tarif est de 0,04 dollar par million de tokens en entrée, la sortie est gratuite et aucun frais n’est facturé à la requête ; chaque organisation peut envoyer 10 requêtes par seconde, quel que soit son forfait. Perplexity vise la classification, le routage et la notation selon une grille : son exemple de référence (cookbook) trie des tickets de support, la Decisions API prenant la première décision et l’Agent API les escalades.

Le modèle est affiné à partir de Qwen3.8-27B ; ses poids, sur Hugging Face, demandent un GPU CUDA capable de loger environ 49 Gio, plus la mémoire de travail. Sa fiche le compare à Jev, un autre modèle de décision, et à son modèle de base sur onze benchmarks, les résultats de pplx-decider-v1-27b étant mesurés via l’API de Perplexity :

Benchmark (précision)Score de JevScore de Qwen3.8-27B (modèle de base)Score de pplx-decider-v1-27b
WinoGrande90,70 %73,10 %83,30 %
FinancialPhraseBank76,98 %75,68 %84,18 %
RAGTruth77,27 %61,53 %88,80 %
JudgeBench78,57 %68,86 %78,29 %
BBH94,27 %72,80 %82,80 %
JevBench public hard73,27 %72,28 %70,30 %
TabFact89,80 %78,60 %90,60 %
ContractNLI77,45 %80,78 %80,78 %
Circa84,60 %87,00 %89,20 %
Belebele95,00 %93,20 %94,00 %
TruthfulQA binary92,00 %82,80 %85,40 %
Overall (selon la fiche)84,51 %74,76 %85,71 %

Sur la ligne Overall, mise en avant dans l’annonce, pplx-decider-v1-27b devance Jev, 85,71 % contre 84,51 %, mais la fiche ne précise pas comment cette ligne est calculée. D’après le tableau publié, Jev reste devant sur six des onze benchmarks, dont BBH et WinoGrande, et sur JevBench public hard le modèle de Perplexity passe même derrière son modèle de base.

🔗 Annonce de @perplexitydevs · Documentation de la Decisions API · pplx-decider-v1-27b sur Hugging Face

llama.cpp sert les modèles de décision avec l’API /v1/systemone, compatible avec Jev

2 octobre — Le serveur de llama.cpp sait désormais servir des modèles de décision via un nouveau point d’accès, /v1/systemone, arrivé avec la PR n° 29818, fusionnée le 2 octobre. Le billet de ggml-org, signé Xuan-Son Nguyen et Victor Mustar, en décrit le principe : on envoie un état (texte, JSON, capture d’écran) et des questions typées, choice, score (de 2 à 10 niveaux) ou noul (oui ou non), et le modèle renvoie une probabilité par option en une seule passe. L’API reprend le format System One introduit par Jev, le modèle de TypeSafe : un client existant n’a qu’à changer d’URL de base. Un mode routeur charge plusieurs modèles à la demande sur le même serveur.

Modèle de décision pris en chargeTaille du modèleModèle de baseTemps médian par question
Julia-1 (plus de 50 langues)144MmmBERT-small3 ms
Laya421MModernBERT-large5 ms
Kev-4B4BQwen3.5-4B-Base12 ms
lev4BQwen3.5-4B36 ms
OpenJev (lit aussi les images)27BQwen3.8-27B43 ms

Les temps sont mesurés sur une NVIDIA RTX PRO 6000. Prochain modèle annoncé : Clef, que Cloudflare a présenté le 1er octobre avec une API compatible avec celle de Jev ; ggml-org a créé le 2 octobre les dépôts GGUF de Clef et de Clef-flash sur Hugging Face.

🔗 New in llama.cpp: Decision Models


Anthropic lance la Claude Frontier Academy et engage 100 millions de dollars pour former 10 000 ingénieurs

2 octobre — Anthropic lance la Claude Frontier Academy, un programme de formation adossé à un engagement de 100 millions de dollars. L’objectif est de former 10 000 ingénieurs de déploiement de pointe (Frontier Deployed Engineers, FDE) d’ici fin 2027. Les premières cohortes réunissent des ingénieurs d’Accenture, Bain, Capgemini, Commonwealth Bank of Australia, Deloitte, McKinsey, Morgan Stanley et Novo Nordisk.

Le premier programme, la Frontier Deployed Engineer Residency, reprend le modèle de la formation médicale. Selon la page du programme, il commence par un module intensif de quatre jours : trois jours en présentiel à construire un système Claude pour une entreprise simulée, puis une épreuve notée qui donne le badge Claude Resident Engineer. Suivent douze semaines de résidence à mener un déploiement de Claude dans sa propre organisation, puis une évaluation finale pour le badge Claude Frontier Deployed Engineer ; les premiers sont attendus début 2027.

L’accès reste fermé : participation sur nomination, accès anticipé réservé à des clients et partenaires choisis, cohortes à San Francisco, New York et Londres. L’Academy prolonge le Claude Partner Network (46 000 entreprises, plus de 175 000 certifications), lancé en mars avec 100 millions de dollars ; le billet ne dit pas si la nouvelle enveloppe s’y ajoute.

🔗 Annonce d’Anthropic · Page du programme


Agents : Claude Code 2.1.288, GLM 5.3 dans Cursor, Replit, DeepSeek Harness et le banc SWE-sweep

Claude Code 2.1.288 lève la limite des commandes en arrière-plan en session interactive

2 octobre — Claude Code 2.1.288 arrive avec 89 entrées, dont 64 correctifs. Le changement le plus visible concerne les commandes lancées en arrière-plan : la limite de temps introduite par la 2.1.285 (30 minutes par défaut, 2 heures au maximum) ne s’applique plus qu’aux sessions sans surveillance (-p, Agent SDK, CI, cloud). Dans le terminal, l’application de bureau et VS Code, une commande en arrière-plan peut de nouveau tourner sans limite.

Un prompt effacé par erreur avec Ctrl+C se récupère d’une flèche vers le haut, /code-review accepte --max-findings pour remonter plus ou moins de problèmes, claude project purge devient claude purge, et les mods, lancés la veille, reçoivent $.ui.selection(), qui renvoie le dernier texte sélectionné en plein écran. Quand l’API expire en pleine réponse, les sessions non interactives et les sous-agents repartent de la réponse partielle au lieu d’échouer. Côté sécurité, un rm dangereux glissé dans un script bash -c ne passe plus sans confirmation en mode bypassPermissions, et un hook PreToolUse ou PermissionRequest dont la correspondance échoue bloque désormais l’appel au lieu d’être ignoré. Enfin, le classifieur du mode auto côté client ignore désormais une variable ANTHROPIC_DEFAULT_SONNET_MODEL qui désigne Sonnet 5.5 ou Opus 5.5, et utilise Claude Sonnet 5 à la place.

Six minutes après la release, @ClaudeDevs a mis en avant You should know, un mod intégré qui lance un agent secondaire chargé d’afficher au-dessus du prompt les informations à ne pas manquer. Il figurait déjà parmi les six mods intégrés présentés le 1er octobre et reste désactivé par défaut.

We’re adding a new plugin to Claude Code: You should Know. It scans Claude’s output for important information you might miss to help keep you in the loop. Enable it with: /plugin enable cc-plugin-you-should-know@builtin

🇫🇷 Nous ajoutons un nouveau plugin à Claude Code : You should Know. Il analyse la sortie de Claude à la recherche d’informations importantes qui pourraient vous échapper, pour vous tenir au courant. Activez-le avec : /plugin enable cc-plugin-you-should-know@builtin — @ClaudeDevs sur X

🔗 Notes de version de Claude Code 2.1.288

GLM 5.3 et GLM 5.3 Flash arrivent dans Cursor

1er octobre — Cursor ajoute GLM 5.3 et GLM 5.3 Flash, les modèles ouverts de Z.ai, à son sélecteur de modèles, et revendique pour GLM 5.3 Max la première place des modèles ouverts sur son propre banc d’essai.

GLM 5.3 and GLM 5.3 Flash are now available in Cursor! GLM 5.3 Max is the best-scoring open-weight model on CursorBench 4.0.

🇫🇷 GLM 5.3 et GLM 5.3 Flash sont désormais disponibles dans Cursor ! GLM 5.3 Max est le modèle à poids ouverts le mieux noté sur CursorBench 4.0. — @cursor_ai sur X

Le graphique joint place les modèles selon leur score CursorBench 4.0 et leur coût moyen par tâche, mais n’étiquette qu’un point : celui de GLM 5.3 marqué « (max) », à 42,6 % pour 5,05 dollars par tâche. D’après ce graphique, GLM 5.3 reste sous Claude Opus 5.5, Claude Sonnet 5.5, Fable 5.1 et Grok 4.7, aucun autre modèle ouvert n’y figure et GLM 5.3 Flash n’y apparaît pas. Cursor n’a publié ni tarif, ni billet, ni méthode à l’appui de son classement.

Replit ouvre GPT-6.1 Sol et Claude Sonnet 5.5 dans Agent, et Jev dans ses AI Integrations

2 octobre — Le changelog de Replit ajoute deux modèles récents au choix dans Replit Agent : Claude Sonnet 5.5 en mode Power et GPT-6.1 Sol en mode Max. La même entrée ouvre Jev, le modèle de décision déjà cité face à pplx-decider-v1-27b, dans les Replit AI Integrations : une application peut classer du contenu, router des requêtes ou noter des prospects par des décisions rapides et structurées, sans gérer de clé API. La documentation précise que Jev est servi sous l’identifiant jev-latest via OpenRouter. Les réglages s’ouvrent désormais en pleine page, et les comptes Enterprise peuvent fixer des règles pour toute l’entreprise, avec des exceptions par équipe (Workspace). L’entrée n’indique aucun tarif.

🔗 Changelog de Replit du 2 octobre

DeepSeek Harness s’installe sur macOS et Windows

30 septembre — Le compte @DeepSeekHarness annonce une version de bureau de DeepSeek Harness, le harnais d’agent open source de DeepSeek, pour macOS et Windows. Le 2 octobre, le compte principal @deepseek_ai relaie l’annonce et précise que les utilisateurs Linux passent par le paquet npm @deepseek-ai/dsh. Les installateurs se téléchargent sur le site de DeepSeek, pour macOS sur puce ARM et pour Windows x64.

La page officielle, marquée PREVIEW, présente Harness comme une préversion publique ouverte dans le monde entier, et open source. Il repose sur l’architecture « tout est plugin » (everything is a plugin) du framework Cordis et couvre le travail de bureau (fichiers, données, documents, présentations), le code, la recherche avec citation des sources et les tâches de fond, avec un mode Creator qui fait écrire de nouveaux plugins par la conversation. La nouveauté tient à la distribution : la préversion du 29 septembre intégrait déjà la commande dsh à l’application de bureau, et aucune version stable n’est encore publiée sur GitHub.

🔗 Annonce de @deepseek_ai · Page de DeepSeek Harness

SWE-sweep : un banc où les agents doivent trouver seuls les bugs à corriger

1er octobre — Des chercheurs de Meta Superintelligence Labs, avec Harvard, l’université de Washington et Stanford, ouvrent SWE-sweep, un banc qui demande aux agents de code de découvrir eux-mêmes les bugs d’un vrai dépôt et d’en corriger le plus possible, sans indice sur leur nature ni sur leur emplacement. Le jeu couvre 100 dépôts et 4 068 bugs ; le code, sous licence MIT, s’appuie sur le framework Harbor, et Ofir Press et John Yang figurent parmi les auteurs. Aucune annonce n’accompagne encore le dépôt, créé le 1er octobre.

Le classement, mis à jour le 24 septembre et mesuré avec l’agent mini-SWE-agent, montre l’ampleur de la tâche :

Rang au classementModèle évaluéBugs résolusCoût total
1Sol 5.6 (xhigh), OpenAI4,7 %7 230 dollars
2Luna 5.6 (xhigh), OpenAI2,5 %224 dollars
3Terra 5.6 (xhigh), OpenAI1,5 %357 dollars
4Luna 5.6 (high), OpenAI1,4 %28 dollars
5Opus 5 (xhigh), Anthropic1,3 %5 363 dollars

🔗 SWE-sweep


Calcul et matériel : premières TPU en orbite, DGX Spark 64 Go, DeepGEMM et DeepEP sur Ascend 950

Project Suncatcher : le satellite prototype de Google emporte ses premières TPU en orbite

1er octobre — Une semaine après avoir annoncé son premier test en orbite, Google a lancé le satellite prototype de Project Suncatcher, un projet de recherche au long cours (moonshot) qui cherche à savoir si l’espace pourrait un jour héberger une infrastructure d’apprentissage automatique à grande échelle. Construit avec Planet, le satellite a rejoint l’orbite à bord de Transporter-18, une mission de covoiturage de SpaceX ; selon Travis Beals, de Google, l’équipe a établi le contact et le satellite fonctionne comme prévu.

Pendant les prochaines semaines, Google mesurera comment ses TPU encaissent les contraintes du vol spatial et les extrêmes de radiation et de température ; au sol, des TPU Trillium avaient déjà supporté une dose de radiation supérieure à celle d’une mission de cinq ans. L’article évalué par les pairs qui détaille la recherche paraît dans la revue Joule. En relayant le lancement le 2 octobre, @GoogleAI rappelle l’argument du projet : en orbite basse, la lumière du soleil est quasi constante et les satellites peuvent produire jusqu’à 8 fois plus d’énergie solaire que sur Terre. Prochaine étape annoncée : deux satellites en 2027 pour tester des liaisons laser.

🔗 Le prototype de Project Suncatcher est en orbite · L’article publié dans Joule · Le relais de @GoogleAI

DGX Spark 64 Go : NVIDIA ajoute une configuration vendue dès le 23 octobre

2 octobre — NVIDIA ajoute à son DGX Spark une configuration à 64 Go de mémoire unifiée, à côté du modèle 128 Go. Elle sera vendue uniquement par six fabricants partenaires, Acer, ASUS, Dell, Gigabyte, HP et MSI, à partir du vendredi 23 octobre, au prix de départ de 4 999 dollars ; le billet ne donne pas le prix actuel du modèle 128 Go. La base reste la même : puce GB10 Grace Blackwell, DGX OS et pile logicielle NVIDIA AI, pour des modèles jusqu’à 100 milliards de paramètres exécutés sur la machine.

L’argument principal est la mise en grappe : deux unités reliées par un câble QSFP sur leurs cartes réseau ConnectX-7 mettent leur mémoire en commun.

Caractéristique techniqueUn DGX Spark 64 GoDeux DGX Spark 64 Go en grappe
Mémoire unifiée64 Go128 Go mis en commun
Taille de modèle annoncéeJusqu’à 100 milliards de paramètresJusqu’à 200 milliards de paramètres
Performances sur Qwen 3.8 27B (test NVIDIA)RéférenceJusqu’à 1,7 fois

L’application NVIDIA Sync s’en charge avec Cluster Assistant, qui détecte les unités et règle le réseau. NVIDIA Sync Model Launcher, annoncé pour la fin du mois, téléchargera et lancera Qwen3.8 27B sur une machine ou une grappe, et configurera OpenCode pour l’utiliser.

🔗 Billet de NVIDIA sur DGX Spark 64 Go

DeepSeek porte DeepGEMM et DeepEP sur les NPU Ascend 950 de Huawei

29 et 30 septembre — DeepSeek a publié sur GitHub, sans annonce, deux portages de ses bibliothèques de calcul vers les NPU Ascend de Huawei. DeepGEMM-Ascend, dont le README date la première version du 30 septembre, reprend à l’identique l’API de DeepGEMM : multiplications de matrices en BF16, FP8 et FP4, logits MQA et MegaMoE, sous licence MIT, pour la série Ascend 950. DeepEP-Ascend porte la bibliothèque de communication du parallélisme d’experts (expert parallelism) des modèles MoE, avec les opérations all-to-all de répartition (dispatch) et de recombinaison (combine).

Sur Ascend 950DT, DeepEP-Ascend mesure une répartition de 373 à 375 Go/s avec 8 rangs et de 313 à 320 Go/s avec 128 rangs ; jusqu’à 32 rangs, il atteint environ 90 à 95 % de la limite physique de bande passante. Ces chiffres ont été obtenus avec un kit matériel (HDK) de preuve de concept fourni à DeepSeek et une configuration manuelle, non distribués publiquement ; le README renvoie à la version commerciale, dont Huawei prévoit la disponibilité vers le 15 octobre.

🔗 DeepGEMM-Ascend sur GitHub · DeepEP-Ascend sur GitHub


Voix et audio : Suno Speech en bêta, ElevenLabs certifié FedRAMP 20x Class A

Suno Speech génère voix parlée et musique de fond dans une même piste

1er octobre — Suno ouvre en bêta Speech, une fonction qui crée de l’audio parlé sur une musique de fond originale, directement dans Suno : on saisit une idée, un poème ou un texte, puis on décrit la voix et le style musical souhaités. Suno présente Speech comme le premier modèle audio qui génère la voix et la musique ensemble, en une seule piste cohérente. Testée pendant un mois auprès d’un petit groupe d’utilisateurs, la fonction est désormais ouverte à tous, après une mise à jour de l’application.

Le billet, signé par le directeur produit Jack Brody, cite surtout des usages personnels : messages d’amis transformés en lectures dramatiques, notes vocales mises en musique, méditations ou histoires du soir. Suno prévient que la bêta reste imparfaite : un accent britannique peut glisser vers l’australien, et les pauses dramatiques peuvent être très appuyées. Ni tarif, ni forfait, ni langues prises en charge ne sont précisés.

🔗 Introducing Speech (Suno)

ElevenLabs certifié FedRAMP 20x Class A pour ElevenAgents et ses API vocales

1er octobre — ElevenLabs obtient la certification FedRAMP 20x Class A, le cadre par lequel les agences fédérales américaines décident si un produit cloud peut être utilisé en toute sécurité avec des données gouvernementales. Elle couvre ElevenAgents et les API Text to Speech et Speech to Text, à condition de fonctionner en Zero Retention Mode avec résidence des données aux États-Unis. Elle étend l’offre ElevenLabs for Government, et l’entreprise figure désormais au FedRAMP Marketplace. Selon FedRAMP, cité par ElevenLabs, le niveau Class A suffit pour la plupart des usages non sensibles des agences ; ElevenLabs cite les demandes de prestations, les permis, les impôts ou la transcription d’audiences.

ElevenLabs appuie l’annonce sur des déploiements publics existants :

Déploiement public citéChiffre annoncé par ElevenLabs
Ligne nationale de l’emploi (Ukraine)25 % traités par des agents conversationnels
Lignes des prestations et de l’emploi (Tchéquie)85 % d’environ 5 000 appels par jour résolus
Ville de Midland7 000 appels manqués en moins par mois (projection)

🔗 Billet d’ElevenLabs


ChatGPT ouvre Finances aux utilisateurs Free et Go aux États-Unis

2 octobre — Finances, l’espace de ChatGPT consacré à l’argent personnel, s’étend aux forfaits Free et Go aux États-Unis, sur le web, iOS et Android. La fonction existait déjà pour les abonnés Plus et Pro : née en aperçu pour les seuls abonnés Pro en mai, elle avait reçu le 21 septembre le suivi du score de crédit Experian pour les abonnés Plus et Pro. Elle couvre désormais les forfaits Free, Go, Plus et Pro, toujours aux seuls États-Unis.

Le principe ne change pas : on relie ses comptes bancaires et d’investissement via Plaid, et son rapport de crédit via Experian, deux connexions utilisables ensemble ou séparément. La page Finances rassemble dépenses, factures, abonnements, patrimoine net, investissements et score de crédit. Dans la conversation, ChatGPT classe les dépenses, repère les abonnements, compare le mois aux tendances récentes et, pour les impôts, organise les informations et signale des pistes à examiner, comme les déductions.

🔗 Notes de version de ChatGPT · Finances in ChatGPT


SpaceXAI publie son SDK TypeScript officiel en version expérimentale

2 octobre — SpaceXAI a publié sans annonce la première version publique de son SDK TypeScript officiel. La 0.1.0 est sortie à 16 h 57 UTC, suivie à 18 h 25 UTC d’une 0.2.0 qui renomme la classe cliente xAI en SpaceXAI : un changement cassant qui aligne le code sur le nouveau nom de l’entreprise. Le SDK couvre déjà la Responses API (streaming, compaction et conversations multitours), les outils intégrés de la plateforme (recherche web et recherche X, exécution de code, serveurs MCP distants), la génération et l’édition d’images et de vidéos, ainsi que les API Files, Batch et Voice.

Élément du SDKDétail relevé
Paquet npm@xai-official/sdk
LicenceApache-2.0
PrérequisNode.js 22.13 ou plus récent, projet ESM, aucune dépendance d’exécution
StatutExpérimental, interfaces non figées avant la 1.0

Par défaut, le SDK refuse de tourner dans un navigateur ou un Worker, pour ne pas exposer la clé secrète côté client. Les développeurs TypeScript disposent ainsi d’un équivalent du SDK Python officiel, dont la version 1.20.0 est sortie le 24 septembre.

🔗 CHANGELOG du SDK TypeScript de SpaceXAI · Le paquet @xai-official/sdk sur npm


Brèves

  • GPT-6.1 Sol dans v0 — Le 29 septembre, jour de la sortie du modèle, v0, le générateur d’applications de Vercel, a ouvert GPT-6.1 Sol, quelques heures après avoir accepté la connexion avec un abonnement ChatGPT ; l’annonce ne donne ni tarif ni mesure propre à v0. 🔗 source
  • Nouveau tableau de bord d’agents dans Grok Build — Annoncé le 1er octobre, il affiche tous les agents sur un seul écran avec /dashboard, lance des tâches en parallèle et place un agent dans son propre worktree git avec Ctrl+W ; Grok Build avait reçu un premier tableau de bord le 15 juin. 🔗 source
  • Nightly de Gemini CLI — La v0.64.0-nightly du 2 octobre ne contient que huit correctifs : Ctrl+C annule de nouveau une opération en cours, et l’état ~/.gemini/state.json s’écrit de façon atomique, avec une sauvegarde .bak restaurée en cas de corruption ; stable et préversion sont inchangées. 🔗 source
  • Modèles retirés de GitHub Copilot — Comme annoncé le 3 septembre, Gemini 3.5 Flash, Gemini 3.6 Flash, Kimi K2.7 Code et Claude Opus 4.7 quittent toutes les expériences Copilot ; GitHub suggère Gemini 3.8 Flash, Kimi K3 et désormais Claude Opus 5.5, au lieu de Claude Opus 5. 🔗 source
  • Tester un SKILL.md — Dans un billet communautaire, Golda Manuel propose une méthode, sans mesure publiée, pour vérifier qu’une compétence est trouvée, chargée et utile aux agents de code : emplacement attendu par Claude Code ou Codex, activation à trois niveaux de requête, comparaison avec et sans compétence sur huit mesures. 🔗 source
  • Manus détaille Video Editor et Game Dev — Deux billets du 1er octobre approfondissent Manus 2.0 : Video Editor, dans Manus Studio, place chaque élément d’une vidéo sur sa propre piste (125 clips montés en un film de 10 min 50 s avec 195 coupes), et Game Dev règle un jeu en direct ; ni tarif ni date. 🔗 Video Editor · 🔗 Game Dev
  • AutoSynthData de ServiceNow — L’équipe CoreAI de ServiceNow génère des tâches d’entraînement vérifiées à partir des échecs d’un modèle : sur EnterpriseOps Gym, Gemma-4-26B-A4B-it gagne 7,2 points de Pass@1 en domaine Hybrid et passe de 18,77 % à 27,18 % en ITSM ; ni code ni données publiés. 🔗 source
  • POCKET-Darwin-180B — VIDRAFT publie une version GGUF 4 bits de 111 Go (contre 360 Go) de Darwin-180B-RSI, un MoE de 180 milliards de paramètres : de 18,4 à 21 tokens par seconde sur processeur seul, 4,17 sur un portable à RTX 5060 de 8 Go, et 87,65 % sur MMLU-Pro comme l’original, selon les auteurs. 🔗 source
  • Guide des modèles GPT-6 — OpenAI publie un guide pour les startups : GPT-6 Astra pour les raisonnements les plus durs, GPT-6.1 Sol pour le code complexe, la recherche et l’utilisation de l’ordinateur, GPT-6 Luna pour les tâches ciblées à grande échelle ; les tokens en cache coûtent jusqu’à 95 % de moins selon le modèle. 🔗 source
  • ChatGPT numérise plusieurs pages en un seul PDF depuis l’appareil photo sur iOS — en déploiement, 1er octobre.
  • Chatham Financial et Codex — Le cabinet de conseil sur les marchés de capitaux a construit avec Codex une application de validation des transactions : d’après les premières mesures, la vérification passe d’environ 30 minutes à moins de 4 ; sa plateforme Onyx combine GPT-5.6 Sol et Terra, GPT-5.4 et GPT-4.1. 🔗 source
  • The Den et ChatGPT Work — Selon une étude de cas d’OpenAI datée du 1er octobre, l’équipe de direction de ce club de Denver pour parents gagne 10 à 15 heures par semaine avec ChatGPT Work, relié à Gmail, Slack et Google Drive ; une demande de subvention prend 2 heures au lieu de 3 jours. 🔗 source
  • GPT-6 Astra Ultrafast sur Blackwell — NVIDIA précise le 1er octobre que le palier Ultrafast de GPT-6 Astra, lancé par OpenAI le 29 septembre, tourne sur ses GPU Blackwell, jusqu’à 8 fois plus vite que le mode Astra Standard, et qu’OpenAI optimise son logiciel d’inférence avec ses propres modèles ; aucun chiffre nouveau. 🔗 source
  • RL Rollouts chez CoreWeave — Présenté le 30 septembre avec CoreWeave Forge et relayé par NVIDIA le 2 octobre, ce service bâti sur NVIDIA Dynamo charge à chaud les nouveaux points de contrôle pendant un post-entraînement par renforcement ; sur Nemotron 3.5 Lightning, la latence de rechargement du modèle est améliorée de 15 fois. 🔗 source
  • Eleven v4 dans ElevenReader — Le modèle vocal le plus expressif d’ElevenLabs, lancé le 28 septembre, arrive dans son application de lecture : articles, livres numériques et PDF dans la voix choisie, en plus de 90 langues, sur iOS, Android et le web. 🔗 source
  • Changelog alpha de Midjourney — Daté du 1er octobre, il réunit surtout des correctifs, dont les paramètres de prompt mémorisés par dossier et les références de style regroupées en une pastille, avant de nouveaux outils collaboratifs annoncés pour la semaine suivante. 🔗 source
  • Grok 4.7 à moitié prix dans Ramp Router — Jusqu’au 6 octobre, la passerelle LLM Ramp Router propose Grok 4.7 avec 50 % de réduction, une offre relayée par SpaceXAI ; le modèle est facturé 2 dollars en entrée et 6 dollars en sortie par million de tokens sur l’API de SpaceXAI. 🔗 source
  • Commentaires confidentiels sur les avis de sécurité — GitHub permet de commenter un avis de sécurité de dépôt sans que le rapporteur le voie : seules les personnes ayant l’accès en écriture lisent ces commentaires, dont les consultations sont journalisées ; une API REST de commentaires passe en préversion publique. 🔗 source · 🔗 API REST
  • API GraphQL de la GitHub Advisory Database — L’objet SecurityAdvisory gagne cinq champs, dont l’identifiant CVE et la date de publication par la NVD, et la requête securityAdvisories deux filtres, par sévérité et par statut retiré : plus besoin de repasser par l’API REST. 🔗 source
  • Fin de l’image macOS 14 dans GitHub Actions — Annoncé le 1er octobre, le retrait aura lieu le 2 novembre, précédé de huit coupures programmées en octobre, de 14 h à minuit UTC ; les workflows doivent passer à macos-15 ou à macos-latest, qui pointe vers macos-26. 🔗 source
  • Maturité de l’IA en entreprise — Perplexity publie un guide qui décrit quatre stades de maturité, résume les cadres de Gartner, Deloitte et Google Cloud et propose une grille d’auto-évaluation ; selon l’enquête 2026 de McKinsey qu’il cite, 80 % des répondants voient des gains de productivité personnelle, mais 37 % seulement une contribution à l’EBIT. 🔗 source

Ce que ça signifie

L’IA appliquée à la science se juge de plus en plus sur des critères extérieurs à ceux qui l’annoncent. Meta ne se contente pas d’aligner des résultats : chaque article dit quels passages l’IA a rédigés, un second groupe de mathématiciens relit, et le billet reconnaît que trois des problèmes ont aussi été résolus ailleurs. Le modèle de prévision de la grippe conçu avec l’IA de Google tire sa valeur d’une évaluation menée par les CDC sur une saison entière, face à 38 autres modèles. Ai2 publie les poids et les données d’AstaBrief, mais prévient que ses comparaisons datent de 2025 : un modèle ouvert se vérifie, une évaluation vieillit.

Les modèles de décision deviennent en quelques jours une catégorie à part entière. Après Jev, d1 de Liquid AI et Clef de Cloudflare, Perplexity propose à la fois une API facturée au token d’entrée et les poids de son modèle ; llama.cpp sert ces modèles en local avec le même format System One, et Replit place Jev dans ses intégrations sans clé d’API. Pour un développeur, l’intérêt est concret : une probabilité par option, obtenue en une seule passe, au lieu d’une réponse en texte qu’il faut ensuite analyser. Les comparaisons demandent de la prudence : la ligne Overall de la fiche place pplx-decider-v1-27b devant Jev, mais le détail publié donne l’avantage à Jev sur six benchmarks sur onze.

Les agents de code progressent plus vite que leur autonomie réelle. Laissé seul face à un dépôt sur SWE-sweep, le meilleur modèle ne trouve et ne corrige que 4,7 % des bugs, pour plus de 7 000 dollars. Claude Code 2.1.288 consacre l’essentiel de ses 89 entrées à des correctifs, dont la reprise après un délai d’API et plusieurs règles de permissions resserrées, et met en avant un mod qui surveille le travail de l’agent principal. Anthropic s’attaque à l’autre goulot d’étranglement, les compétences humaines, avec 100 millions de dollars pour former des ingénieurs capables de mener un déploiement jusqu’en production. Les modèles ouverts, eux, gagnent leur place dans les outils, avec GLM 5.3 dans Cursor et DeepSeek Harness sur le bureau.

Le matériel de calcul, enfin, se diversifie dans trois directions. Google teste en orbite des TPU qui pourraient un jour profiter de jusqu’à 8 fois plus d’énergie solaire que sur Terre, NVIDIA ajoute à son DGX Spark une configuration de 64 Go à associer par deux pour atteindre 200 milliards de paramètres, et DeepSeek rend ses bibliothèques de bas niveau utilisables, avec la même API, sur les puces Ascend de Huawei. Chacun à sa façon élargit l’endroit et le matériel sur lesquels les modèles peuvent tourner.


Sources