Rechercher

GPT-6 Astra passe au grand public, Claude formalise le dernier théorème de Fermat, GitHub orchestre plusieurs modèles avec HydraFusion

GPT-6 Astra sort du déploiement restreint vingt-quatre heures après son lancement : le modèle devient accessible aux forfaits Pro, Enterprise et Business Premium, entre en disponibilité générale dans GitHub Copilot et décroche le meilleur score jamais mesuré par Perplexity sur son banc d’essai de recherche documentée. Anthropic publie de son côté la première preuve du dernier théorème de Fermat vérifiée par ordinateur, écrite en onze jours par Claude. GitHub ouvre HydraFusion, un mode qui choisit lui-même modèle et workflow pour chaque tâche, Google publie Lyria 3.5 dans l’application Gemini, et SpaceXAI ouvre Grok Bot aux entreprises en documentant un agent achats qui a trouvé plus de 100 000 dollars d’économies chez son propre employeur.


GPT-6 Astra sort du déploiement restreint et entre en disponibilité générale dans Copilot

4 septembre — OpenAI annonce à 22 h 13, heure de Paris, que GPT-6 Astra quitte son déploiement restreint. Le modèle est accessible à tous les utilisateurs Pro, Enterprise et Business Premium dans ChatGPT Work et dans Codex, et l’API le donne désormais sans réserve, là où l’annonce du 3 septembre la conditionnait encore au déploiement progressif. Les abonnés Plus et les utilisateurs Business devront patienter quelques jours de plus, précision apportée dans le même message.

Surface concernéeAccès au 4 septembre
API OpenAIDisponible sans réserve
ChatGPT Work et Codex, ProDisponible
Enterprise et Business PremiumDisponible
Plus et autres BusinessQuelques jours de délai

🔗 Annonce OpenAI sur X

Disponibilité générale dans GitHub Copilot, au tarif public dès le premier jour

Le même jour, GPT-6 Astra entre en disponibilité générale dans GitHub Copilot. GitHub met l’accent sur la méthode de travail du modèle plutôt que sur ses scores : dans ses tests internes, Astra planifie et valide au fil de l’exécution, regroupe le diagnostic avec la vérification, et confirme lui-même ses résultats avant de déclarer une tâche terminée, ce qui lui vaut de meilleures performances sur les tâches longues avec moins d’étapes que les modèles OpenAI précédents. Aucun chiffre de benchmark n’accompagne l’annonce.

Le modèle apparaît sur dix surfaces, de Visual Studio Code aux IDE JetBrains en passant par Copilot CLI, GitHub Mobile, Xcode et Eclipse, mais reste réservé aux forfaits Pro+, Max, Business et Enterprise. Copilot Pro est laissé de côté. Le point de facturation mérite d’être noté : Astra est facturé au tarif public du fournisseur en paiement à l’usage, sans période promotionnelle, alors que Gemini 3.8 Flash, arrivé la veille, bénéficie d’une tarification d’introduction jusqu’au 31 décembre 2026.

🔗 Changelog GitHub

Perplexity lui attribue son meilleur score sur WANDR

Perplexity a publié le 3 septembre à 23 h 10 le résultat d’Astra sur WANDR, son banc d’essai maison de recherche documentée à grande échelle. Le modèle obtient 0,682 pour 11,98 dollars par tâche, le score le plus élevé de tous ceux que l’entreprise a testés.

Modèle évaluéScore WANDRCoût par tâcheMesure publiée le
GPT-6 Astra0,68211,98 dollars3 septembre 2026
Claude Fable 5.10,60112,76 dollars1er septembre 2026

Perplexity donne aussi deux écarts relatifs : 13,5 pour cent de score en plus que Claude Fable 5.1 pour 6,1 pour cent de coût en moins, et 27,0 pour cent de plus qu’Opus 5 pour 3,3 pour cent de coût en plus. Deux réserves s’imposent. WANDR est un banc d’essai propriétaire dont la méthodologie détaillée n’est pas publiée, et Perplexity est aussi cliente des modèles qu’elle classe. Aucune valeur absolue n’a été communiquée pour Opus 5.

🔗 Mesure Perplexity sur X

Trois correctifs de Codex CLI achèvent l’intégration

Côté ligne de commande, la 0.153.0 publiée dans la nuit du 3 septembre a été suivie de trois correctifs en moins de deux jours, tous consacrés à Astra. La 0.153.1 permet de configurer le modèle via l’API sans changer le modèle par défaut ni le faire apparaître dans le sélecteur. La 0.153.2 corrige un libellé : le palier Fast est décrit comme offrant 2x la vitesse et non 1,5x, sans que la manière de traiter les requêtes change. La 0.153.3, publiée le 4 septembre à 21 h 01, ajoute Astra au sélecteur de modèles Amazon Bedrock pour les routes Mantle et Runtime, et corrige la consigne donnée au modèle pour les questions de clarification asynchrones.

OpenAI a complété la journée par trois retours d’expérience : deux billets du blog développeurs, l’un sur un jeu d’exploration spatiale procédural construit dans Codex, l’autre sur la conception d’une maison explorée sous Blender et Unreal Engine 5, plus un article de Dominik Kundel sur cinq changements dans sa manière d’utiliser Codex.

🔗 Notes de version Codex CLI 0.153.3 · 🔗 Construire un jeu avec Astra


Claude signe la première preuve formalisée du dernier théorème de Fermat

4 septembre — Anthropic publie la première preuve du dernier théorème de Fermat entièrement vérifiée par ordinateur. Claude a travaillé onze jours, en grande partie de façon autonome, pour l’écrire en Lean. L’entreprise la décrit comme la plus grande preuve Lean jamais construite.

Métrique mesuréeValeur relevée
Durée du travail de Claude11 jours
Lignes de Lean écrites13 millions
Théorèmes intermédiaires démontrés29 500
Première preuve humaine, par Wiles1995, 129 pages
Écart entre la conjecture et sa preuveplus de 350 ans

Le théorème énonce qu’aucun triplet d’entiers positifs ne satisfait l’équation de Fermat pour un exposant supérieur à deux. Pierre de Fermat l’a griffonné vers 1637 dans la marge de son exemplaire de l’Arithmétique de Diophante. La première démonstration correcte est due à Sir Andrew Wiles en 1995 : 129 pages, des mois de vérification humaine, et une première version présentée en 1993 dont un relecteur avait exposé une faille critique deux mois plus tard.

Les premières tentatives ont échoué, les agents obtenant des succès rapides avant de perdre le fil. Le déblocage est venu de Prove2Me, une plateforme collaborative ouverte de formalisation, associée à un harnais multi-agents fondé sur Claude Code. La plateforme maintient un graphe orienté acyclique des énoncés qui sert aux agents à choisir la prochaine preuve à tenter, sépare énoncés et preuves dans des fichiers distincts pour accélérer la compilation Lean, et conserve une description en langage naturel de chaque énoncé pour permettre la recherche et la réutilisation. La preuve produite suit l’exposition simplifiée de Wiles due à Henri Darmon, Fred Diamond et Richard Taylor.

This extraordinary autoformalization achievement, which Anthropic researchers say only took 11 days, proves Fermat’s Last Theorem with no assumptions other than the axioms of mathematics.

🇫🇷 Cette réalisation extraordinaire d’autoformalisation, qui n’a demandé que onze jours selon les chercheurs d’Anthropic, démontre le dernier théorème de Fermat sans autre hypothèse que les axiomes des mathématiques. — Kevin Buzzard, relecteur du résultat, cité sur la page de recherche d’Anthropic

Anthropic présente l’enjeu comme celui de la vérification plutôt que de la découverte, à la différence des travaux récents menés par l’IA sur l’hypothèse de Riemann, qui produisaient des mathématiques nouvelles. À mesure que le volume de démonstrations augmente, la relecture par les pairs devient un goulot d’étranglement qui se compte en années.

🔗 Preuve complète sur GitHub


Project HydraFusion, GitHub fait choisir le modèle par l’outil plutôt que par le développeur

4 septembre — GitHub ouvre en préversion de recherche Project HydraFusion, un mode qui ne désigne plus un modèle mais un workflow. Là où le sélecteur de Copilot demandait de choisir entre plus de vingt modèles, HydraFusion décide lui-même, pour chaque requête, quel modèle traite la tâche et selon quel schéma d’exécution. Il se sélectionne comme n’importe quel modèle, mais en orchestre plusieurs derrière ce choix unique.

Trois schémas existent pour l’instant. Le mode Single confie la tâche à un seul modèle. Le mode Cascade fait rédiger une première solution par un modèle efficace, puis une porte de qualité décide de l’accepter ou d’escalader vers un modèle plus capable. Le mode Critique fait relire le brouillon par un critique indépendant en lecture seule, issu d’une autre famille de modèles.

Benchmark évaluéÉcart de coût face à Opus 5Écart de qualité face à Opus 5
TerminalBench 2.167 pour cent de moinsplus 4,9 points
DeepSWE36 pour cent de moinsmoins 1,5 point
CheckpointBench65 pour cent de moinsmoins 0,1 point

Cinq principes d’ingénierie encadrent l’exécution : comptabilité agrégée du coût de chaque étape, délai d’expiration et annulation explicites, revue en contexte isolé et sans outils, application à sécurité intégrée qui n’applique aucun correctif si le workflow échoue, et validation du routage avant exécution. GitHub assume un compromis d’interface, en affichant les étapes mais en retenant les brouillons intermédiaires jusqu’au résultat final, et reconnaît que l’attente sans visibilité suffisante est un vrai inconvénient.

La documentation du développement est inhabituellement franche : GitHub retient TerminalBench 2.1 comme la séquence de runs la plus complète, précise que la progression n’a pas été linéaire, et reconnaît que deux défaillances opérationnelles du harnais d’évaluation ont produit des runs invalides entre le 11 et le 25 août. Ces runs ont été exclus de la tendance puis corrigés, et l’entreprise situe au 25 août les meilleurs points de fonctionnement de la série enregistrée. L’accès passe par Copilot CLI sur tous les forfaits, au tarif standard fondé sur le total des tokens du workflow, après /update puis /experimental on.

🔗 Project HydraFusion


Lyria 3.5 arrive dans l’application Gemini et dans l’API

4 septembre — Google publie Lyria 3.5, qu’il présente comme son modèle de génération musicale à la meilleure restitution sonore, avec des voix plus expressives et des arrangements plus riches.

Dans l’application Gemini, la mise à jour s’accompagne de trois changements d’interface. L’utilisateur peut sélectionner ou décrire son genre musical et choisir entre un rendu chanté ou instrumental. De nouveaux modèles prêts à l’emploi (templates) servent de point de départ, qu’il s’agisse d’une musique de fond ou d’un morceau d’anniversaire personnalisé. La durée du morceau devient configurable, entre format court et format long.

Type de surfaceAccès à Lyria 3.5
Grand publicApplication Gemini web et mobile, mondial
Création professionnelleGoogle Flow Music
DéveloppeursAPI Gemini, Google AI Studio, Google Vids

Google situe l’usage attendu du côté des besoins quotidiens plutôt que de la production professionnelle : une piste d’accompagnement pour une vidéo, un jingle de marque, une sonnerie personnalisée. La distribution est large, sans restriction d’abonnement mentionnée. Le billet ne donne en revanche aucun chiffre de qualité audio, aucune comparaison avec la version précédente de Lyria, ni aucun tarif pour l’accès par API.

🔗 Annonce Google


SpaceXAI met Grok au travail en entreprise, et publie le prompt système de son agent achats

3 et 4 septembre — SpaceXAI ouvre Grok Bot aux entreprises. Lancé le 12 août, le produit passe d’une offre destinée aux abonnés individuels et aux équipes Cursor à une version dotée de contrôles d’accès, de réseau et d’audit. Le travail de chaque utilisateur s’exécute dans un environnement isolé, et un Bot n’a aucun accès par défaut : il n’atteint que les comptes sur lesquels on le connecte explicitement. Les clients Grok Enterprise et Cursor Enterprise en disposent gratuitement pendant deux semaines et peuvent inviter toute leur organisation, y compris des personnes sans siège existant. SpaceXAI cite Legora, Supermicro et ServiceTitan, et affirme que des milliers d’organisations ont adopté le produit depuis son lancement.

Le point le plus intéressant de l’annonce est que l’usage le plus intense se situe hors de l’ingénierie : prospection nocturne et grilles d’évaluation en recrutement, brouillons de courriel et mise à jour de présentation en vente, extraction des questions-réponses d’un webinaire en marketing.

Le lendemain, l’entreprise publie l’étude de cas d’un Bot lâché sur ses propres achats. Baptisé Haggle Bot et connecté à Slack, Notion, Drive, Gmail, Hex et Ramp, il annonce plus de 100 000 dollars d’économies directes.

Trouvaille de l’agentMontant identifié
Économies directes totalesplus de 100 000 dollars
Sièges inactifs sur 90 jours, premier produit43 sièges, 14 220 dollars
Références inutilisées, produit mensuel85 662 dollars par an

L’intérêt éditorial du billet dépasse ces chiffres : SpaceXAI publie le gabarit de prompt système de l’agent, présenté comme un modèle à remplir pour sa propre organisation, dont les valeurs sont données à titre d’exemple entre chevrons. Sa section de permissions distingue trois régimes permanents. Un premier ne demande jamais d’accord, avec pour exemples la lecture des données de dépense et les messages aux collègues. Un deuxième exige l’aval explicite de l’opérateur à chaque fois, tout envoi vers un fournisseur étant l’exemple donné. Un troisième reste interdit en toutes circonstances, et les exemples cités y placent la signature, l’achat, la souscription, l’approbation de dépenses et tout engagement contraignant. Le billet précise en prose que l’équipe a laissé l’agent mener seul la recherche interne et la coordination, mais a exigé une approbation explicite pour dépenser, accepter des conditions ou écrire à un fournisseur.

🔗 Grok Bot for Enterprise · 🔗 Haggle Bot lâché sur les achats


Grok se connecte aux comptes bancaires américains via Plaid

4 septembre — Grok peut désormais se brancher sur les comptes financiers de ses utilisateurs. La connexion passe par Plaid, l’intermédiaire technique qui relie applications et établissements bancaires aux États-Unis, et la fonction est disponible immédiatement dans ce seul pays.

Les trois exemples retenus par SpaceXAI dessinent le périmètre visé : savoir où est passé l’argent du mois écoulé, suivre la performance de ses placements, et vérifier si l’on peut réellement s’offrir ce qui se trouve dans son panier. Autrement dit, de l’analyse de dépenses passées, du suivi de portefeuille et une aide à la décision d’achat au moment où elle se pose. L’annonce reste brève et ne dit rien du traitement des données ni des établissements couverts, au-delà de la mention d’une connexion sécurisée.

Elle prolonge une série d’intégrations financières engagée avec le rapprochement Interactive Brokers du 25 juin, mais la nature change : là où Interactive Brokers visait les investisseurs actifs, Plaid ouvre l’assistant aux comptes courants du grand public.

🔗 Annonce Grok sur X


Claude Code 2.1.260 et 2.1.261 : panneau de diff, audit des skills et permissions durcies

4 septembre — Deux versions de Claude Code sortent le même jour, et elles se répondent : la première apporte de la visibilité sur le travail en cours, la seconde sur ce que la session consomme.

Version publiéeHeure de sortieApports marquants
2.1.2604 septembre 01h48Panneau /diff, diagnostic de cache dans /cost, correctifs de permissions
2.1.2614 septembre 21h58/skill-doctor, sorties jusqu’à 128 000 caractères, prompt de sous-agent en fichier

La 2.1.260 ouvre un panneau de diff à côté de la conversation en mode plein écran, qui affiche les modifications non commitées au fil des éditions. Elle corrige surtout plusieurs failles d’évaluation des permissions : les règles Edit, Write et Read dont le chemin contenait des parenthèses étaient rejetées comme invalides ou ignorées par le bac à sable Bash, ce qui laissait inscriptibles des dossiers censés être en lecture seule, et les commandes zsh dissimulant une substitution de commande dans une affectation REPORTTIME étaient auto-approuvées.

La 2.1.261 ajoute /skill-doctor, qui liste les skills chargés restés inutilisés et le coût en contexte de chacun. Son mode auto traite désormais comme un envoi vers un site tiers un lien qui empaquette du contenu dans l’URL d’un générateur public de diagrammes.

🔗 Notes de version 2.1.260 · 🔗 Notes de version 2.1.261


La commande ant apply met les Managed Agents en fichiers versionnés

4 septembre — Anthropic ajoute ant apply à son CLI ant. La commande transpose aux Managed Agents le modèle déclaratif familier aux équipes d’infrastructure : on décrit l’état voulu dans des fichiers du dépôt, la commande réconcilie les ressources de l’API avec cette description.

Cinq types de ressources sont concernés : les environnements Managed Agent, les agents eux-mêmes, les skills, les magasins de mémoire (memory stores) et les déploiements. Jusqu’ici, ces objets se créaient par appels d’API ou via la console, sans trace dans le dépôt. Les décrire en fichiers les fait entrer dans le champ de la revue de code, du versionnement et des pipelines d’intégration continue. L’intérêt pratique tient à la reproductibilité : un environnement d’agent décrit en fichier peut être recréé à l’identique, comparé d’une branche à l’autre, ou déployé depuis un pipeline sans intervention manuelle.

🔗 Annonce sur X


La salve NVIDIA : mémoire durable des agents, raisonnement sur Jetson et identité fédérée

3 et 4 septembre — Trois publications du blog technique de NVIDIA le même jour, sur trois couches différentes de la pile.

La première est une recette ouverte bâtie sur NemoClaw : un agent chef de cabinet qui entretient une mémoire durable du travail de son utilisateur. La thèse tient en une phrase : une mémoire d’agent utile demande de la structure, de la récupération sélective et de la gouvernance, pas seulement du stockage. Le dispositif repose sur un modèle de soi (self model), une couche de connaissance lisible par un humain écrite en pages Markdown structurées, doublée d’un registre SQLite qui conserve obligations, classements, corrections et événements d’audit. L’exécution passe par NVIDIA OpenShell, qui applique en bac à sable les politiques d’accès au système de fichiers, aux processus et au réseau, les identifiants restant hors du bac à sable.

Métrique mesuréeBase de RAG agentiqueModèle de soiÉcart constaté
Exactitude globale, sur 186 questions82,8 pour cent90,9 pour centplus 8,1 points
Questions difficiles, sur 31 questions67,7 pour cent87,1 pour centplus 19,4 points
Suivi de faits qui changent, sur 560,0 pour cent100,0 pour centplus 40,0 points
Fidélité au corpus, sur 13 questions100,0 pour cent92,3 pour centmoins 7,7 points

Context can inform an action, but it cannot authorize one.

🇫🇷 Le contexte peut éclairer une action, mais il ne peut pas l’autoriser.Billet NVIDIA sur la mémoire des agents

La deuxième publication est un guide de déploiement qui acte un basculement pour l’IA embarquée : la quantification NVFP4 combinée au décodage spéculatif atteint jusqu’à 6,28 fois le débit de décodage face à BF16 sur Jetson AGX Thor et Orin. La configuration gagnante diffère selon le modèle, et NVIDIA insiste sur ce point plutôt que de désigner un vainqueur universel : Nemotron 3.5 Lightning donne son meilleur résultat avec DSpark, entre 123 et 138 tokens de sortie par seconde, Qwen3.8-27B avec DFlash2, entre 27,7 et 34,4 tokens par seconde. L’avertissement final est méthodologique : le débit varie selon la charge, donc valider la configuration avec des invites représentatives de l’application visée. La troisième, plus modeste, décrit la propagation de l’identité d’un utilisateur entre plateformes Kubernetes fédérées et plateformes d’IA.

🔗 Raisonnement de frontière sur Jetson · 🔗 Identité entre plateformes fédérées


Les outils en ligne de commande de Google : Gemini CLI passe en série 0.60.0, Antigravity ouvre Flash aux entreprises

3 et 4 septembre — Le canal nightly de Gemini CLI quitte la série 0.59.0 pour la 0.60.0, avec une livraison à dominante sécurité. Le correctif le plus notable retire une clé d’API Google CrUX codée en dur dans le composant chrome-devtools-mcp. Deux autres changements durcissent l’isolation : le bac à sable macOS Seatbelt reçoit un répertoire temporaire isolé, et le chargeur d’extensions applique une résolution de chemin renforcée assortie d’une validation des limites. Le quatrième impose dans le flux OAuth des serveurs MCP l’identification de l’émetteur conforme à la RFC 9207, une protection contre les attaques par substitution d’autorité.

Antigravity 2.12.2, publié la veille, ne contient qu’une seule amélioration et aucun correctif : les utilisateurs entreprise accèdent aux modèles de raisonnement Gemini 3.8 Flash en s’authentifiant par les identifiants par défaut de l’application (Application Default Credentials). L’intérêt pratique est le raccordement du modèle au mode d’authentification standard des déploiements Google Cloud, sans clé API individuelle.

🔗 Gemini CLI v0.60.0 nightly · 🔗 Changelog Antigravity


L’IA au service de la science : un émulateur climatique couplé et le connectome complet d’une drosophile mâle

3 et 4 septembre — Deux publications appliquent l’apprentissage automatique à des objets scientifiques massifs, dans deux disciplines sans rapport entre elles.

Ai2 publie SamudrACE-E3SMv3 sous licence Apache 2.0 sur le Hub Hugging Face, un émulateur climatique entièrement couplé atmosphère-océan. L’objet du travail est de reproduire le comportement d’E3SM, le modèle climatique de référence du Département de l’Énergie américain, à un coût de calcul très inférieur : filtrer des hypothèses avant de lancer E3SM lui-même, et produire de grands ensembles qui échantillonnent à faible coût la variabilité climatique. Les émulateurs d’atmosphère (ACE) et d’océan (Samudra) sont d’abord pré-entraînés séparément avant d’être couplés, puis évalués sur 400 années de données E3SM jamais vues, sur lesquelles le climat moyen tient. Ai2 signale une limite explicite : l’émulateur capture les précipitations quotidiennes jusqu’au 99,99e centile mais sous-estime au-delà.

Le HHMI Janelia Research Campus, Google Research et leurs collaborateurs publient de leur côté la première carte complète du cerveau et du système nerveux central d’une drosophile mâle adulte : plus de 166 000 neurones, un record, répartis en 11 691 types cellulaires classés avec l’aide de l’IA et validés par des experts humains. La méthode repose sur l’imagerie de coupes fines puis la recomposition par ordinateur de millions d’images en deux dimensions en formes neuronales tridimensionnelles. L’intérêt tient à la comparaison avec la carte femelle publiée précédemment : la majorité des neurones sont identiques dans les deux sexes, une minorité est spécifique, et une troisième catégorie dite dimorphique existe chez les deux mais se connecte à des voisins différents. Trois études compagnon appliquent la carte à la vision, au goût et au comportement social.

🔗 SamudrACE-E3SMv3 sur X · 🔗 Carte du cerveau de la drosophile mâle


Meta ouvre au public le palier de raisonnement max de Muse Spark 1.3

4 septembre — Meta rend public le palier de raisonnement max de Muse Spark 1.3, deux jours après l’annonce du modèle lui-même. Le palier est disponible dans Muse Code et dans la Meta Model API.

Ce qui change n’est donc pas le modèle mais l’ouverture effective de son niveau de raisonnement le plus coûteux. Alexandr Wang, chief AI officer de Meta, précise que le gain porte sur le codage et les tâches agentiques, et recommande de réessayer le modèle même pour ceux qui avaient déjà testé les paliers high et xhigh. Il ajoute que le lancement intervient après l’achèvement des tests de sécurité. L’activation demande de sélectionner Muse Spark 1.3 puis de régler le niveau de raisonnement sur max.

Aucun chiffre de benchmark n’accompagne cette mise à disposition : le fil ne publie ni score ni comparaison, seulement une appréciation qualitative de son auteur.

🔗 Annonce AI at Meta


Percept-Lens, le protocole de Sakana AI pour évaluer la détection d’images générées

3 septembre — Sakana AI présente Percept-Lens, un cadre d’évaluation hors distribution pour la détection d’images générées par IA, accepté à ECCV 2026. Le constat de départ est que les détecteurs d’images synthétiques échouent dès que plusieurs facteurs changent en même temps : le générateur, le style ou l’invite, et le domaine source. Percept-Lens unifie l’évaluation sur 39 jeux de données publics, soit 7,1 millions d’images.

L’étude de représentation pose une question directe : l’entraînement d’une tête de classification apporte-t-il encore quelque chose au-delà de ce que les encodeurs modernes séparent déjà ? Les auteurs construisent une échelle de discriminants gaussiens conditionnés par l’a priori, c’est-à-dire des têtes en forme close bâties sur les statistiques d’ordre un et deux des caractéristiques. Le meilleur barreau de cette échelle rivalise souvent avec les têtes de détection publiées, et les dépasse parfois, à condition de comparer à a priori et encodeur identiques. Les auteurs plaident pour un compte rendu au niveau du triplet a priori, encodeur, tête.

🔗 Billet Sakana AI · 🔗 Article arXiv


TAOT, le placement des répliques d’experts qui tient compte de la topologie réseau

4 septembre — L’équipe Baige de Baidu détaille TAOT, une méthode de placement des répliques d’experts pour l’entraînement de modèles mixture-of-experts, livrée dans son framework open source LoongForge.

Le problème est concret. Quand un entraînement MoE ralentit, la cause est rarement la puissance des GPU mais l’incapacité à rééquilibrer la charge à temps : quelques experts deviennent des points chauds et tous les autres rangs attendent. Le remède classique consiste à répliquer temporairement les poids d’un expert chaud sur un rang inactif, mais dès que le domaine de parallélisme dépasse un nœud, tous les GPU inactifs ne se valent plus : l’intra-nœud passe par NVLink, le cross-nœud par InfiniBand, et le coût peut varier d’un ordre de grandeur.

Métrique mesuréeValeur relevée
Temps par itération, avant puis après155,4 ms puis 108,8 ms, soit 1,43x
Accélération de EP4 à EP16jusqu’à 1,79x
Coût de communication face à LPLBjusqu’à 74 pour cent plus bas à EP32
Surcoût de planification en lignemoins de 1 pour cent du temps de passe avant

TAOT est présenté comme la première méthode à faire entrer dans une seule fonction objectif le bénéfice d’écrêtage des pics et le coût de déplacement des poids entre nœuds. Là où LPLB de DeepSeek contraint les chemins par des graphes prédéfinis, TAOT emploie une matrice de coût de communication continue avec une préférence topologique souple : l’intra-nœud est privilégié, le cross-nœud reste légal mais plus cher. Le passage de l’appariement par lignes à l’appariement par colonnes fait tomber le déséquilibre résiduel de 7 à 10 pour cent à 1 à 2 pour cent.

🔗 Billet Hugging Face


Open Yap 1K, mille heures de conversation en duplex intégral libres d’usage commercial

3 septembre — The Agentic Data Company publie Open Yap 1K, un corpus de conversation anglaise en deux canaux séparés, conçu pour les modèles vocaux en duplex intégral.

Élément du corpusÉchantillon publicCorpus complet
Durée totale8,9 heures1 000 heures
Conversations161 602
Licence appliquéeCC BY 4.0Open Yap, usage commercial libre
Mode d’accèsHub Hugging FaceSur demande

Les auteurs positionnent explicitement le corpus comme une alternative aux corpus de parole existants tels que Fisher, Switchboard et CANDOR, avec un argument d’abord technique : le billet met en regard un extrait Fisher English, échantillonné à 8 kHz sur bande téléphonique, et un extrait Open Yap 1K, pour illustrer l’écart de qualité audio. Méthode de collecte, démographie des locuteurs, assurance qualité, consentement et confidentialité sont documentés.

🔗 Billet Hugging Face


Daily Brief devient gratuit pour davantage d’utilisateurs américains de Gemini

4 septembre — Google élargit gratuitement l’accès à Daily Brief pour un plus grand nombre d’utilisateurs de l’application Gemini aux États-Unis. La fonctionnalité avait été introduite le 21 mai.

Daily Brief travaille en arrière-plan et fait le lien entre les applications Google de l’utilisateur : courriels, agenda, conversations et centres d’intérêt sont condensés en une liste unique et parcourable de tâches et de priorités, présentée comme un point de départ de journée. L’annonce reste limitée aux États-Unis et ne précise ni le pourcentage d’utilisateurs concernés, ni le calendrier d’une extension internationale.

🔗 Annonce Gemini sur X


Runway ouvre Team, un forfait en libre-service pour les équipes de deux à neuf sièges

4 septembre — Runway lance Team, qui comble le vide entre les formules individuelles et une offre Enterprise réservée aux grands comptes. La bascule est structurante pour le catalogue : Standard, Pro et Max deviennent explicitement des formules individuelles, et tout nouveau membre passe désormais par Team, les espaces existants conservant leur accès et leur tarif.

Caractéristique du forfaitValeur annoncée
Tarif mensuel par siège69 dollars
Tarif annuel par siège55 dollars, soit 20 pour cent de remise
Nombre de sièges admis2 à 9
Crédits mensuels par siège6 900, versés dans une réserve commune
Projets partagés et stockagejusqu’à 100 projets, 1 To

Le forfait s’organise autour de projets partagés où résident actifs, références, Brand Kits, sessions et workflows. Runway défend l’argument sous l’angle de la cohérence de sortie : quand toute l’équipe génère à partir des mêmes références, la dixième vidéo ressemble à la première. Les crédits inutilisés sont reportés un mois, une équipe partage jusqu’à 20 compétences d’agent, et les Agent Connectors rattachent Figma, Dropbox et Notion à l’agent créatif.

🔗 Annonce Runway


ElevenLabs étend son initiative 1 Million Voices au Brésil

4 septembre — ElevenLabs porte son programme d’impact au Brésil et l’illustre par une première histoire brésilienne. Eliane a perdu sa voix depuis l’enfance, Alberto est devenu aveugle à 46 ans ; l’entreprise a donné à Eliane une voix qui porte la ressemblance de celle de sa famille, ce qui lui permet pour la première fois de communiquer avec l’homme qu’elle aime dans une voix qui porte son identité.

L’annonce s’accompagne de deux partenariats locaux. L’Associação Brasileira de Esclerose Lateral Amiotrófica, qui sert jusqu’à 10 000 personnes atteintes de sclérose latérale amyotrophique dans le pays, permet à ces malades d’obtenir un accès gratuit pour cloner leur voix. La Sociedade Brasileira de Fonoaudiologia formera de son côté les orthophonistes brésiliens au clonage vocal, l’entreprise misant sur l’aisance des praticiens pour élargir le nombre de patients bénéficiaires. L’initiative 1 Million Voices est un engagement en nature d’un milliard de dollars qui a touché plus de 11 000 personnes dans le monde depuis son lancement.

🔗 Billet ElevenLabs


Kimi Code 0.41.0 ajoute un mode multi-agents et retire un garde-fou vieux de deux jours

4 septembre — Moonshot AI publie Kimi Code 0.41.0. La nouveauté visible est tower, un mode expérimental de collaboration multi-agents dans l’interface web, déclenché par la commande /tower ou par le menu plus du composeur, qui accepte une branche de base en argument. La gestion du contexte reçoit deux ajustements : le modèle est averti de son budget de contexte avant une compaction automatique, puis redirigé vers le journal d’événements de la session pour retrouver les détails exacts. L’historique de fichiers au niveau du tour devient permanent.

Le point le plus notable est un retour en arrière. La version 0.40.0, publiée le 2 septembre, avait introduit le blocage des commandes destructrices comme shutdown, reboot ou rm -rf en mode de permission automatique. La 0.41.0 inverse ce choix et cesse de bloquer les commandes dangereuses, ainsi que celles qui ne peuvent pas être analysées statiquement, dans ce même mode. Le garde-fou aura tenu deux jours. Le motif n’est pas explicité dans les notes, mais l’analyse statique de commandes shell produit facilement des faux positifs qui bloquent du travail légitime.

🔗 Notes de version Kimi Code 0.41.0


Perplexity détaille Ivy, Tulip et ROSE, la pile maison qui sert ses embeddings

4 septembre — Perplexity publie un billet d’ingénierie qui ouvre le capot de l’infrastructure servant ses modèles d’embedding et de classement (ranking). L’entreprise entraîne et sert ses propres modèles, dont pplx-embed, et décrit son index de recherche comme étant à l’échelle de l’exaoctet.

Composant de la pileLangage employéRôle dans le service
IvyRustPasserelle HTTP, tokenisation, découpage et répartition des lots
TulipRust, tokio, tonicServeur d’inférence gRPC, ordonnancement et mise en lots
ROSEPythonExécution des modèles, noyaux et graphes CUDA

L’idée directrice est la réutilisation du code d’inférence des LLM. Perplexity observe que l’embedding par lots ressemble à la phase de préremplissage (prefill), limitée par le calcul, tandis que l’embedding en ligne d’une requête courte ressemble à la phase de décodage (decode), limitée par la mémoire. Les mêmes noyaux (kernels) servent donc pplx-embed et le décodage de Qwen3.5, sans cache clé-valeur instancié pour les embeddings et avec des variantes d’attention acceptant des entrées irrégulières (ragged) qui évitent le remplissage inutile. Sur les noyaux d’attention, l’équipe maintient FlashInfer 2, FlashInfer 3 et FlashAttention 4 en parallèle plutôt que d’en choisir un seul, le choix se faisant au cas par cas selon le nombre et la dimension des têtes. Les mesures sont comparées à vLLM v0.22.0, mais leurs résultats chiffrés ne figurent que dans des graphiques.

🔗 Billet d’ingénierie Perplexity


Zed et Replit annoncent sur X, sans billet ni notes de version

4 septembre — Deux annonces d’outils de codage tiers arrivent le même jour, et toutes deux reposent sur une seule publication X, sans billet de blog ni notes de version pour les étayer.

Zed indique que Delta est accessible dès maintenant aux personnes inscrites à la bêta sous Windows, en réponse à une demande d’utilisateur du 2 septembre. La distinction compte : Delta est l’environnement multijoueur de codage avec agents lancé le 12 août, qui permet à plusieurs membres d’une équipe de travailler avec des agents sur un projet partagé. L’éditeur Zed, lui, est déjà distribué pour macOS, Linux et Windows. L’annonce ne concerne donc pas l’éditeur mais Delta, dont la disponibilité Windows restait en attente depuis août. Le périmètre exact de cette bêta et ses modalités d’inscription restent inconnus.

Replit a de son côté diffusé une session en direct d’une heure et 58 minutes intitulée « Replit MCP: Steer Your Agent From Anywhere ». Le titre annonce un serveur MCP exposant l’agent de la plateforme à des clients compatibles avec le protocole, l’usage visé étant de lancer une tâche et d’en suivre l’avancement depuis un éditeur, un terminal ou un assistant tiers, sans passer par l’interface web. Le message ne comporte aucun autre texte que ce titre, ni lien vers un billet, ni formulation explicite de lancement.

🔗 Delta sur Windows · 🔗 Replit MCP en direct


Brèves

  • Un endpoint API restitue l’historique des étoiles sans exposer les utilisateurs — l’API REST de GitHub renvoie les comptes d’étoiles horodatés sans identifier les comptes qui les ont attribuées, en remplacement des endpoints de listage réservés aux administrateurs plus tôt dans l’année. 🔗 Changelog
  • npm accepte plusieurs configurations de publication de confiance par paquet — trois évolutions en disponibilité générale : des configurations OIDC multiples et additives par paquet, une approbation bloquée tant que l’analyse antimalware tourne, et l’historique de préproduction visible dans l’onglet des versions. 🔗 Changelog
  • GitHub Actions ajoute une API de dépréciation des runners — l’API REST donne les dates de fin de prise en charge d’une version de runner, une permission vulnerability-alerts ouvre les alertes Dependabot en lecture seule, et quatre propriétés du contexte job donnent aux workflows réutilisables leur identité d’origine. 🔗 Changelog
  • Le documentaire The Story of VS Code sort le 4 septembre — GitHub relaie la diffusion du documentaire officiel sur Visual Studio Code, sur la chaîne YouTube de l’éditeur, après une bande-annonce publiée le 1er septembre. 🔗 Annonce
  • Replit met en avant une application construite en une semaine — Pep AI, bâtie sur la plateforme par Cédric Roberge en une semaine environ, rapporterait de l’ordre de 130 000 dollars par mois selon Replit, dans un fil promotionnel suivi de conseils de tarification. 🔗 Fil Replit
  • Zed publie une annonce visuelle dont le contenu n’a pas pu être vérifié — un message de quatre mots accompagné d’une seule image, publié le 4 septembre à 22h14. L’image ne s’est pas chargée pendant le scan et aucun billet ni note de version n’accompagne la publication : rien ne permet d’établir ce qu’elle annonce. 🔗 Message
  • Un écosystème LLM ouvert complet pour l’arménien — une collection Hugging Face réunit le corpus web ArmWeb, le jeu de données scientifique vérifié ArmSTEM et le modèle arm-gemma-e4b, avec un article annoncé comme à venir. 🔗 Billet
  • VLM Run Gateway réunit les modèles OCR et vision à poids ouverts derrière une seule API — la passerelle expose sous un point d’entrée unique des modèles de reconnaissance optique, vision-langage et vision à poids ouverts, dont PaddleOCR-VL-1.6. 🔗 Billet
  • Sakana AI ouvre les portes de son équipe d’ingénierie le 5 octobre — l’Engineer Open House est reconduite le lundi 5 octobre 2026 de 18 h à 21 h, à Toranomon ou en ligne, avec inscription sur connpass. 🔗 Annonce
  • Google détaille les sprints de son programme d’expérience développeur Gemini Enterprise — billet de méthode sans lancement : le sprint décrit porte sur la gouvernance de l’IA en entreprise et livre une documentation mise à jour et des exemples de code normalisés pour Agent Gateway et Semantic Governance. 🔗 Billet
  • Suno nomme sa prochaine génération de modèles, la famille v6 — dans une réponse à un utilisateur, le compte officiel la présente comme son meilleur travail à ce jour, sans date ni détail technique, au lendemain de l’entrée en vigueur des nouvelles limites de téléchargement. 🔗 Réponse
  • MiniMax et Together AI organisent une soirée sur l’économie des modèles ouverts à Londres — l’événement commun Open by Design: The Economics of AI in Production se tiendra le 16 septembre, seule publication de MiniMax dans la fenêtre. 🔗 Annonce
  • Mistral ramène la conférence AI Engineer à Paris les 23 et 24 septembre — le retour à Station F réunit le vice-président ingénierie Lélio Renard-Lavaud aux côtés de Black Forest Labs, Cognition et Hugging Face, après une édition précédente complète. 🔗 Annonce
  • Le WebMCP Challenge ferme ses soumissions — la clôture arrive après le report de douze heures dû à la panne du 3 septembre ; les projets sont en cours d’examen et les gagnants seront annoncés prochainement. 🔗 Annonce

Ce que ça signifie

La vitesse d’absorption d’un modèle de frontière par l’écosystème est devenue le vrai indicateur. GPT-6 Astra a été annoncé le 3 septembre ; le 4, il est dans l’API sans réserve, en disponibilité générale sur dix surfaces Copilot, mesuré par un tiers qui l’exploite en production, et intégré par trois correctifs successifs de Codex CLI. Ce délai de vingt-quatre heures n’existait pas il y a un an. Il déplace la question du lancement vers la facturation : GitHub applique à Astra le tarif public du fournisseur sans période promotionnelle, là où Gemini 3.8 Flash bénéficie d’une tarification d’introduction jusqu’à la fin de l’année. Quand tous les modèles arrivent le lendemain de leur annonce, le prix redevient le seul discriminant visible pour l’utilisateur final.

HydraFusion s’attaque au problème par l’autre bout, et c’est la nouvelle la plus structurante de la journée pour l’outillage. Choisir entre vingt modèles est un travail que peu de développeurs font sérieusement, et GitHub propose de ne plus le faire du tout : on sélectionne un workflow, l’outil décide du modèle à chaque requête. Les chiffres, 4,9 points de qualité en plus pour 67 pour cent de coût en moins face à Opus 5 sur TerminalBench, valent surtout pour ce qu’ils suggèrent : le gain vient de l’orchestration, pas d’un modèle supérieur. Si ce résultat tient hors des conditions de banc d’essai, le modèle cesse d’être le produit et devient un composant interchangeable derrière une porte de qualité.

Les agents en entreprise sortent de l’ingénierie, et la gouvernance suit. SpaceXAI l’affirme explicitement, l’usage le plus intense de Grok Bot se situe hors du code, et le chiffre le plus parlant de la journée est un audit de sièges logiciels : 43 abonnements payés sans activité depuis 90 jours. Mais le vrai contenu de ces annonces est la mécanique de permission. Le gabarit de prompt système publié par SpaceXAI distingue trois régimes, toujours autorisé, autorisé au cas par cas, jamais autorisé, et NVIDIA formule le même principe dans son billet sur la mémoire des agents : le contexte peut éclairer une action, il ne peut pas l’autoriser. Deux acteurs sans rapport arrivent le même jour à la conclusion qu’un agent utile se définit d’abord par ce qu’on lui interdit.

Sur les outils en ligne de commande, la sécurité avance en zigzag plutôt qu’en ligne droite. Gemini CLI retire une clé d’API codée en dur et durcit son bac à sable, Claude Code corrige des règles de permission qui laissaient inscriptibles des dossiers censés être en lecture seule, et Kimi Code retire le blocage des commandes destructrices deux jours après l’avoir ajouté. Ce dernier cas est le plus instructif : l’analyse statique de commandes shell produit assez de faux positifs pour qu’un garde-fou correct sur le papier devienne insupportable à l’usage. La sécurité de ces outils ne se joue pas dans l’annonce d’une protection, mais dans sa survie au contact des utilisateurs.

Reste la journée en mathématiques et en sciences, la plus difficile à évaluer sur le moment. La preuve de Fermat formalisée en onze jours ne produit aucune mathématique nouvelle : elle vérifie un résultat vieux de trente ans. C’est précisément ce qui la rend intéressante, parce que la relecture par les pairs est le goulot d’étranglement qui se compte en années, et que Kevin Buzzard relève que ces artefacts sont désormais assez robustes pour servir de base à d’autres travaux. L’émulateur climatique d’Ai2 et le connectome de la drosophile relèvent de la même logique : ni l’un ni l’autre ne découvre, tous deux rendent praticable un travail dont le coût interdisait l’échelle. C’est un usage moins spectaculaire que la découverte autonome, et probablement plus proche de ce que l’IA change réellement dans la pratique scientifique.


Sources