Cette semaine, Meta publie Muse Glimmer, un modèle agentique multimodal de 30 milliards de paramètres à poids ouverts, immédiatement accessible via un endpoint GPU-accéléré NVIDIA en plus de Hugging Face. OpenAI restructure son programme de cybersécurité Daybreak et lance GPT-5.6-Cyber, un modèle qui a déjà permis de découvrir une faille inédite dans le moteur JavaScript de Chrome. Autre fait marquant : une version de recherche non publiée de Claude a fait progresser un problème mathématique lié à la conjecture de Riemann, avec preuve formelle vérifiée. Au menu également : tarification Anthropic, outillage développeur, IA vocale d’entreprise et finance IA-native.
Meta publie Muse Glimmer, modèle agentique 30B à poids ouverts, disponible via NVIDIA
Meta a publié Muse Glimmer, un modèle dense multimodal de 30 milliards de paramètres (encodeur visuel de 2B + décodeur texte de 28B) optimisé pour tourner localement, en continu, sur du matériel grand public — Mac ou PC équipé d’un GPU performant. Les poids sont distribués sous licence Apache 2.0. Le modèle gère une fenêtre de contexte de plus de 120 000 tokens et atteint, selon NVIDIA, jusqu’à 20 000 tokens par seconde sur un seul GPU ; Alexandr Wang (Meta Superintelligence Labs) précise qu’il tourne sur 24 Go de VRAM sans perte de fiabilité agentique.
Sur le plan technique, Muse Glimmer combine attention à fenêtre glissante et attention complète, une architecture Gated Grouped-Query Attention qui réduit le cache mémoire d’un facteur 16, et un modèle de brouillon léger DFlash qui accélère la génération de 2 à 4x. Le support est disponible dès le jour 0 dans transformers, llama.cpp et vLLM, avec des poids GGUF quantifiés et des déploiements via les Inference Endpoints de Hugging Face.
| Caractéristique technique | Valeur mesurée |
|---|---|
| Paramètres | 30B (encodeur 2B + décodeur 28B) |
| Licence | Apache 2.0 |
| Fenêtre de contexte | 120 000+ tokens |
| VRAM minimale | 24 Go |
| Débit (1 GPU) | jusqu’à 20 000 tokens/s |
| MCP Atlas (agentique) | 75,5 (contre 54,2–62,5 pour les concurrents) |
NVIDIA a immédiatement ouvert un point d’accès GPU-accéléré pour tester Muse Glimmer, optimisé pour ses plateformes edge, desktop et workstation — une disponibilité concrète en complément du téléchargement des poids.
Introducing Muse Glimmer, an open-weight 30B-parameter model optimized for local, always-on agent workflows. […] we’re releasing model weights under a permissive Apache 2.0 license.
🇫🇷 Présentation de Muse Glimmer, un modèle à poids ouverts de 30 milliards de paramètres optimisé pour des workflows d’agents locaux et permanents. […] nous publions les poids du modèle sous licence permissive Apache 2.0. — @AIatMeta sur X
🔗 NVIDIA propose un endpoint GPU-accéléré pour Muse Glimmer
OpenAI étend Daybreak et lance GPT-5.6-Cyber, une CVE inédite découverte dans Chrome
OpenAI restructure son programme de cybersécurité Daybreak en deux niveaux d’accès et lance GPT-5.6-Cyber, un modèle spécialisé construit sur GPT-5.6 Sol. L’objectif affiché : mettre une intelligence de pointe entre les mains de défenseurs de confiance avant que les capacités offensives ne se généralisent chez les attaquants.
| Niveau d’accès | Modèle utilisé | Public visé |
|---|---|---|
| Daybreak Blue | GPT-5.6 Sol (garde-fous système levés) | Point d’entrée recommandé pour la majorité des défenseurs |
| Daybreak Red | GPT-5.6-Cyber (nouveau) | Chercheurs en sécurité expérimentés, travaux autorisés avancés |
GPT-5.6-Cyber réduit les refus sur certaines requêtes dual-use à haut risque (par exemple du pentest sur des systèmes de production) et dépasse GPT-5.6 Sol ainsi que l’ancien GPT-5.5 Cyber sur ExploitGym 2. En conditions réelles, le modèle a permis de découvrir deux vulnérabilités inédites dans V8, le moteur JavaScript de Chrome, permettant de corrompre la mémoire et de s’échapper du sandbox du tas ; après divulgation coordonnée à Google, la faille a été corrigée et référencée CVE-2026-15903. Il a aussi identifié au moins cinq vulnérabilités dans un système d’exploitation mobile populaire, trois failles critiques dans une base de données populaire, et plus de 400 vulnérabilités d’élévation de privilèges dans un noyau de système d’exploitation populaire — corrections en cours avec les partenaires Daybreak.
OpenAI impose des clés de sécurité matérielles pour tous les comptes Daybreak individuels à partir du 1er septembre 2026, et un programme Daybreak Cyber Partner associe déjà des prestataires (Accenture, IBM, KPMG) et éditeurs de sécurité (Palo Alto Networks, CrowdStrike, Cisco) pour intégrer ces modèles à leurs services.
We’re expanding our cybersecurity initiative Daybreak and introducing GPT-5.6-Cyber, a new model for advanced, authorized cybersecurity work.
🇫🇷 Nous étendons notre initiative de cybersécurité Daybreak et lançons GPT-5.6-Cyber, un nouveau modèle pour les travaux avancés et autorisés de cybersécurité. — @OpenAI sur X
🔗 Expanding Daybreak as the cyber defense window narrows
Claude progresse sur la conjecture de Riemann, sans la résoudre
Anthropic a demandé à une version de recherche non publiée de Claude de s’attaquer à l’hypothèse de Riemann, l’un des sept problèmes du prix du millénaire du Clay Mathematics Institute (1 million de dollars chacun). Claude n’a pas résolu le problème, mais a fait progresser une question connexe : il a relevé la borne inférieure de la fraction de zéros de la fonction zêta de Riemann qui vérifient l’hypothèse, la faisant passer de 41,6 % à 67,2 %.
Le travail s’est déroulé en deux sessions totalisant 31 millions de tokens de sortie. La première a généré 650 idées initiales, toutes infructueuses. Pour la seconde tentative, Claude a coordonné 60 sous-agents spécialisés (développement mathématique, apport d’idées, validation, rédaction), exécuté 2 400 commandes shell et téléchargé 54 articles depuis arXiv pour vérifier ses pistes. Le résultat a ensuite été relu par deux mathématiciens d’Anthropic, puis examiné par les experts externes Brian Conrey et Dan Goldston. Claude a produit une preuve formellement vérifiée en Lean, qui a passé la validation standard.
Ce résultat sort du registre habituel des benchmarks : une amélioration mesurable sur un problème ouvert depuis des décennies, avec vérification indépendante et preuve formelle, illustre comment Anthropic teste désormais ses modèles de recherche sur des problèmes de mathématiques fondamentale plutôt que sur des tâches d’ingénierie logicielle classiques.
We asked an unreleased research version of Claude to take a stab at the Riemann hypothesis. It didn’t solve it, but it did make strides on a related problem: it increased the lower bound for the fraction of zeros of the Riemann zeta function that satisfy the hypothesis from 41.6% to 67.2%.
🇫🇷 Nous avons demandé à une version de recherche non publiée de Claude de tenter sa chance sur l’hypothèse de Riemann. Elle ne l’a pas résolue, mais a progressé sur un problème connexe : elle a fait passer la borne inférieure de la fraction de zéros de la fonction zêta de Riemann qui vérifient l’hypothèse de 41,6 % à 67,2 %. — @AnthropicAI sur X
🔗 Détail méthodologique complet sur le blog de recherche Anthropic
Anthropic : tarification et sécurité
Le tarif de lancement de Sonnet 5 devient permanent
Anthropic confirme que le tarif de lancement de Claude Sonnet 5 — $2 par million de tokens en entrée, $10 par million de tokens en sortie — devient permanent. Le modèle avait été lancé en juin avec ce tarif présenté comme promotionnel, valable jusqu’au 31 août 2026. Anthropic lève ainsi l’incertitude qui pesait sur les équipes ayant construit leurs coûts prévisionnels autour de ce prix de lancement : aucune hausse n’est à prévoir pour la rentrée sur ce modèle, ce qui consolide sa position tarifaire face à la concurrence sur les usages à fort volume de tokens.
🔗 Annonce
L’injection de prompt « largement résolue » selon Anthropic
Boris Cherny, responsable produit Claude Code chez Anthropic, affirme que l’injection de prompt — la méthode d’attaque la plus courante contre les utilisateurs et agents IA, où un site ou document malveillant glisse une instruction cachée exécutée par le modèle — est désormais largement résolue en pratique avec les modèles Claude. Il précise que ce progrès vient principalement de l’entraînement des modèles, complété par plusieurs classificateurs de sécurité superposés : la combinaison modèle + détecteur (probe) + mode automatique ramènerait le taux de succès des attaques à 0 %, un dispositif qui devient le mode de permission par défaut de Claude Code le 14 août. Il s’agit d’une déclaration publique sur X, non d’une publication de recherche formelle avec méthodologie détaillée.
🔗 Tweet
Outils de développement : Amp bascule vers OpenAI, Copilot Chat s’améliore
Amp change son système de modes vers OpenAI si un abonnement ChatGPT est lié
L’outil de code agentique Amp modifie la logique de routage de ses modes (« the Dial ») lorsqu’un compte est lié à un abonnement ChatGPT. Avec un abonnement lié, les modes low, medium et high basculent sur des modèles OpenAI (GPT-5.6 Terra pour le mode low et la relecture de code, GPT-5.6 Sol pour l’agent et l’oracle en mode high) au lieu de GLM-5.2 ou Claude Fable. Sans abonnement lié, rien ne change. Amp justifie l’abandon de Claude Fable comme modèle oracle par une convergence des performances des modèles frontières : son cofondateur @sqs juge peu probable qu’un futur test justifie la différence de prix de 80x entre Fable et les modèles OpenAI utilisés. Le mode Ultra n’est pas concerné et continue de tourner sur Claude Fable.
Copilot Chat sur github.com : contrôles de conversation améliorés
GitHub met à jour Copilot Chat sur github.com avec trois améliorations, en disponibilité générale pour tous les plans. L’accès aux conversations récentes est facilité, la fenêtre de discussion peut désormais être réduite (minimize) pendant qu’une réponse se génère puis rouverte pour reprendre l’échange, et un indicateur de consommation de tokens apparaît directement dans le chat — avec le détail par session et par message. Ces ajustements restent des améliorations d’ergonomie plutôt qu’une fonctionnalité majeure, mais répondent à un usage quotidien concret pour les comptes soumis à des quotas Copilot limités.
🔗 Copilot on web expands conversation controls
Écosystème open source et inférence
NVIDIA publie Magpie TTS Multilingual, TTS ouvert pour agents vocaux en 12 langues
NVIDIA publie Magpie TTS Multilingual, un modèle de synthèse vocale à poids ouverts d’environ 357 millions de paramètres, sous licence NVIDIA Open Model License, couvrant douze langues (dont le français) avec voix masculine et féminine chacune. La latence jusqu’au premier son atteint 32 ms en flux unique sur GPU B200 (239 ms avec 64 flux concurrents), 47 ms sur H100 et 79 ms sur A100, avec un facteur temps réel jusqu’à 320x. Le taux d’erreur de caractères baisse aussi : de 2,70 % à 1,54 % pour le français, de 1,14 % à 0,60 % pour l’espagnol. Déploiement possible via les poids ouverts sur Hugging Face ou via NVIDIA NIM en production.
🔗 Build Low-Latency Multilingual Voice Agents
Une technique de distillation réduit jusqu’à 15x la mémoire GPU nécessaire
Multiverse Computing publie une technique de distillation de connaissances combinant mise en cache hors-ligne des logits de l’enseignant et une fonction de perte KL fusionnée qui évite de matérialiser la matrice complète vocabulaire × longueur de séquence. Résultat : la mémoire GPU passe de 85,2 Go à 5,45 Go à 32K tokens de contexte (jusqu’à 15,6x de réduction), et la distillation d’un modèle GPT-OSS 20B est passée de quatre nœuds GPU à un seul, avec un temps d’itération réduit d’environ 5x. Appliquée à GPT-OSS 120B et Kimi-K3 (2,8T paramètres), la technique conserve environ 90 % de la précision de l’enseignant sur BoolQ et HellaSwag. Le code est publié en open source sur GitHub.
🔗 Making Knowledge Distillation Cheap Enough to Run at Scale
DeepSeek-V4-Flash disponible sur le cloud d’Ollama via Together AI
Together AI fournit désormais l’infrastructure d’inférence derrière DeepSeek-V4-Flash sur le cloud d’Ollama, présenté comme l’hébergement offrant les meilleures performances disponibles pour ce modèle à poids ouverts. L’offre met en avant une politique de zéro rétention de données ainsi qu’un hébergement aux États-Unis et dans l’Union européenne — un argument de souveraineté pour les entreprises qui veulent utiliser DeepSeek-V4-Flash sans dépendre d’une infrastructure chinoise. C’est un nouveau canal de distribution qui s’ajoute à la disponibilité déjà existante de DeepSeek-V4-Flash directement sur Together AI.
🔗 Tweet
Sakana AI entraîne son orchestrateur Fugu sur une base Gemma 4
Sakana AI publie une nouvelle version du modèle chef d’orchestre de son produit d’orchestration multi-agents Fugu, entraînée cette fois sur la base du modèle ouvert Gemma 4, en complément du pool de modèles interchangeable déjà proposé. L’architecture à deux couches — un petit modèle chef d’orchestre qui répartit les tâches, et un pool de modèles qui exécute le traitement réel — s’appuie sur les recherches Trinity et Conductor présentées à ICLR 2026. Les évaluations internes montrent une performance d’orchestration équivalente à la version précédente, avec une réduction de coût. Sakana AI vise aussi, à terme, des modèles chefs d’orchestre maison pour répondre aux exigences de souveraineté numérique au Japon.
Together AI détaille son partenariat avec Cursor pour l’inférence temps réel
Together AI publie un article co-écrit avec Cursor détaillant leur partenariat d’infrastructure d’inférence : les agents intégrés à l’éditeur génèrent du code pendant que les développeurs éditent activement leur fichier, ce qui impose des contraintes de latence strictes — la réponse du modèle doit s’insérer dans la boucle de rétroaction de l’éditeur sans casser le flux de travail. L’article illustre comment Together AI a construit son infrastructure pour tenir ces objectifs à grande échelle, un cas d’usage concret de ses offres d’inférence dédiée pour les outils de développement assistés par IA.
🔗 Tweet
Média génératif : ElevenLabs chez Deutsche Telekom, MiniMax détaille H3
ElevenLabs déploie sa technologie vocale IA chez Deutsche Telekom
ElevenLabs annonce un partenariat avec Deutsche Telekom, premier opérateur télécom d’Europe, pour intégrer sa technologie vocale IA à trois niveaux : le centre de contact, l’application grand public, et le réseau lui-même. L’assistant d’appel IA tourne sur ElevenLabs et est intégré directement au réseau, ce qui le rend disponible sur n’importe quel appareil mobile capable de passer un appel, sans application dédiée — avec assistance en direct pendant les appels, traduction en temps réel, et transcription/résumé des appels. Le partenariat a débuté comme un ensemble de fonctionnalités d’application début 2025 et s’est transformé en une intégration au cœur des services de Deutsche Telekom, avec une extension prévue.
🔗 Tweet
MiniMax détaille la feuille de route open source de H3
Après une session AMA sur Reddit, MiniMax publie un récapitulatif de la feuille de route open source de son modèle vidéo H3. Une transition vers la licence Apache-2.0 est « sur la table » une fois les questions de droit d’auteur clarifiées, avec un rapport technique complet à venir. MiniMax prévoit aussi d’ouvrir les poids de H3-Regenerate-2K, un modèle de régénération en espace latent permettant de repasser un résultat 768p en 2K, une implémentation d’attention creuse (sparse attention), une variante basse latence 4-NFE/8-NFE à l’étude, et un modèle unifié de génération/édition d’image dérivé de la lignée H3. Le workflow Ref2VA permet déjà d’enchaîner des clips pour produire des vidéos de 60 secondes.
🔗 Tweet
Agents multimodaux et finance IA-native
Qwen-MM-Plugins : rendre les agents multimodaux-natifs
AlibabaQwen annonce Qwen-MM-Plugins, une famille de plugins destinée à rendre n’importe quel environnement d’exécution d’agent (_agent harness) multimodal-natif : lecture d’images, de vidéos et de documents, édition vidéo, et travail sur des fichiers 3D/CAO. L’idée : au lieu d’un modèle multimodal isolé, une couche de plugins vient se greffer sur l’environnement déjà utilisé par le développeur. L’annonce ne détaille ni benchmarks, ni tarification, ni date de disponibilité précise — elle reste au stade du teaser produit, avec une démonstration vidéo à l’appui. Ce lancement prolonge la stratégie Qwen de 2026, qui étend désormais son offre vers l’outillage agentique multimodal plutôt que vers de nouveaux poids de modèles bruts.
🔗 Tweet
Cinq leçons pour bâtir une fonction finance IA-native
La CFO d’OpenAI, Sarah Friar, partage cinq leçons pour construire une fonction finance IA-native, autour de deux ambitions : une clôture à zéro jour (vue en temps réel, réconciliée et traçable des finances de l’entreprise) et une prévision continue. Parmi les leçons : donner l’accès à tous puis créer une raison de l’utiliser — illustré par un hackathon finance ayant fait naître IR-GPT, un GPT personnalisé pour répondre aux questions de due diligence des investisseurs ; combiner expérimentation ascendante et stratégie descendante ; dépasser les tableurs statiques au profit d’outils vivants appuyés sur le contexte complet de l’activité ; construire une responsabilité claire dans chaque workflow ; et mesurer le retour sur investissement de l’IA.
🔗 Building an AI-native finance function
Des sièges Premium arrivent pour ChatGPT Business
OpenAI lance des sièges Premium pour ChatGPT Business, offrant aux collaborateurs les plus actifs 5 fois plus d’usage que les sièges Standard et sans la limite d’usage sur cinq heures.
| Type de siège | Tarif mensuel | Tarif annuel (mensualisé) |
|---|---|---|
| Standard | $25/utilisateur | $20/utilisateur |
| Premium | $125/utilisateur | $100/utilisateur |
Les entreprises peuvent mixer sièges Standard et Premium au sein d’un même espace de travail. Offre de lancement : les propriétaires d’espace de travail qui s’inscrivent avant le 20 août 2026 reçoivent $100 de crédits par siège Premium ajouté (jusqu’à $500 pour cinq sièges), avec un accès anticipé possible avant la disponibilité générale.
🔗 Premium seats for ChatGPT Business
Brèves
- Claude Code — gains de performance CPU et mémoire : l’équipe indique d’importantes améliorations à l’usage CPU et à la mémoire au 99ᵉ centile (P99 RSS) ces derniers mois, sans chiffres précis communiqués. 🔗 Tweet
- Le CEO de Replit décrit la « self-driving company » dans Platformer : Amjad Masad détaille sa vision d’une entreprise pilotée par un bot interne et des agents qui utilisent les applications à la place des humains. 🔗 Tweet
- Sakana AI étend son RSI Lab à l’IA physique : l’entreprise veut construire des modèles du monde pour l’IA physique et recrute à temps plein et en stage à Tokyo. 🔗 Tweet
- FC Bayern Munich s’associe à Google Pixel et Gemini : partenariat annoncé sans détail sur sa nature exacte (sponsoring, intégration produit). 🔗 Tweet
- Gemini, conseils pour visiter les foires agricoles américaines : article lifestyle du blog Google recensant cinq usages existants de Gemini (itinéraires, Ask Maps, AI Mode, Gemini Live, retouche photo), sans nouvelle fonctionnalité. 🔗 Google Blog
- Facturation GitHub en Inde : les clients peuvent désormais activer le paiement automatique récurrent par carte enregistrée, via un mandat électronique conforme à la Reserve Bank of India. 🔗 Changelog
- GitHub déprécie les abonnements personnalisés par fil de discussion : seuls les états Subscribed/Not subscribed resteront disponibles, les abonnements personnalisés existants basculant automatiquement en Subscribed. 🔗 Changelog
- NVIDIA optimise vLLM pour Qwen 3.5 sur GB200 : les optimisations atteignent 25 000 tokens par seconde et par GPU, en préparation du lancement de Qwen 3.8. 🔗 Tweet
- Codex Build Week — projets et gagnants à venir : OpenAI indique que les participants ont transformé leurs idées en projets réels avec Codex ; l’annonce des gagnants est à venir. 🔗 Tweet
- Lettre d’OpenAI au gouverneur du Texas : l’entreprise détaille son engagement pour un développement responsable des infrastructures IA dans l’État. 🔗 OpenAI
- Model ML accélère le travail finance avec GPT-5.6 Sol : le cabinet automatise la production de decks PowerPoint et classeurs Excel traçables, avec 36 % de tokens en moins qu’Opus 5 sur un workflow Excel. 🔗 OpenAI
Ce que ça signifie
La course aux poids ouverts s’accélère et se diversifie : Meta (Muse Glimmer), Alibaba (Qwen-MM-Plugins), MiniMax (feuille de route H3) et Sakana AI (Fugu sur Gemma 4) publient tous, la même semaine, des briques réutilisables plutôt que de simples modèles fermés. La tendance dépasse le seul texte : NVIDIA ouvre un TTS multilingue à 357M de paramètres, et Sakana AI justifie explicitement son choix par la souveraineté numérique — un argument qui revient aussi chez Together AI pour l’hébergement de DeepSeek-V4-Flash en UE et aux États-Unis.
La sécurité IA passe du laboratoire à la production concrète. GPT-5.6-Cyber d’OpenAI ne se contente pas d’un score de benchmark : il a fait corriger une CVE réelle dans V8 et des centaines de failles ailleurs, tout en s’accompagnant d’un régime d’accès renforcé (clés matérielles obligatoires dès septembre). En miroir, Anthropic affirme avoir neutralisé l’injection de prompt côté défense grâce à l’empilement modèle + classificateurs — deux approches complémentaires (attaque outillée d’un côté, défense durcie de l’autre) qui montrent que la sécurité devient un axe de différenciation produit à part entière, pas un sujet secondaire.
Côté infrastructure, l’économie de l’inférence continue de se tendre : la technique de distillation de Multiverse Computing divise la mémoire GPU nécessaire par 15, Together AI muscle son partenariat avec Cursor pour tenir des contraintes de latence strictes en édition de code, et Anthropic stabilise durablement le prix de Sonnet 5. Ces mouvements, pris ensemble, indiquent une pression continue sur les coûts d’inférence à mesure que les usages agentiques et interactifs se généralisent.
Enfin, l’IA s’installe dans les fonctions support des entreprises autant que dans la recherche fondamentale. OpenAI documente comment sa propre finance devient IA-native et lance des sièges ChatGPT Business à capacité renforcée, pendant que Model ML rapporte des gains de tokens concrets sur des workflows Excel. À l’autre extrémité du spectre, le résultat de Claude sur la conjecture de Riemann — vérifié formellement et relu par des mathématiciens externes — rappelle que ces mêmes modèles sont aussi engagés sur des problèmes de recherche fondamentale, loin des cas d’usage produit.
Sources
- Meta lance Muse Glimmer
- NVIDIA — endpoint GPU-accéléré Muse Glimmer
- OpenAI — Expanding Daybreak as the cyber defense window narrows
- OpenAI — annonce Daybreak/GPT-5.6-Cyber sur X
- Anthropic — annonce Riemann sur X
- Anthropic — billet de recherche Riemann
- Anthropic — tarif Sonnet 5 permanent
- Anthropic — injection de prompt largement résolue
- Amp — We changed the Dial
- GitHub — Copilot on web expands conversation controls
- NVIDIA — Magpie TTS Multilingual
- Multiverse Computing — distillation de connaissances
- Together AI — DeepSeek-V4-Flash sur Ollama
- Sakana AI — Fugu × Gemma 4
- Together AI — partenariat Cursor
- ElevenLabs — partenariat Deutsche Telekom
- MiniMax — feuille de route H3
- Alibaba_Qwen — Qwen-MM-Plugins
- OpenAI — Building an AI-native finance function
- OpenAI — Premium seats for ChatGPT Business
- Claude Code — gains de performance CPU/mémoire
- Replit — self-driving company
- Sakana AI — RSI Lab IA physique
- FC Bayern Munich × Google Pixel × Gemini
- Google Blog — Gemini et les foires agricoles
- GitHub — facturation en Inde
- GitHub — dépréciation abonnements par fil
- vLLM/NVIDIA — optimisations Qwen 3.5
- OpenAIDevs — Codex Build Week
- OpenAI — lettre au gouverneur du Texas
- OpenAI — Model ML