Rechercher

Claude Platform en disponibilité générale, GitHub Copilot débarque dans Slack, DeepSeek lance un modèle multimodal

Grosse journée pour les briques d’infrastructure agentique : Anthropic sort computer use, le browser tool, la Skills API et la Files API de bêta sur la Claude Platform, pendant que GitHub Copilot s’installe dans Slack et Microsoft Teams. Côté modèles, DeepSeek publie son premier modèle multimodal et Pika Labs lance un synthétiseur vocal revendiquant un rapport qualité/prix inédit. Entre les deux, un jeu de données égocentrique massif, une étude sur les biais de benchmark en reconnaissance vocale, et une dizaine de mises à jour notables chez Google DeepMind, GitHub, Z.ai, Qwen, Harvey et les outils de génération vidéo/audio.


Claude Platform : computer use, browser tool, Skills API et Files API en disponibilité générale

20 août — Anthropic annonce le passage en disponibilité générale de quatre briques pour construire des agents sur la Claude Platform : computer use, le browser tool, la Skills API et la Files API. L’objectif affiché est de réduire le nombre d’allers-retours nécessaires pour automatiser une tâche dans une application qui n’a pas d’API, et de permettre de construire des Claude Managed Agents sur des skills versionnées et des fichiers réutilisables.

Le nouveau computer_toolset_20260801 permet à Claude d’enchaîner plusieurs actions par tour (clic, saisie, touche clavier, capture d’écran) au lieu d’un aller-retour par action isolée. Anthropic indique que les clients en accès anticipé ont constaté 20 à 40 % d’allers-retours en moins par tâche. Le browser tool évolue en parallèle avec browser_toolset_20260801 : au lieu de cibler des pixels — fragile au moindre changement de mise en page — Claude reçoit désormais la structure de la page et peut agir sur des références d’éléments.

Côté API, la Skills API permet de téléverser la procédure d’une équipe une seule fois, de la versionner et de l’épingler à un version_id précis ou à latest. La Files API gagne un paramètre expires_in_seconds, une limite de débit 5 fois plus élevée (500 requêtes par minute) et un quota de 1 To par organisation. Anthropic a aussi publié un adaptateur AG-UI pour les Managed Agents, qui mappe chaque fil de discussion à une session managée et diffuse texte, appels d’outils et raisonnement vers l’interface.

BriqueNouveauté du jour
Computer usecomputer_toolset_20260801, jusqu’à -40% d’allers-retours par tâche
Browser toolbrowser_toolset_20260801, ciblage par référence d’élément de page
Skills APIVersionnage, épinglage à version_id ou latest
Files API500 requêtes/minute (x5), quota de 1 To par organisation

🔗 Annonce Claude Platform


GitHub Copilot arrive dans Slack et Microsoft Teams

21 août — GitHub Copilot débarque en préversion publique sur Slack et Microsoft Teams. Le principe est identique dans les deux cas : mentionner @GitHub dans un message direct, un canal ou un fil ouvre une session d’agent cloud capable de répondre à des questions sur le code et l’activité GitHub, trier des rapports de bugs, enquêter sur des échecs, implémenter des changements dans un bac à sable cloud sécurisé, puis ouvrir des pull requests avec un lien vers la conversation d’origine.

Sur Slack, l’intégration s’appuie sur Slack Code, la nouvelle offre agentic de Slack lancée le même week-end : GitHub Copilot peut ouvrir des canaux de code dédiés où l’équipe consulte les diffs et inspecte des aperçus de rendu sans polluer la conversation d’origine. Sur Teams, une discussion se transforme en session d’agent collective que tout le monde peut suivre et orienter ; le travail continue de façon asynchrone dans le bac à sable cloud pendant que l’équipe fait autre chose.

Disponibilité réservée aux organisations sur plan Copilot Business ou Enterprise. L’administrateur active la politique d’agent cloud Copilot et installe l’app pour Slack ou Teams ; les administrateurs de dépôt peuvent exiger une approbation avant fusion des pull requests générées par l’agent. L’usage consomme des crédits IA, et le bac à sable cloud est facturé séparément avec des budgets configurables.

🔗 GitHub Copilot dans Slack · 🔗 GitHub Copilot dans Teams


DeepSeek-V4-Flash-Vision-Exp : premier modèle multimodal de DeepSeek sur l’API

21 août — DeepSeek met en ligne DeepSeek-V4-Flash-Vision-Exp, un modèle multimodal expérimental disponible sous l’identifiant deepseek-v4-flash-vision-exp. Sur les capacités purement textuelles — agents, raisonnement, connaissance du monde — le modèle égale DeepSeek-V4-Flash. La nouveauté est ailleurs : sur les benchmarks d’agents multimodaux, DeepSeek annonce un bond net par rapport à V4-Flash, avec des performances qui se rapprochent d’Opus-4.8.

Le support multimodal côté API est complet : entrée mixte texte + image (base64, URL externe, ou via une nouvelle Files API gratuite lancée le même jour), compatible avec les trois formats existants (Chat Completions, Messages, Responses). Le tarif suit la grille V4-Flash, avec une tokenisation des images plafonnée à 384 tokens par image. La Files API permet d’uploader une image une seule fois et de la référencer par file_id, un gain de bande passante pour les usages agentiques répétitifs. DeepSeek Harness 0.1.1, le harnais d’agent open source lancé le 13 août, a été mis à jour le jour même pour supporter le nouveau modèle nativement.

ÉlémentDétail
Modèledeepseek-v4-flash-vision-exp
Capacités texteParité avec DeepSeek-V4-Flash
Capacités multimodalesProches d’Opus-4.8 sur les benchmarks d’agents multimodaux
Tarif imageJusqu’à 384 tokens/image, prix V4-Flash
APIs supportéesChat Completions, Messages, Responses
HarnaisDeepSeek Harness 0.1.1 (support natif)

DeepSeek-V4-Flash-Vision-Exp is now live on the DeepSeek API Platform! This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities—including agents, reasoning, and world knowledge. On multimodal agent benchmarks, V4-Flash-Vision-Exp makes a major leap over V4-Flash, bringing multimodal agent performance close to Opus-4.8.

🇫🇷 DeepSeek-V4-Flash-Vision-Exp est maintenant disponible sur la plateforme API DeepSeek ! Ce modèle multimodal expérimental égale DeepSeek-V4-Flash sur les capacités textuelles — y compris les agents, le raisonnement et la connaissance du monde. Sur les benchmarks d’agents multimodaux, V4-Flash-Vision-Exp fait un bond majeur par rapport à V4-Flash, rapprochant les performances d’agents multimodaux de celles d’Opus-4.8.@deepseek_ai sur X


Pika Speech : synthèse vocale 3B à 1,2 seconde la minute, jusqu’à 9x moins cher qu’ElevenLabs v3

21 août — Pika Labs élargit sa gamme Pika Audio avec Pika Speech, un modèle de synthèse vocale de 3 milliards de paramètres. L’argument principal est la vitesse : un facteur temps réel (RTF) de 0,02, soit une minute de parole 48 kHz de qualité studio générée en environ 1,2 seconde dans des tests locaux en forme longue, avec des requêtes possibles jusqu’à cinq minutes de parole continue.

Sur le contrôle du rythme, Pika Speech innove : plutôt que d’étirer ou compresser l’audio après coup — la méthode standard chez la plupart des systèmes TTS — le modèle contrôle rythme et durée directement grâce à un « latent de fin de parole » (EOS latent), une ancre placée à l’image finale cible. Déplacer cette ancre plus tôt comprime le débit ; la déplacer plus tard laisse le texte respirer. Côté architecture, l’équipe combine flow matching et distillation par appariement de distribution, FlashAttention-3, et un « token packing » qui fait que cinq segments de phrase coûtent environ deux fois le prix d’un seul plutôt que cinq fois.

Sur les coûts, Pika revendique un avantage pouvant atteindre 9x face à ElevenLabs v3, 4,5x face à Cartesia et ElevenLabs Turbo, et 2x face à Fish Audio — sans détailler la méthodologie exacte au-delà de ces ratios. Le modèle est accessible via le Pika API Club.

Let’s talk about Pika Speech, a 3B text-to-speech model at RTF 0.02. […] Pika Speech generates one minute of studio-quality 48 kHz speech in about 1.2 seconds—and supports requests up to five minutes. That efficiency makes it up to 9× more cost-efficient than ElevenLabs v3, 4.5× than Cartesia and ElevenLabs Turbo, and 2× than Fish Audio.

🇫🇷 Parlons de Pika Speech, un modèle de synthèse vocale de 3 milliards de paramètres avec un facteur temps réel de 0,02. […] Pika Speech génère une minute de parole 48 kHz de qualité studio en environ 1,2 seconde — et prend en charge des requêtes allant jusqu’à cinq minutes. Cette efficacité le rend jusqu’à 9 fois plus rentable qu’ElevenLabs v3, 4,5 fois plus que Cartesia et ElevenLabs Turbo, et 2 fois plus que Fish Audio.@pika_labs sur X

🔗 Détail architecture


EgoSuite-Open100K : le plus grand jeu de données égocentrique humain ouvert

21 août — Lightwheel AI, en partenariat avec Hugging Face, open-source EgoSuite-Open100K, présenté comme le plus grand jeu de données égocentrique humain entièrement annoté jamais publié en accès libre. L’objectif visé est 100 000 heures de données humaines à la première personne ; les 10 000 premières heures sont déjà disponibles, le reste étant publié par étapes.

Le jeu de données couvre plus de 15 000 tâches réparties sur plus de 15 000 scènes réelles — cuisines, chambres, entrepôts, lignes d’assemblage — regroupées en 7 catégories d’environnements et 128 types de scènes. Chaque séquence est annotée avec pose de la main, pose du corps et sémantique au niveau des sous-tâches, une partie du corpus disposant en plus d’une couverture caméra au poignet. Point notable côté licence : contrairement à beaucoup de jeux de données de recherche, EgoSuite-Open100K est licencié pour l’entraînement commercial, pas seulement académique.

Le dataset est présenté par ses créateurs comme la première brique publique d’une infrastructure de données plus large pour la « Physical AI » (robotique et IA incarnée) — l’idée que la mise à l’échelle des modèles physiques dépend désormais d’un accès à des données humaines massives et partagées.

🔗 Annonce Lightwheel AI · 🔗 Relais Hugging Face


Claude Security passe sur Claude Mythos 5

21 août — Anthropic fait tourner Claude Security, son outil de scan de vulnérabilités, sur Claude Mythos 5, en bêta publique pour tous les clients Claude Enterprise. L’argument : profiter du modèle de sécurité le plus capable d’Anthropic sur son codebase sans accès séparé au modèle — les scans sont facturés en usage de tokens standard sur le plan existant.

Concrètement, l’outil se pointe sur un dépôt GitHub et Mythos 5 analyse le code en traçant la circulation des données entre fichiers et en raisonnant sur les interactions entre composants. Chaque résultat revient avec une catégorie CWE, un niveau de confiance, une évaluation de sévérité et un correctif suggéré, qui s’ouvre directement dans Claude Code sur le web. Anthropic en profite pour lancer un Defender Advantage Fund doté de 35 millions de dollars de crédits pour la sécurité open source, et prévoit d’étendre son Cyber Verification Program dans les semaines à venir.

🔗 Annonce Claude Security


Tarification GPT-5.6 Sol : OpenAI baisse ses prix API, GitHub Copilot suit

21 août — OpenAI réduit de plus de 20 % les prix API et crédits de GPT-5.6 Sol pendant les trois prochains mois. La mesure est déjà active côté API et se déploie dans Codex et ChatGPT Work au cours de la journée. Pour les utilisateurs Codex sur plans à la tâche (token-based), les crédits achetés vont désormais plus loin ; l’usage inclus dans les abonnements Pro, Plus et Business, lui, reste inchangé — la baisse profite donc surtout aux développeurs API et aux utilisateurs facturés au token.

GPT-5.6 Sol à -50% dans GitHub Copilot

En parallèle, GitHub relaie une promotion distincte : -50 % sur GPT-5.6 Sol dans GitHub Copilot jusqu’au 3 septembre, utilisable dans l’app, la CLI et l’IDE. C’est une remise ponctuelle côté Copilot, à ne pas confondre avec la baisse tarifaire permanente d’OpenAI décrite ci-dessus — deux entreprises différentes, deux mécanismes distincts sur le même modèle.

🔗 Baisse tarifaire OpenAI · 🔗 Promo GitHub Copilot


GLM-5.3 (Max) grimpe sur Code Arena: WebDev

20 août — LMArena indique que GLM-5.3 (Max) de Z.ai a fait bouger la frontière de Pareto (rapport qualité/coût) du classement Code Arena: WebDev, dédié à l’évaluation des modèles sur des tâches de développement web. Avec 1597 points, le modèle se positionnerait 2ᵉ parmi les modèles à poids ouverts (une fois publiés) et 8ᵉ toutes catégories confondues.

ModèlePrix ($/M tokens)Points Code Arena: WebDev
GLM-5.3 (Max)$3,651597
Qwen3.8 (Max)$5,00
Gemini-3.7-flash-high$2,86moins bon score
DeepSeek-v4-flash-high$1,10moins bon score

À $3,65 par million de tokens, GLM-5.3 (Max) reste dans une fourchette de prix comparable à Qwen3.8 (Max) tout en surpassant Gemini-3.7-flash-high et DeepSeek-v4-flash-high sur ce classement — un nouveau signal de la compétitivité de Z.ai sur le développement web agentique, en complément des résultats déjà connus sur Terminal-Bench et l’Agent Arena générale.

🔗 Annonce LMArena


Harvey lance Tenet, un modèle juridique bâti sur Kimi K3

20 août — Harvey présente Tenet, son premier modèle post-entraîné pour le droit, à partir d’une base Kimi K3 (Moonshot AI) post-entraînée avec Fireworks AI sur un corpus de données juridiques publiques, de données synthétiques et de données d’experts humains simulant du travail juridique de longue durée.

Harvey annonce que ce post-entraînement augmente le taux de réussite complet de Tenet de 82 % sur le benchmark LAB et de 22 % sur LAB Contracts, par rapport au Kimi K3 de base — avec un état de l’art sur LAB Contracts et la 2ᵉ place sur LAB dans son ensemble. Le coût d’exploitation de Tenet serait inférieur au quart de celui des modèles de fondation les plus performants du marché. En complément, Harvey a entraîné trois sous-agents spécialistes : diligence M&A, revue de tableaux, et connaissance du cabinet.

🔗 Annonce Harvey


Georgia Tech trace les origines du raisonnement social d’Olmo 3

21 août — Une équipe de Georgia Tech a exploité le fait que la pile Olmo 3 d’Ai2 est totalement ouverte — poids, corpus de pré-entraînement Dolma 3 (1,26 milliard de documents), infrastructure — pour relier statistiquement des capacités du modèle aux textes qui les ont produites, une expérience impossible sur un modèle fermé.

La méthode repose sur des fonctions d’influence, appliquées à environ 5,68 millions de documents échantillonnés dans Dolma 3. Résultat principal : les textes riches en dialogues et en écriture interpersonnelle pèsent plus sur la performance en raisonnement social que sur les connaissances factuelles — et en retirant les documents littéraires les plus influents, la performance sur le benchmark SocialIQA a chuté significativement, confirmant la causalité.

🔗 Article Ai2


Biais de « benchmark optimization » détecté dans des modèles ASR open source

21 août — Une équipe de Hume AI publie sur le blog Hugging Face une étude sur un biais méthodologique en reconnaissance vocale : certains modèles sembleraient optimisés pour reproduire les transcriptions de référence des benchmarks publics plutôt que pour transcrire fidèlement l’audio.

Sur 11 modèles ASR open source testés, environ 40 % des extraits VoxPopuli analysés contiendraient des erreurs dans leurs références, et 6 modèles sur 11 reproduisaient ces erreurs au lieu de transcrire correctement l’audio. Sur LibriSpeech, les taux de récupération de nombres masqués atteignaient 30 à 40 %, signe que certains modèles « comblent » le texte plutôt que de l’entendre. La conclusion recommande l’usage de jeux d’évaluation tenus secrets et une séparation plus stricte entre données d’entraînement et de test.

🔗 Étude Hugging Face


SenseNova-U1.5-8B-MoT : modèle image ouvert sans VAE ni DiT

21 août — SenseNova publie en poids ouverts un modèle de génération d’image dont les performances annoncées seraient comparables à Nano Banana 2. L’intérêt technique tient à l’architecture : pas de VAE, pas d’encodeur de texte séparé, pas de DiT — le modèle repose sur une « mixture of transformers », où les tokens de texte et d’image utilisent des poids distincts et s’attendent mutuellement, le débruitage se faisant directement dans l’espace des pixels plutôt que dans un espace latent compressé.

Cette approche tranche avec la pile standard des modèles de diffusion texte-image, et son ouverture en poids permettra à la communauté de vérifier indépendamment les comparaisons de performance annoncées.

🔗 Annonce SenseNova


Diffusers 0.40.0 : Modular Diffusers quitte le statut expérimental

21 août — Hugging Face publie Diffusers 0.40.0. Le changement le plus structurant est la sortie du statut expérimental pour Modular Diffusers, le système de pipelines modulaires de la bibliothèque. La version ajoute l’intégration de plusieurs modèles ouverts récents (LTX2.5, MiniMax H3, MiniMax Music 3, Wan Animate 2), un support du parallélisme tensoriel pour une sélection de modèles, et deux nouveaux backends de quantification (SDNQ, Nunchaku-Lite).

🔗 Annonce Diffusers 0.40.0


Google DeepMind explore l’IA dans les jeux avec Fenris Creations

21 août — Google DeepMind annonce un partenariat de recherche avec le studio Fenris Creations, dans la continuité de 15 ans de travaux utilisant les jeux vidéo comme terrain d’expérimentation pour l’IA, de la maîtrise d’Atari jusqu’au niveau Grandmaster sur StarCraft II. Après SIMA, qui a appris à des agents à comprendre des mondes 3D, DeepMind veut explorer la navigation dans des dynamiques humaines réelles au sein d’un univers persistant.

Le partenariat cible quatre défis ouverts : l’apprentissage continu (acquérir de nouvelles compétences sans oublier les précédentes), des systèmes de mémoire profonde allant bien au-delà des fenêtres de contexte actuelles, la planification à long horizon (semaines, mois, années), et les dynamiques multi-agents (coopération, négociation, économie, comportements émergents). L’objectif à long terme est double : créer de nouvelles expériences de jeu avec des développeurs, et réutiliser ces avancées pour des problèmes du monde réel et la découverte scientifique.

🔗 Annonce Google DeepMind


Runway Ruby : conversion vidéo SDR vers HDR 16 bits

21 août — Runway lance Ruby, un modèle qui convertit une vidéo SDR (standard dynamic range) en HDR 16 bits, en sortie séquences EXR ou ProRes/HEVC 10-12 bits, dans l’espace colorimétrique BT.2020 avec prise en charge PQ ou HLG — les standards utilisés en post-production professionnelle et broadcast HDR.

Ruby fonctionne aussi bien sur une vidéo uploadée par l’utilisateur que sur un output généré par Runway, avec une limite de 30 secondes. La fonctionnalité est disponible dès maintenant pour les plans Max et Enterprise.

🔗 Annonce Runway Ruby


NVIDIA AVO revendique 100 % sur le benchmark ARC-AGI-3

21 août — NVIDIA présente AVO, un agent de code généraliste, avec un score de 100 % sur ARC-AGI-3, un benchmark de raisonnement interactif. Selon NVIDIA, AVO a complété les 183 niveaux répartis sur les 25 environnements publics du benchmark, sans instructions explicites, règles énoncées ni objectifs formulés au préalable.

AVO fonctionne via une boucle continue d’inspection, de planification, d’implémentation et d’évaluation, en s’appuyant sur de la mémoire, des outils et un retour d’exécution pour construire sur ce qu’il apprend au fil du temps — une approche censée maintenir la progression sur des tâches longues plutôt que de repartir de zéro à chaque nouvelle fenêtre de contexte.

🔗 Résultat ARC-AGI-3


HeyGen Look Packs : changer tenue et décor en gardant le visage

21 août — HeyGen lance Look Packs, une fonctionnalité qui change la tenue et le décor d’une vidéo d’avatar tout en conservant fidèlement le visage de la personne — l’argument étant que la plupart des modèles génératifs modifient aussi les traits du visage lorsqu’ils changent l’apparence.

L’usage visé est la cohérence de marque personnelle à travers différents contextes professionnels : immobilier, juridique, fitness, éducation, bien-être. Un créateur de contenu B2B peut ainsi produire des vidéos dans des tenues et décors adaptés à chaque secteur tout en restant reconnaissable d’une vidéo à l’autre. Cette annonce s’inscrit dans la cadence soutenue de HeyGen ces derniers jours (Retouch le 20 août, Brand Kits et upscale 4K le 18-19 août).

🔗 Annonce Look Packs


Amp lance Explain Usage pour expliquer sa consommation de tokens

21 août — Amp ajoute Explain Usage, une fonctionnalité qui permet de demander directement à Puck, l’assistant intégré, d’analyser sa propre consommation de tokens, de crédits et de taille d’orb. L’utilisateur pose une question en langage naturel — « Quels threads ont consommé le plus de tokens aujourd’hui ? » — et Puck lit les données d’usage personnelles et les métriques par thread pour répondre.

Deux points d’entrée existent : poser la question directement à Puck, ou cliquer sur le bouton dédié sur les pages d’usage. Pour les utilisateurs qui préfèrent les données brutes, Amp expose aussi ces informations via CLI (amp usage --details, amp threads usage <thread-id> --details).

🔗 Explain Usage


v0 (Vercel) ajoute Vercel Connect pour se connecter à 100+ services

21 août — Les apps et agents construits dans v0 peuvent désormais se connecter directement à Slack, GitHub, Salesforce et plus de 100 autres services tiers via Vercel Connect, sans que le développeur ait à gérer lui-même le flux d’authentification.

Le mécanisme repose sur des connecteurs d’équipe réutilisables associés à des tokens de courte durée de vie : une fois un connecteur configuré côté équipe, chaque nouvelle app ou agent généré peut le réutiliser plutôt que de redemander une authentification complète à chaque fois. Cela positionne v0 comme une plateforme capable de produire des agents intégrés à la pile logicielle d’une entreprise, pas seulement des interfaces isolées.

🔗 Vercel Connect


Threads partagés dans Codex et ChatGPT Work

20 août — Codex et ChatGPT Work introduisent les « threads partagés » : un lien en lecture seule qui expose le raisonnement complet d’une session — démarche, décisions, contexte — plutôt qu’un simple résultat final. L’objectif est d’éviter de reconstituer le contexte d’une pull request à partir de captures d’écran éparses lors d’une revue de code, d’une exploration technique approfondie ou d’une passation de projet entre coéquipiers.

C’est une fonctionnalité qui s’inscrit dans la continuité des annonces récentes autour de ChatGPT Sites (édition à plusieurs, personnalisation d’URL) et renforce le positionnement de Codex/ChatGPT Work comme outil de travail d’équipe.

🔗 Threads partagés


Arrière-plans transparents en préversion pour GPT-Image-2

20 août — L’API GPT-Image-2 permet désormais, en préversion, de générer des images à fond transparent. L’intérêt pratique est de produire des assets réutilisables — visuels produits, éléments de design graphique, maquettes de sites web, campagnes marketing — que l’on peut ensuite replacer sur n’importe quel fond sans retouche manuelle de détourage.

🔗 Arrière-plans transparents


Brèves

  • Zed — Antigravity s’installe en un clic depuis l’ACP Registry de Zed. 🔗 Tweet
  • trackio 0.36 — Hugging Face publie une mise à jour ajoutant le support d’un nouveau type de donnée loggable, sans autre précision. 🔗 Tweet
  • L’IA « full-stack » selon Google DeepMind — Paige Bailey décompose l’approche de bout en bout de Google en cinq couches : infrastructure, sécurité, recherche, modèles/outils, produits. 🔗 Article Google
  • GitHub — meilleure gestion des utilisateurs bloqués : recherche par nom, tri et pagination des longues listes. 🔗 Changelog
  • GitHub — l’épinglage des vues, projets et jalons dans la barre latérale du dépôt passe en disponibilité générale, avec plusieurs améliorations connexes (avatars de réactions, densité du dashboard). 🔗 Changelog
  • Manus prolonge l’accès gratuit à Manus 1.6 Lite et Manus 1.6 jusqu’au 28 août (SGT), dans la limite du quota quotidien. 🔗 Tweet
  • Manus rappelle aux utilisateurs notifiés de sauvegarder leurs données avant le 23 août 7h59 (SGT), avant son passage en entreprise indépendante. 🔗 Tweet
  • Genspark lance une promotion jusqu’au 30 septembre : Design + GenTeam à -90%, GenMail gratuit, Slides Ultra Mode à -50%. 🔗 Tweet
  • NVIDIA détaille la répartition entre le harnais d’un agent (ce qu’il essaie de faire) et l’infrastructure (ce qu’il peut réellement faire) dans un deep dive sécurité de la pile agentique. 🔗 Tweet
  • NVIDIA publie le bilan du Spark Hack Series de Seattle sur DGX Spark : projets gagnants en réponse aux catastrophes, santé et survie hors-ligne avec Nemotron et NemoClaw. 🔗 Tweet
  • NVIDIA Cosmos 3 — une vidéo Cosmos Labs montre le post-training de Cosmos 3 chez les partenaires Aigen et Linker Vision. 🔗 Tweet
  • Luma Labs interviendra sur les agents créatifs lors de Summer Signal, organisé avec GMI Cloud le 14 septembre. 🔗 Tweet
  • Synthesia — son CEO est cité dans un article Forbes Tech sur la mesure de l’adoption de l’IA par les résultats plutôt que par l’usage. 🔗 Tweet
  • Qwen3.8-27B poursuit sa lancée communautaire : nouvelles recettes d’inférence NVFP4 + DFlash2 dans le cookbook SGLang, versions allégées publiées par Unsloth, 1ʳᵉ place sur le classement de l’agent de code Cline en quatre jours, et un DGX Station NVIDIA rapportant plus de 2713 tokens/seconde en pic agrégé en service BF16. 🔗 SGLang · 🔗 Unsloth · 🔗 Cline · 🔗 DGX Station
  • Qwen3.8-Max est désormais utilisable dans l’outil de code Kilo Code pour la génération d’interfaces. 🔗 Tweet
  • Kimi Work publie un deuxième tutoriel pour les analystes financiers : tableau de bord investisseur, mise à jour de modèles financiers, génération de rapports par lots. 🔗 Tweet
  • GLM-5.3 continue sa progression : score de 69 sur le classement officiel DeepSWE, disponibilité sur la plateforme WorkBuddy, et prolongation de Build Week par Z.ai jusqu’au 23 août 18h (PT) avec 100 millions de tokens gratuits pour les 50 000 premiers nouveaux inscrits ZCode. 🔗 DeepSWE · 🔗 WorkBuddy · 🔗 Build Week
  • GPT-5.6 Sol — trois plateformes tierces (Router, Cloudflare AI Gateway, OpenCode Zen) proposent chacune -50% jusqu’à mi-septembre, en plus des remises déjà couvertes chez Devin, OpenRouter et v0. 🔗 Cloudflare AI Gateway

Ce que ça signifie

L’annonce Anthropic-GitHub du jour dessine une tendance de fond : l’infrastructure agentique quitte le stade expérimental. La GA de computer use et du browser tool sur la Claude Platform, combinée à l’arrivée de Copilot dans Slack et Teams, signale que les grands fournisseurs ne se contentent plus de vendre des modèles — ils vendent des agents capables d’agir dans les outils que les équipes utilisent déjà au quotidien, sans passer par une intégration API dédiée à chaque fois. C’est un changement de distribution autant que de capacité : l’agent va désormais là où le travail se fait, plutôt que d’exiger que le travail vienne à lui.

Sur le terrain des modèles, DeepSeek-V4-Flash-Vision-Exp confirme que le multimodal devient un standard attendu plutôt qu’un différenciateur — même les acteurs positionnés sur l’efficacité économique (V4-Flash) l’intègrent désormais nativement, avec des performances qui se rapprochent des meilleurs modèles fermés. La compétition sur les benchmarks agentiques de code (GLM-5.3 sur Code Arena: WebDev, Qwen3.8-27B sur Cline) illustre la même dynamique côté outils de développement : les écarts de prix entre modèles ouverts et fermés se resserrent, ce qui pousse OpenAI à baisser ses tarifs API de plus de 20% sur GPT-5.6 Sol dans la foulée.

Le mouvement vers l’ouverture totale — pas seulement des poids, mais des données et de l’infrastructure d’entraînement — continue de porter ses fruits scientifiques : l’étude Georgia Tech sur Olmo 3 n’aurait tout simplement pas été possible sur un modèle fermé, tout comme l’étude Hume AI sur les biais de benchmark ASR rappelle qu’un score de leaderboard ne garantit pas une qualité réelle de transcription. Ce sont deux rappels utiles au moment où l’industrie multiplie les annonces de scores record.

Enfin, la multiplication des jeux de données massifs à licence commerciale — EgoSuite-Open100K aujourd’hui, après plusieurs annonces similaires ces dernières semaines — confirme que l’accès à des données humaines réelles, pas seulement synthétiques, devient un enjeu stratégique pour la robotique et l’IA incarnée, au même titre que le calcul l’a été pour les grands modèles de langage.


Sources