Rechercher

OpenAI ralentit ses modèles face au risque cyber Astra, Warp lance Warp Factories, Claude Code lance le skill Design

Article généré par intelligence artificielle
OpenAI ralentit ses modèles face au risque cyber Astra, Warp lance Warp Factories, Claude Code lance le skill Design

Le 18 août 2026, OpenAI publie un rapport détaillant pourquoi elle a ralenti l’entraînement de ses derniers modèles face aux capacités cyber critiques d’un modèle nommé Astra, tandis que Warp ouvre une infrastructure agentique pour les entreprises et que Claude Code lance un skill de conception d’interface. Autour de ces trois annonces majeures, dix-huit autres nouveautés couvrent Anthropic, les outils de code, la recherche IA ouverte et les plateformes de génération média.


OpenAI ralentit le déploiement de ses modèles face aux capacités cyber critiques d’Astra

18 août — OpenAI explique pourquoi l’entreprise a ralenti le déploiement de ses modèles récents. Deux événements ont motivé cette décision : l’incident de sécurité OpenAI-Hugging Face survenu lors de l’évaluation d’un modèle, et des preuves préliminaires que l’un des prochains modèles, nommé Astra, pourrait franchir le seuil de « capacité cyber critique » défini par son Preparedness Framework.

OpenAI a observé une pause de deux semaines dans l’entraînement par renforcement (RL) sur ses derniers modèles destinés au déploiement, le temps de durcir et de red-teamer ses environnements de recherche. Le plus grand run de RL frontière prévu reste suspendu, en attendant que des entraînements à plus petite échelle valident les nouvelles protections.

ProtectionDétail
MonitoringClassificateurs par token, alerte visée sous 30 minutes
AlignementRéduction des actions nuisibles ou non autorisées
SécuritéIsolement réseau renforcé, sandboxes pour code non fiable
Coût induitEnviron 20 % de calcul d’inférence surveillé en plus

Ce monitoring est obligatoire pour tout entraînement RL et toute évaluation avec outils dès le niveau « Sol » ; depuis le 7 août, une exigence supplémentaire s’applique à toute inférence d’Astra avec outils. OpenAI prévoit un rapport technique sur l’incident Hugging Face et une évolution de son Preparedness Framework avec des organisations externes.

As models become more capable, the risks associated with developing and testing them internally also grow. We temporarily paused reinforcement learning (RL) training on our latest models intended for deployment for two weeks while we hardened and red-teamed our research environments and expanded monitoring coverage. Our largest planned frontier RL run remains on hold while smaller-scale training and evaluations validate these safeguards and establish more evidence of alignment.

🇫🇷 À mesure que les modèles deviennent plus capables, les risques liés à leur développement et à leur test en interne augmentent aussi. Nous avons temporairement mis en pause l’entraînement par renforcement (RL) sur nos derniers modèles destinés au déploiement pendant deux semaines, le temps de durcir et de red-teamer nos environnements de recherche et d’étendre la couverture de notre monitoring. Notre plus grand run de RL frontière prévu reste suspendu pendant que des entraînements et évaluations à plus petite échelle valident ces protections et établissent davantage de preuves d’alignement.@OpenAI sur X

🔗 OpenAI — Pacing model development


Warp lance Warp Factories, infrastructure pour les cloud software factories

18 août — Warp annonce Warp Factories, une infrastructure ouverte destinée aux entreprises qui construisent leurs propres boucles d’automatisation autour du cycle de vie logiciel : des agents cloud triagent, spécifient, implémentent, revoient et vérifient le travail, avec les humains gardés dans la boucle aux points de décision clés. L’annonce identifie deux problèmes remontés par les responsables d’ingénierie : la difficulté à mesurer le retour sur investissement des agents de codage dans la durée, et la gouvernance, chaque développeur configurant son propre agent créant des angles morts de sécurité.

Sur le plan technique, les factories se configurent comme du code — l’analogie revendiquée est « Terraform pour la configuration d’agents » — et acceptent n’importe quel modèle ou harnais, y compris Claude Code ou Codex directement comme harnais. Les agents disposent d’un accès computer use sur Linux et Mac pour reproduire des bugs et prouver la correction d’un changement, avec partage d’enregistrements sur les pull requests. Un tableau de bord, une API et un SDK mesurent coût et vélocité, avec des agents d’auto-amélioration configurables.

Warp affirme automatiser aujourd’hui environ 30 % de ses propres tâches via ses factories internes et anticipe une croissance rapide de ce taux. L’entreprise ouvre l’accès à un nombre limité d’entreprises dès aujourd’hui, avec une offre de 10 000 dollars de crédits d’usage factory pour certains clients sélectionnés.

Introducing Warp Factories: open, flexible infrastructure for building cloud software factories. - Configure your factory as code - Use any model and any harness - Measure quality with evals and benchmarks on your own data - Built-in self-improvement and memory

🇫🇷 Présentation de Warp Factories : infrastructure ouverte et flexible pour construire des cloud software factories. Configurez votre factory comme du code. Utilisez n’importe quel modèle et n’importe quel harnais. Mesurez la qualité avec des évaluations et des benchmarks sur vos propres données. Auto-amélioration et mémoire intégrées.@warpdotdev sur X

🔗 Annonce Warp Factories


Claude Code lance le skill /design en recherche préliminaire

17 août — Anthropic lance un nouveau skill /design pour Claude Code, actuellement en recherche préliminaire. Cette fonctionnalité importe dans le CLI et l’application Desktop le workflow d’artboards de Claude Design, construit sur le système d’artifacts existant. La commande /design génère plusieurs artboards éditables représentant des propositions d’interface utilisateur : l’utilisateur choisit celle qui lui convient, l’ajuste, puis demande à Claude de l’implémenter dans le code.

Ce lancement rapproche Claude Code d’un usage de conception d’interface, jusqu’ici plutôt réservé à des outils dédiés, en l’intégrant directement au flux de travail du développeur dans le terminal ou le Desktop. La fonctionnalité est disponible pour les plans Pro, Max, Team et Enterprise, et nécessite une mise à jour de Claude Code pour être testée. Aucun détail supplémentaire (limitations du research preview, roadmap, exemples visuels) n’a été fourni au-delà de cette annonce de lancement.

Claude Code can design now. The new /design skill (research preview) brings Claude Design’s artboard workflow into the CLI and Desktop, built on artifacts. Run /design to get editable artboards for your UI — pick one, tweak it, then have Claude implement it.

🇫🇷 Claude Code peut désormais concevoir des interfaces. Le nouveau skill /design (recherche préliminaire) apporte le workflow d’artboards de Claude Design dans le CLI et le Desktop, construit sur les artifacts. Lancez /design pour obtenir des artboards éditables pour votre interface — choisissez-en un, ajustez-le, puis demandez à Claude de l’implémenter.@ClaudeDevs sur X

🔗 Disponibilité Pro, Max, Team, Enterprise


Anthropic : Cowork généralisé, limites prolongées, CPU optimisé

Trois annonces Anthropic du jour portent sur l’accès et les performances de Claude Code et Cowork.

Claude Cowork disponible sur mobile et web pour tous les plans payants

18 août — Claude Cowork, l’environnement collaboratif d’Anthropic, est désormais accessible sur mobile et sur le web pour l’ensemble des plans payants (Pro, Max, Team et Enterprise). Jusqu’ici évoqué principalement autour de son panneau latéral partagé entre desktop, web et mobile, cette annonce marque une généralisation de l’accès plutôt qu’une nouvelle fonctionnalité : les utilisateurs payants retrouvent désormais leurs sessions Cowork depuis n’importe lequel de ces trois points d’entrée, sans détail supplémentaire sur l’interface ou d’éventuelles limitations mobiles.

🔗 Annonce Claude Cowork

Hausse de 50 % des limites hebdomadaires Claude Code prolongée jusqu’au 31 août

18 août — Anthropic prolonge jusqu’au 31 août la hausse de 50 % des limites d’usage hebdomadaires de Claude Code, initialement temporaire. L’équipe espère rendre ce changement permanent, mais prévient que la forte demande sur ses modèles pourrait entraîner des tensions de capacité dans les semaines à venir, sans date définitive pour une décision finale. Cette annonce s’inscrit dans une série de communications récentes autour des performances et de l’usage de Claude Code, reflétant une pression continue de la demande sur l’infrastructure du produit.

🔗 Annonce limites Claude Code

Claude Code CLI utilise deux fois moins de CPU au p99

18 août — Un correctif fait désormais attendre le ramasse-miettes (garbage collector) de Bun, le runtime JavaScript de l’outil, jusqu’à l’inactivité du processus avant de s’exécuter. Le déclenchement se faisait auparavant sur un minuteur fixe, potentiellement en plein milieu d’un tour de conversation, au moment où Claude Code sollicitait le plus le processeur. Résultat : le CLI utilise désormais deux fois moins de CPU au percentile 99, dans la continuité d’autres optimisations de performance communiquées début août.

🔗 Annonce optimisation CPU


Agents de codage : chat vocal et SSH natif

Amp et Warp complètent leurs agents de codage avec de nouveaux modes d’interaction.

Amp lance le chat vocal temps réel avec Puck

18 août — Amp ajoute la conversation vocale en temps réel avec Puck, son agent assistant, propulsée par gpt-realtime-2.1, qui délègue le travail à l’agent Puck déjà existant (alimenté par GPT-5.6 Sol) et résume la réponse à voix haute pendant que le texte complet continue de s’afficher dans le fil de discussion. Amp met en avant plusieurs cas d’usage : coordonner du travail en parallèle, obtenir des points d’avancement, ou faire lire à voix haute des messages Slack pertinents, aussi bien au bureau qu’en déplacement.

🔗 Talk to Puck

Amp lance un tarif éducation à 10 dollars par mois

18 août — Étudiants et enseignants peuvent désormais s’abonner à Amp Megawatt Edu pour 10 dollars par mois, soit la moitié du tarif habituel. L’offre inclut l’agent frontière d’Amp, les orbs (machines distantes pour agents sans supervision), l’hébergement de code illimité (public et privé), 750 heures d’usage d’orb par an et 10 dollars de crédits mensuels. Les abonnés peuvent lier un abonnement ChatGPT existant pour accéder à GPT-5.6, ou un abonnement X Premium+/SuperGrok pour Grok 4.6 ; aucune vérification stricte du statut étudiant n’est mise en place.

🔗 Amp Megawatt Edu

Warp Agent CLI ajoute le support SSH natif

17 août — Le Warp Agent CLI, gratuit à télécharger et compatible BYOK et abonnements Grok, permet désormais d’inviter l’agent directement dans une session SSH déjà active — y compris dans vim, un REPL SQL ou d’autres interfaces texte — plutôt que de se limiter à l’exécution de commandes ponctuelles. Aucune CLI supplémentaire n’est nécessaire sur la machine distante : la commande ! ssh suffit pour travailler aux côtés de l’agent directement dans la session.

🔗 Warp Agent CLI et SSH


OpenAI : adolescents, DevDay mondial et impact agentique

Quatre annonces OpenAI du jour couvrent la sécurité des jeunes utilisateurs, l’international, et l’impact concret de Codex.

ChatGPT for Teens : protections renforcées et partenariat éducatif avec CodeAI

18 août — OpenAI lance ChatGPT for Teens, expérience dédiée aux adolescents combinant le Study Mode, des rappels anti-raccourci capables de détecter un contournement de devoir, des quiz et visualisations pédagogiques, ainsi que des Study Hours programmables par les ados ou les parents. Le système bascule automatiquement dans cette expérience tout utilisateur estimé mineur, avec de nouvelles évaluations « moins de 18 ans » publiées dans les system cards (automutilation, troubles alimentaires, violence, contenu sexuel). En parallèle, un partenariat signature avec CodeAI prévoit sur un an un conseil consultatif sur le développement de l’enfant, l’extension du programme « Hour of AI », un « Builders Challenge » pour lycéens et un soutien au cours gratuit « AI Foundations ».

🔗 ChatGPT for Teens

DevDay Exchange : OpenAI mondialise son événement développeurs

18 août — À partir d’octobre 2026, OpenAI lance DevDay Exchange, une série d’événements développeurs dans huit villes : Bengaluru, Tokyo, Séoul, Berlin, Paris, Londres, São Paulo et Mexico. L’objectif affiché est de permettre aux builders d’échanger sur leurs projets réels et de rencontrer directement les équipes OpenAI qui développent les outils (API, Codex, ChatGPT Work). Aucun détail sur le format précis ou les inscriptions n’est fourni à ce stade.

🔗 DevDay Exchange

Asana réalise cinq ans de travail d’ingénierie en deux semaines avec Codex

18 août — Asana a utilisé Codex pour retirer Enzyme, un système de test obsolète bloquant la modernisation de sa stack frontend. Un projet estimé à environ cinq ans de travail et 6 millions de dollars a été réalisé en 1,5 semaine d’effort d’ingénierie étalée sur deux semaines calendaires, pour un coût total d’environ 12 000 dollars. À partir d’un prompt de cinq phrases, jusqu’à quatre agents Codex ont travaillé en parallèle sur des copies distinctes de la base de code, un ingénieur validant chaque changement deux fois par jour.

🔗 Étude de cas Asana

OpenAI lance une initiative pour renforcer le contrôle démocratique de l’IA en sécurité nationale

18 août — OpenAI annonce une initiative dotée de 5 millions de dollars pour aider les institutions de contrôle démocratique à superviser l’usage de l’IA dans la sécurité nationale, via formation, support technique et crédits OpenAI. Trois principes guident ce travail : l’IA doit renforcer et non remplacer le jugement institutionnel, l’usage gouvernemental doit rester traçable pour les organes de contrôle autorisés, et l’IA doit donner à ces institutions les moyens d’agir à l’échelle requise. Sur un an, OpenAI prévoit de piloter des outils de traçabilité des décisions gouvernementales assistées par IA, les institutions participantes conservant le contrôle des preuves.

🔗 Contrôle démocratique et sécurité nationale


Recherche et modèles ouverts

Quatre publications de recherche illustrent ce que l’ouverture des poids et des données permet de démontrer.

Sentence Transformers v6.0 : les modèles multi-vecteurs ColBERT en première classe

18 août — Hugging Face publie la version 6.0 de Sentence Transformers avec l’ajout de MultiVectorEncoder, qui place les modèles à interaction tardive façon ColBERT au même niveau que les modèles denses, épars et re-ranker déjà pris en charge. Chaque token du document conserve son propre vecteur, et le score final additionne la similarité maximale de chaque token de requête (opérateur MaxSim). Sur le banc d’essai NanoBEIR (13 jeux de données), la version multi-vecteurs obtient un NDCG@10 moyen de 0,6868 contre 0,6764 pour la version dense équivalente, au prix d’un stockage plus élevé (environ 92 Mo compressés pour 4 874 passages). La bibliothèque ajoute aussi un support Flash Attention multipliant le débit par 2,44 en précision fp16.

🔗 Sentence Transformers v6.0

Ai2 : Olmo 3 révèle un raccourci morphologique dans les réponses médicales des LLM

18 août — Des chercheurs de UT Austin, Northeastern University et du MD Anderson Cancer Center ont utilisé Olmo 3 (7B Instruct), modèle entièrement ouvert d’Ai2, pour vérifier si les modèles répondent aux questions sur les médicaments à partir d’une connaissance réelle ou en exploitant la structure du nom (le suffixe « -pril » signale un inhibiteur de l’ECA, par exemple). Pour 51 à 59 % des médicaments testés, la réponse du modèle au nom réel est à peine distinguable de sa réponse à un nom inventé. L’accès aux poids, données et checkpoints intermédiaires d’Olmo a permis de retracer ce raccourci jusqu’aux données d’entraînement — une traçabilité impossible avec des modèles propriétaires.

🔗 Olmo 3 et raccourci morphologique

IBM Research : calibrer la mémoire agentique selon le modèle

18 août — Un nouvel article de la série ALTK-Evolve d’IBM Research montre que la mémoire agentique — consignes distillées du travail passé d’un agent — doit être dosée selon la capacité du modèle sous-jacent. Testée sur huit modèles : gpt-oss-120b gagne +16,1 points de taux de complétion des tâches avec une récupération sélective ciblée pour seulement +5 % de tokens ; DeepSeek-V3.2 progresse de +9,5 points avec l’injection complète des consignes ; GLM-5 ne montre aucun gain mesurable, cas de saturation. Constat contre-intuitif : la stratégie la moins coûteuse délivre souvent la meilleure précision pour les modèles les plus faibles.

🔗 ALTK-Evolve — mémoire agentique

AlphaEvolve contribue à un nouveau record pour la multiplication de matrices

18 août — Google DeepMind annonce un nouveau record pour oméga (ω), l’exposant théorique de la vitesse la plus rapide pour multiplier des matrices, avec ω < 2,371177. Ce résultat provient d’un effort conjoint entre Google DeepMind, des collaborateurs académiques et AlphaEvolve, l’agent de codage propulsé par Gemini déjà connu pour avoir amélioré plusieurs algorithmes en 2025. La multiplication de matrices sous-tend une grande partie de l’informatique moderne, y compris l’entraînement et l’inférence des modèles d’IA — un gain théorique sur cet exposant dépasse donc la seule recherche académique.

🔗 Nouveau record oméga


Économie de l’inférence : A/B testing et cascade de coûts

Deux publications de Together AI mesurent le coût réel de la mise en production et de la comparaison de modèles.

Together AI lance l’A/B testing de modèles au niveau des endpoints

18 août — Together AI intègre l’A/B testing directement à la couche endpoint plutôt que dans le code applicatif : une expérience associe un modèle de contrôle et jusqu’à 20 variantes, chacune avec un pourcentage de trafic fixe (95/5, 80/20, 50/50), indépendant du nombre de réplicas. Les mises à jour se propagent en 30 à 60 secondes avec protection par etag contre les écrasements concurrents. Une fois un gagnant identifié, il est promu par déploiement blue-green puis l’expérience est supprimée : 100 % du trafic revient au contrôle sans logique résiduelle à nettoyer côté client.

🔗 A/B testing Together AI

DeepSeek V4 Pro face à GPT-5.6 Sol et Claude Fable 5 sur DeepSWE : coût et cascade

17/18 août — Together AI publie deux benchmarks indépendants de 904 rollouts chacun (113 tâches, 4 tentatives) comparant DeepSeek V4 Pro 0813 à GPT-5.6 Sol et Claude Fable 5 sur DeepSWE, banc d’essai d’ingénierie logicielle.

ComparaisonPass@1 ProPass@1 concurrentCoût rollout ProCoût concurrentCascade Pro-first
Pro vs GPT-5.6 Sol62,8 %72,7 %0,24 $8,37 $ (35x)83,0 % à 3,35 $/tâche
Pro vs Claude Fable 562,8 %69,7 %0,24 $21,63 $ (90x)82,7 % à 8,28 $/tâche

En pass@4, Pro reprend l’avantage dans les deux cas (88,5 % contre 85,8 % face à Sol, 88,5 % contre 84,1 % face à Fable). La cascade « Pro-first » — exécuter Pro d’abord, escalader seulement en cas d’échec — dépasse chaque modèle seul à une fraction du coût.

🔗 Benchmark DeepSWE — GPT-5.6 Sol


Produits par email et audio génératif

Perplexity Computer accessible par email

18 août — Computer, l’agent d’action de Perplexity, devient accessible par email pour tous ses utilisateurs : il suffit d’envoyer, transférer ou mettre en copie computer@perplexity.com sur n’importe quel fil de discussion pour déclencher une tâche. Chaque tâche par email s’exécute comme une session normale de Computer, consultable sur le web et le mobile, avec le même journal d’audit que les tâches lancées depuis l’application.

🔗 Computer par email

Stability AI lance un plugin DAW et une nouvelle interface web pour Stable Audio 3.0

18 août — Stability AI annonce deux outils en bêta pour Stable Audio 3.0, tous deux basés sur des modèles « commercially-safe » dont l’utilisateur possède les sorties. Le plugin DAW (macOS AU/VST3, Apple Silicon et Intel) génère de l’audio directement comme piste instrument synchronisée au tempo, de courtes séquences jusqu’à six minutes. L’interface web enrichie sur stableaudio.com ajoute des prompts directionnels pour ajuster une génération, la transformation audio-à-audio, le mixage multipiste et des effets par piste. Ces outils rapprochent Stable Audio des flux de production musicale professionnels, sur un terrain où Suno et Pika proposent déjà des offres concurrentes.

🔗 Stable Audio 3.0 — nouveaux outils


Brèves

  • Le Hub Hugging Face dépasse 3 millions de modèles — nouveau jalon pour la plateforme communautaire de référence des modèles ouverts. 🔗 Tweet
  • Sakana Namazu disponible sur OpenRouter et Vercel AI Gateway — le modèle qui alimente Sakana Chat, spécialisé japonais et contexte métier, devient accessible sur ces deux plateformes de distribution. 🔗 Tweet
  • Ai2 prévisualise MolmoMotion avant son webinaire du 20 août — extension de Molmo pour la prédiction de trajectoires 3D à partir d’instructions en langage naturel, poids et données ouverts annoncés à venir. 🔗 Tweet
  • Together AI : l’adoption des modèles ouverts s’accélère — une étude Brex citée par Together AI montre 14 des 25 fournisseurs logiciels à plus forte croissance servant l’IA ; l’usage de tokens sur Together est passé de 30 milliards par mois à 400 000 milliards en un an. 🔗 Tweet
  • Josh Woodward détaille la feuille de route de l’app Gemini — outils Workspace revus en test, amélioration du tool calling avec Gemini 3.7 Flash, nouvelle interface Projects, et 49 connecteurs désormais supportés. 🔗 Tweet
  • HeyGen lance les Brand Kits — polices, logo, codes hexadécimaux et glossaire de prononciation préconfigurés pour que chaque vidéo d’avatar générée reste conforme à la charte de marque, sans reprise. 🔗 Tweet
  • NVIDIA construit TensorRT Model Connect avec des agents Codex — outil en préversion de conversion de modèles Hugging Face vers TensorRT, développé entièrement avec des agents Codex sous supervision humaine, projet open source. 🔗 Tweet
  • Cohere — Aidan Gomez sur la souveraineté numérique — le CEO alerte sur la concentration du marché technologique mondial autour de quelques acteurs et plaide pour éviter tout point de défaillance unique. 🔗 Tweet

Ce que ça signifie

La gouvernance de l’IA se traduit désormais en mesures concrètes plutôt qu’en principes. La pause de deux semaines chez OpenAI face aux capacités cyber d’Astra, l’initiative à 5 millions de dollars pour outiller le contrôle démocratique en sécurité nationale, et les protections renforcées de ChatGPT for Teens forment un même mouvement : les laboratoires documentent publiquement les seuils qu’ils s’imposent, avec des chiffres vérifiables (20 % de surcoût de calcul, alerte sous 30 minutes) plutôt que de simples déclarations d’intention.

L’infrastructure agentique devient elle-même un produit à part entière. Warp Factories propose une couche de gouvernance et de mesure de ROI pour les agents de codage d’entreprise, Claude Code étend son périmètre à la conception d’interface avec /design, et Amp ajoute une couche vocale à son agent Puck pendant que Warp ouvre ses agents aux sessions SSH actives. Dans les quatre cas, l’enjeu dépasse la génération de code : il s’agit de donner aux agents une prise directe sur des flux de travail entiers, avec gouvernance et contrôle humain intégrés.

L’ouverture des poids et des données continue de produire une valeur scientifique que les modèles propriétaires ne peuvent pas offrir. La découverte d’Ai2 sur le raccourci morphologique des LLM en pharmacologie n’a été possible que parce qu’Olmo 3 expose ses données d’entraînement ; l’article d’IBM Research sur la mémoire agentique chiffre des gains différenciés par modèle (gpt-oss-120b, DeepSeek-V3.2, GLM-5) grâce à des tests reproductibles ; et le cap des 3 millions de modèles sur le Hub Hugging Face illustre l’échelle que prend cet écosystème ouvert.

Le coût de l’inférence continue de structurer les choix produit plus que la performance brute. Face à GPT-5.6 Sol et Claude Fable 5, DeepSeek V4 Pro perd en pass@1 mais l’emporte largement sur le rapport qualité-prix, et une simple cascade « Pro-first » referme l’essentiel de l’écart de précision pour une fraction du coût. Together AI pousse cette logique jusqu’à l’infrastructure elle-même avec son A/B testing au niveau des endpoints — la comparaison de modèles en production devient une fonctionnalité de plateforme, plus une question de code applicatif.


Sources