Clément Delangue, PDG de Hugging Face, tire trois leçons de la cyberattaque menée en juillet par un agent autonome contre son entreprise et propose le partage obligatoire des traces des agents, tandis que le banc Quadrat-IPI montre que des agents piégés ne donnent presque jamais l’alerte quand l’attaque réussit : 3 alertes pour 389 paiements obtenus par injection. OpenAI corrige un bogue d’encodage qui dégradait la compréhension des images de GPT-6 Sol et GPT-6 Luna, Apple publie LensVLM-9B, qui lit les longs documents sous forme de pages compressées, et SmolDataEnvs ouvre 5 000 tâches d’analyse de données pour entraîner de petits modèles. Côté agents de code, Claude Code 2.1.283 audite les consignes écrites pour d’anciens modèles, Qwen Code 0.24.6 fait appel à un modèle conseiller et une nightly de Gemini CLI transforme en refus les demandes de confirmation en mode non interactif.
Sécurité des agents : les trois leçons de Clément Delangue et le banc Quadrat-IPI
Deux textes abordent la même question sous deux angles : que sait-on des attaques qui passent par des agents ? Le premier vient d’une entreprise qui en a subi une, le second mesure ce que des agents attaqués signalent, ou taisent.
Clément Delangue tire trois leçons de la cyberattaque par agent contre Hugging Face
24 septembre — Selon son PDG Clément Delangue, Hugging Face a été en juillet la première entreprise à rendre publique une cyberattaque par agent autonome. Il en tire trois leçons sur X.
Transparence : des incidents comparables se seraient produits des mois plus tôt, en secret, dans quelques laboratoires de pointe sans surveillance, qu’il ne nomme pas ; il propose le partage obligatoire des traces des agents. Asymétrie : bloquée par les garde-fous des API fermées, qui ne distinguent pas toujours défenseurs et attaquants, son équipe s’est rabattue sur « la version NVIDIA » de GLM 5.2, modèle ouvert de Z.ai ; une grande partie de la défense pourrait, selon lui, reposer sur des outils open source. Enfin, contre les récits anxiogènes : l’IA aide Hugging Face à corriger ses failles, et OpenAI à renforcer ses bacs à sable contre l’évasion d’agents, affirme-t-il.
We were attacked by AI, but more importantly, we defended ourselves with AI.
🇫🇷 Nous avons été attaqués par l’IA, mais surtout, nous nous sommes défendus avec l’IA. — @ClementDelangue sur X
Quadrat-IPI : 3 alertes pour 389 paiements obtenus par injection
26 septembre — Dans un billet communautaire, Mikhail Gribov, auteur du jeu d’injections de prompt Quadrat-IPI, vérifie si l’agent signale l’attaque quand il en a les moyens. L’agent testé, assistant personnel d’un titulaire de boîte mail dans un monde émulé, dispose de 19 outils et en reçoit un vingtième, escalate_security_incident, dont le prompt système ne dit rien. Face à 395 courriels piégés, les neuf modèles testés y recourent de 48,9 % des cas à jamais, selon le modèle.
Sur 389 paiements effectués sous injection, l’alerte n’en accompagne que trois, toujours après le paiement : les modèles signalent surtout les attaques qu’ils repoussent. Parmi les modèles nommés, gpt-4o-mini alerte une fois sur 395, gpt-5.1 dans 4,8 % des cas et gpt-6-astra jamais, car il se contente de consigner le courriel sans en reprendre la demande. L’auteur en conclut que la visibilité doit venir de l’extérieur de l’agent, par l’inspection de ce qu’il lit ; harnais, journaux et correcteur sont publiés.
OpenAI corrige un bogue d’encodage qui dégradait la compréhension des images de GPT-6 Sol et GPT-6 Luna
25 septembre — Trois jours après le lancement de GPT-6 Sol et GPT-6 Luna, deux modèles de raisonnement qui acceptent texte et images en entrée, OpenAI indique dans le journal des modifications (changelog) de son API avoir corrigé un bogue d’encodage des images qui dégradait leur compréhension visuelle. La correction améliore les résultats sur les tâches visuelles dans l’API comme dans Codex, y compris l’usage de l’ordinateur (computer use).
OpenAI recommande aux développeurs dont les cas d’usage impliquent des images en entrée de relancer leurs évaluations et de réessayer les flux de travail touchés. L’entrée ne dit ni depuis quand le bogue était présent, ni dans quelle mesure les résultats étaient dégradés. Le correctif n’a été relayé ni par @OpenAI ni par @OpenAIDevs sur X, et il n’apparaît pas dans le changelog de ChatGPT et Codex.
Un modèle et un jeu de données sur Hugging Face : LensVLM-9B d’Apple et SmolDataEnvs
Deux publications de la semaine, pas encore relayées ici : un modèle d’Apple qui lit les longs documents sous forme d’images compressées, et un jeu de tâches vérifiables pour entraîner de petits modèles à l’analyse de données.
Apple publie LensVLM-9B, qui ne rouvre que les pages utiles d’un document
22 septembre — Apple publie sur Hugging Face LensVLM-9B, un modèle vision-langage accompagné de son code sur GitHub. Plutôt que de découper un long document en milliers de tokens, il le reçoit sous forme de pages rendues en petites images compressées, repère celles qui comptent, puis rouvre leur version non compressée grâce à des outils appris.
| Caractéristique de LensVLM-9B | Valeur publiée |
|---|---|
| Taille et modèle de départ | 9 milliards de paramètres, affiné de Qwen3.5-9B |
| Niveaux de compression proposés | 5x, 10x et 15x |
| Précision comparable au texte intégral | À 4,3x de compression effective |
| Meilleur que les méthodes de référence | Jusqu’à 10,1x, sur sept bancs de questions-réponses |
| Licence des poids | Apple Machine Learning Research Model License |
Ces résultats viennent de l’article de recherche associé, mis en ligne sur arXiv en mai, et les réponses y sont notées par un modèle juge.
🔗 LensVLM-9B sur Hugging Face · Article arXiv
SmolDataEnvs : 5 000 tâches d’analyse de données vérifiables
24 septembre — Adithya S K publie sur le Hub, sous l’organisation FineEnvs et sous licence MIT, SmolDataEnvs : des tâches d’analyse de données pour entraîner de petits modèles par apprentissage par renforcement (reinforcement learning). Chaque tâche associe un vrai jeu de données tabulaire, une question et une réponse de référence, tirées de carnets portant sur 471 jeux Kaggle et validées par des agents dans un bac à sable réel. Un correcteur fourni note la réponse sans aucun modèle de langage, de la correspondance exacte à l’équivalence symbolique.
| Jeu de tâches | Tâches faciles | Tâches moyennes | Tâches difficiles |
|---|---|---|---|
| Entraînement (5 000) | 1 433 | 2 845 | 722 |
| Test (250) | 33 | 118 | 99 |
| Évaluation (144) | 16 | 74 | 54 |
Les jeux tenus à l’écart sont donc plus difficiles par construction. L’ensemble comprend aussi 4 677 trajectoires d’agents vérifiées, prêtes pour TRL, et les mêmes tâches en environnements Harbor exécutables ; Clément Delangue a relayé la sortie le lendemain.
🔗 SmolDataEnvs sur Hugging Face
Agents de code : Claude Code 2.1.283, Qwen Code 0.24.6 et la nightly 0.63.0 de Gemini CLI
Claude Code 2.1.283 : un audit des consignes et deux verrous sur les modèles
25 septembre — La 2.1.283 compte 94 entrées, dont 53 correctifs. Sa nouveauté phare, /doctor prompt-audit (aussi /checkup prompt-audit), passe en revue les fichiers CLAUDE.md, les skills, les agents et les commandes pour repérer les formulations écrites pour des modèles plus anciens, chemins périmés et instructions contradictoires en tête.
| Nouveauté de la 2.1.283 | Ce qui change |
|---|---|
availableModelsMatch: "exact" | Un modèle qui vient de sortir reste bloqué tant qu’il n’est pas listé |
deniedModels | Bloque des modèles précis, même autorisés par availableModels |
| Mode de permission par défaut | Mode auto sur fournisseur tiers ou télémétrie coupée, sauf mode configuré |
| PowerShell sous Windows | rd, rmdir, del et erase ne peuvent plus effacer une racine de lecteur |
| Code Review | Une revue arrêtée par sa limite de temps sans rien vérifier n’est plus facturée |
La version annule aussi la réservation du nom claude-ai introduite la veille par la 2.1.282.
🔗 Notes de version de Claude Code 2.1.283
Qwen Code 0.24.6 : un modèle conseiller et un flux Batch API
26 septembre — Qwen Code v0.24.6 apporte 17 fonctionnalités, 14 correctifs et 3 optimisations, sans changement cassant connu. La principale est un outil Advisor natif, désactivé par défaut : si l’utilisateur configure un second modèle, dit conseiller, l’agent peut le consulter pour obtenir un avis indépendant. Le conseiller voit l’instruction système, les outils déclarés et la conversation, mais ne peut rien exécuter ; il se choisit avec /advisor ou --advisor, jamais depuis un dépôt, dont le réglage est ignoré avec un avertissement. Anthropic propose le même principe en bêta dans son API depuis avril.
Le flux /batch-api prépare un traitement par lots pour la Batch API de DashScope, puis confie la soumission, payante et soumise à approbation, à des sous-commandes qwen batch. Enfin, selon la PR #12622, le démarrage à froid devient environ 2,2 à 2,4 fois plus rapide selon la machine, avec 60 % de mémoire en moins.
🔗 Qwen Code v0.24.6 sur GitHub
Gemini CLI : la nightly 0.63.0 refuse les confirmations en mode non interactif
26 septembre — Publiée à 01 h 20 UTC, la nightly du 26 septembre ouvre la série 0.63.0 de Gemini CLI ; la stable v0.61.0 et la préversion v0.62.0 ne changent pas. Son changement le plus large (PR #29506, 26 fichiers) touche le moteur de règles (PolicyEngine) : en mode non interactif, une décision qui demanderait confirmation à l’utilisateur (ASK_USER) devient un refus (DENY). Les sorties des ressources MCP externes et de la recherche web sont désormais enveloppées comme celles de web-fetch, selon les standards de contexte non fiable (untrusted context).
Trois correctifs règlent des défauts précis : un réglage diff.external vide, que Git prenait pour un exécutable, cassait git diff dans le bac à sable ; les dossiers temporaires des commandes lancées en arrière-plan sont désormais supprimés ; deux sessions ACP ouvertes dans la même minute n’entrent plus en collision.
🔗 Notes de la nightly 0.63.0 de Gemini CLI
Brèves
- Codex CLI 0.157.1 — Correctif de la 0.157.0 publié le 26 septembre et réservé à Windows : l’hôte du mode code et les serveurs MCP locaux n’ouvrent plus de fenêtre de console, et le lancement du démon est fiabilisé. Les notes générées automatiquement étant vides, ce détail vient de la comparaison des deux versions. 🔗 source
- Témoignage sur Claude Tag — Boris Cherny, responsable de Claude Code, affirme sur X que Claude Tag, l’agent Claude intégré à Slack, écrit plus de la moitié de ses PR chaque jour et fait environ 100 % de ses analyses de données ; il partage ses consignes, comme reproduire chaque bug signalé dans un canal avant d’ouvrir une PR. 🔗 source
- Temps de revue des pull requests — Les rapports
repos-1-dayde l’API de métriques d’usage Copilot gagnent un tableaupull_request_review_times: médiane et 90e centile de trois étapes, de « prêt pour revue » à la première revue, de la première à la dernière, puis jusqu’à la fusion. Seules les revues humaines comptent, sans données antérieures au 21 septembre. 🔗 source - Validateur des réglages Copilot d’entreprise — Intégré à la page AI controls, il signale le JSON mal formé, les configurations non prises en charge et les correspondances d’équipes invalides dans
copilot/managed-settings.jsonetcopilot/team-mappings.json, avec le fichier et le chemin JSON de chaque erreur ; l’entrée ne précise ni statut ni formule. 🔗 source - Issues GitHub — Deux fonctions passent en disponibilité générale : les vues enregistrées privées sur les pages d’issues des dépôts, et la relation « Relates to » entre issues, en préversion depuis le 7 août, désormais prise en charge par les API REST et GraphQL, les webhooks, la chronologie et les recherches d’issues et de projets. 🔗 source
- Grok Bot et les finances — Selon un fil de @bot, la nouvelle intégration Finance de Grok Bot relie comptes bancaires, cartes et comptes d’investissement par Plaid, en lecture seule et sans accès aux identifiants ; le fil ne précise ni pays ni formule. Grok, l’assistant, avait reçu une connexion Plaid aux comptes bancaires américains le 4 septembre. 🔗 source
- NVIDIA et ROS 2 Lyrical — Billet du 22 septembre : NVIDIA a versé à ROS 2 Lyrical un module de mémoire CUDA, utilisé par Isaac ROS 5.0, qui fait circuler sans copie entre nœuds d’une même machine les données restées sur le GPU ; une skill confie à un agent de codage la migration des nœuds existants, sans gain chiffré. 🔗 source
- DGX Spark Handbook — Publié sous l’organisation exolabs du Hub, ce guide communautaire chiffre ce que font une à quatre DGX Spark : prix catalogue passé de 3 999 à 4 699 dollars, 22 à 25 W au repos et, d’après un test de NVIDIA, 269 ms par token généré sur une machine contre 72 ms sur quatre. 🔗 source
- Pré-entraînement sur un portable — Dans un billet communautaire, Rambarun Komaljeet fait tenir le pré-entraînement d’un modèle de 1,11 milliard de paramètres dans la RTX 4050 de 6 Go d’un portable ; un pré-entraînement complet prendrait environ 375 jours, et rien au-delà de 48 millions de paramètres n’a été entraîné jusqu’à convergence. 🔗 source
- Pruna et Qwen-Image-2.1 — Pruna AI ouvre deux adaptateurs LoRA qui font générer Qwen-Image-2.1 en 5 ou 8 étapes au lieu de 40, jusqu’à 6,3 fois plus vite selon l’éditeur ; cette version 0.1 reste en deçà de la qualité du modèle de base, sous licence de recherche de Qwen. 🔗 source
- Marin et Dolma 3.5 — Selon Ai2, l’entraînement 535B de Marin puise environ 1 800 milliards de tokens dans le corpus Dolma 3.5 d’Ai2 et s’appuie sur ses recettes Olmix et sa méthode Organize the Web ; Marin a mobilisé 25 000 milliards de tokens issus de 152 jeux de données dont la licence autorise l’entraînement. 🔗 source
- GLiNER2.5-Decide et DecisionBench — Stephen Solka, de Hanno Labs, montre que le format d’entrée pèse sur le score de GLiNER2.5-Decide dans DecisionBench, 38,9 % sur les lignes prises en charge contre 60,2 % annoncés par Fastino sur son propre banc : sans les descriptions d’options, les bonnes réponses passent de 27 à 37 sur 101 lignes. 🔗 source
- Un guide de l’alignement chez Perplexity — Perplexity publie dans sa rubrique Idées un guide pédagogique sur l’alignement de l’IA : huit schémas de défaillance documentés, de la complaisance (sycophancy) à la sous-performance volontaire (sandbagging), et les cadres publics d’OpenAI, d’Anthropic et de Google DeepMind ; aucune fonctionnalité nouvelle ne l’accompagne. 🔗 source
- Cybersécurité et emploi, une tribune — Dans un essai d’opinion sur le blog communautaire de Hugging Face, sans données, Sonny DeSorbo craint que l’automatisation des postes juniors en cybersécurité, conjuguée à une cybercriminalité rendue moins chère par l’IA, pousse des diplômés vers le crime en ligne ; il propose de préserver les voies d’entrée dans le métier. 🔗 source
Ce que ça signifie
Ce que les agents taisent devient le cœur de leur sécurité. Clément Delangue affirme que des incidents comparables à celui de Hugging Face sont restés secrets dans des laboratoires qu’il ne nomme pas, et propose le partage obligatoire des traces des agents. Quadrat-IPI montre que l’agent lui-même est un mauvais témoin : trois alertes pour 389 paiements obtenus par injection, toujours après coup. Mikhail Gribov en conclut que la visibilité doit venir de l’extérieur de l’agent, par l’inspection de ce qu’il lit ; c’est la voie que suit la dernière nightly de Gemini CLI, qui traite les sorties des ressources MCP et de la recherche web comme un contexte non fiable.
Clément Delangue défend les outils ouverts, moins restreints que les API fermées qui ont bloqué ses défenseurs ; les publications de la semaine sur Hugging Face cherchent, elles, à faire autant avec moins. LensVLM-9B ne rouvre que les pages utiles d’un document compressé jusqu’à 15 fois, Pruna ramène Qwen-Image-2.1 de 40 étapes à 5 ou 8, le DGX Spark Handbook détaille ce que quelques machines de bureau font tourner en local, et un développeur fait tenir le pré-entraînement d’un modèle de 1,11 milliard de paramètres dans 6 Go de mémoire vidéo, même s’il faudrait environ 375 jours pour aller au bout.
Une mesure ne vaut que par la chaîne qui la produit. Le bogue d’encodage corrigé par OpenAI dégradait les résultats de GPT-6 Sol et Luna sur les images, sans que l’on sache depuis quand ni de combien : les évaluations qui impliquent des images sont à relancer, comme le conseille OpenAI. Chez Hanno Labs, le seul format d’entrée fait passer GLiNER2.5-Decide de 27 à 37 bonnes réponses sur 101. SmolDataEnvs note ses tâches sans aucun modèle de langage, quand les scores de LensVLM-9B passent par un modèle juge.
Pour les agents de code, la confiance se règle au niveau de l’administrateur et de l’utilisateur, et le doute se tranche par un refus. Claude Code 2.1.283 permet de bloquer tout modèle qui n’est pas nommément autorisé, Qwen Code ignore un réglage d’Advisor posé dans un dépôt, et la nightly de Gemini CLI refuse, faute d’utilisateur pour trancher, ce qui aurait exigé une confirmation. Quant à /doctor prompt-audit, il prend acte que les modèles changent plus vite que les consignes qu’on leur écrit.
Sources
- @ClementDelangue : What we learned from being the first company to disclose an agent cyberattack
- Will the agent tell you it was attacked (blog Hugging Face)
- Changelog de l’API OpenAI
- LensVLM-9B (Hugging Face)
- Article de recherche LensVLM (arXiv)
- SmolDataEnvs (Hugging Face)
- Notes de version de Claude Code 2.1.283 (GitHub)
- Qwen Code v0.24.6 (GitHub)
- PR #12622 de Qwen Code : le démarrage à froid (GitHub)
- Gemini CLI, nightly v0.63.0 du 26 septembre (GitHub)
- PR #29506 de Gemini CLI : le moteur de règles (GitHub)
- Codex CLI 0.157.1 (GitHub)
- @bcherny : Claude Tag au quotidien
- Étapes de revue des pull requests dans l’API de métriques d’usage (changelog GitHub)
- Validateur des réglages gérés par l’entreprise (changelog GitHub)
- Vues enregistrées privées et relation Relates to (changelog GitHub)
- @bot : l’intégration Finance de Grok Bot
- Accelerating a ROS 2 Node with an AI Agent and NVIDIA Isaac ROS (blog NVIDIA)
- The DGX Spark Handbook (blog Hugging Face)
- Pre-training a 1.11B LLM on a 6 GB Laptop GPU (blog Hugging Face)
- Pruna-Qwen-Image-2.1 (Hugging Face)
- @allen_ai : Dolma 3.5 dans l’entraînement de Marin
- Less is more: GLiNER2.5-Decide and the shape of a decision (blog Hugging Face)
- AI alignment: current research and debate (blog Perplexity)
- The Coming Cybercrime Labor Shock (blog Hugging Face)