OpenAI va ajouter dans les prochaines semaines un filigrane invisible au texte de ChatGPT et de Codex pour ses utilisateurs de l’Union européenne, en réponse à l’AI Act qui impose de rendre le texte généré identifiable par une machine, et ouvre dès aujourd’hui ce filigrane en option aux clients de son API dans le monde entier. Côté agents, la mémoire s’installe : Cognition dote Devin d’une mémoire entre les sessions et publie son format comme standard ouvert, et Cohere lance North 2 avec une mémoire qui garde le contexte d’une session à l’autre ; GitHub publie de son côté ReviewBench, un benchmark ouvert de revue de code par IA. Du côté des modèles ouverts, Reflection AI présente Beam, 501 milliards de paramètres, dont les poids sont promis plus tard en octobre.
Filigrane invisible d’OpenAI : le texte de ChatGPT et Codex marqué dans l’Union européenne, une option mondiale dans l’API
5 octobre — OpenAI publie sa réponse aux règles européennes sur la provenance du texte. L’AI Act impose aux fournisseurs d’IA générative de rendre le texte qu’ils produisent identifiable de façon lisible par une machine ; OpenAI y répond par étapes, en prévenant d’emblée que les technologies actuelles de filigrane de texte ont des limites importantes (significant limitations).
| Public concerné | Ce qui change | Calendrier annoncé |
|---|---|---|
| Utilisateurs de ChatGPT et de Codex dans l’Union européenne, tous forfaits | Filigrane invisible ajouté au texte éligible | Dans les prochaines semaines |
| Clients de l’API, dans le monde entier | Filigrane en option (opt-in) sur des modèles sélectionnés, non nommés, désactivé par défaut | Dès le 5 octobre |
| Chercheurs et organisations expertes approuvés | Accès au détecteur, au cas par cas, sur candidature | Candidatures ouvertes le 5 octobre |
OpenAI n’en fait pas un réglage mondial par défaut, et travaille avec des partenaires cloud pour proposer, dans les prochaines semaines, le même filigrane sur les modèles OpenAI qu’ils servent. La technologie, textGrain, ajoute un signal statistique invisible aux choix de mots du modèle, sans marque visible ni caractère spécial ; selon OpenAI, elle égale ou dépasse les autres approches testées, dont SynthID pour le texte. Un rapport technique est publié et OpenAI prévoit d’en ouvrir le code. Le détecteur, lui, n’est pas public au lancement, en raison du risque de filigranes manqués et de faux positifs : l’accès suit le Code de bonnes pratiques (Code of Practice) de la Commission européenne.
Les chiffres publiés montrent surtout les limites de la détection :
| Condition de mesure | Taux de détection publié |
|---|---|
| Passages de 200 tokens, contenu de type psychologie, 1 % de faux positifs visés | environ 80 % |
| Passages de 400 tokens, contenu de type psychologie, 1 % de faux positifs visés | environ 95 % |
| Contenu de type mathématiques, même seuil de 1 % | nettement plus bas (valeur donnée seulement dans un graphique) |
| Passages de 400 tokens en anglais (jeu ELI5), non retouchés | environ 92 % |
| Mêmes passages, 10 % des mots remplacés par des synonymes | 66 % |
| Mêmes passages, 25 % des mots remplacés | 17 % |
Watermarks have limits. They’re often undetectable, especially in short passages. Rewriting or translating text can completely remove the watermark.
🇫🇷 Les filigranes ont des limites. Ils sont souvent indétectables, en particulier dans les passages courts. Réécrire ou traduire un texte peut supprimer complètement le filigrane. — @OpenAI sur X
Sur la qualité, OpenAI ne mesure pas d’écart significatif sur huit benchmarks de GPT-6 Astra sans et avec filigrane (94,44 % contre 93,94 % sur GPQA Diamond, 53,90 % contre 56,06 % sur Terminal-Bench 4.0). Le billet précise aussi ce qu’un filigrane ne dit pas : ni la part de travail humain, ni la propriété ou la responsabilité du texte, ni l’identité de l’utilisateur, ni l’exactitude ; et son absence ne prouve pas qu’un humain a écrit le texte. Pour les images et l’audio, rien ne change : openai.com/verify et la Content Provenance API restent accessibles aux organisations, et SynthID s’ajoute depuis le 19 mai aux métadonnées C2PA des images générées.
🔗 Billet d’OpenAI sur la provenance du texte dans l’UE
Agents de code : Devin se souvient entre les sessions, Cursor, Qwen Code, Together Link et IBM Bob
5 octobre — Cognition introduit dans Devin deux fonctions liées : Memory, une mémoire qui persiste d’une session à l’autre, et Dreaming, un « rêve » quotidien qui la réorganise. Memory garde ce que l’agent apprend en travaillant avec chaque utilisateur : préférences, corrections, leçons tirées d’un projet ou d’un flux de travail. Ce ne sont pas des résumés de sessions mais de courtes notes, chacune reliée à la session où la leçon a été apprise, et cette mémoire reste personnelle : elle ne devient pas une consigne partagée par toute l’organisation.
Les notes vivent dans le Memory Drive, un dépôt Git persistant de fichiers Markdown classés par dépôt, projet ou thème. Un fichier MEMORY.md, volontairement court, réunit les préférences générales et l’index du reste : Devin le reçoit au début de chaque session, puis va chercher les notes utiles avec les outils qui lui servent à parcourir du code, sans charger toute l’archive dans son prompt. Chaque session travaille sur sa propre copie Git : Devin fusionne les mises à jour des autres sessions, une vérification de révision rejette les écritures périmées, et les conflits sont signalés au lieu d’être écrasés en silence.
Dreaming est une session d’arrière-plan quotidienne (la nuit, précise le fil de Cognition) : Devin relit les conversations passées à la lumière de sa mémoire, fusionne les notes qui se recoupent, retire les détails transitoires, cherche les leçons qui n’avaient pas été notées et supprime les mémoires qu’aucune session n’a utilisées. L’accès se fait sur devin.ai, menu Customize → Memory ; le billet ne dit rien de Devin Desktop ni de Devin CLI et n’annonce aucun tarif.
Cognition publie aussi le format comme standard ouvert, Agent Memory Repo, sous licence MIT. La spécification, ouverte aux contributions, décrit la boucle de chaque session (cloner la mémoire, chercher, mettre à jour sans humain dans la boucle, pousser après chaque modification) et la composition de plusieurs mémoires dans une même session, chacune dans son propre dépôt avec ses droits et son historique. Parmi les usages cités figurent la mémoire d’équipe et les essaims d’agents (agent swarms) :
In early experimentation we saw a swarm of Devins using the memory as a way to coordinate at large scale without us prompting them to (we promise they didn’t hack anyone)
🇫🇷 Lors de premières expérimentations, nous avons vu un essaim de Devin utiliser la mémoire pour se coordonner à grande échelle sans que nous le leur demandions (promis, ils n’ont piraté personne). — @cognition sur X
Un « rêve » qui réorganise la mémoire d’un agent existait déjà chez Anthropic (Claude Managed Agents, en mai) et chez OpenAI (mémoire de ChatGPT, en juin) ; ce qui change ici, c’est une mémoire en fichiers versionnés avec Git, publiée comme spécification que d’autres agents peuvent adopter.
🔗 Memory and dreaming, billet de Cognition 🔗 Spécification Agent Memory Repo
Cursor : orienter les agents de son SDK pendant leur exécution
5 octobre — Cursor enrichit son SDK, qui sert à lancer ses agents depuis du code TypeScript ou Python. La méthode run.steer() glisse un message dans le tour en cours d’un agent ; si un sous-agent est à l’œuvre à ce moment-là, il passe en arrière-plan et continue. Les sous-agents d’arrière-plan rendent aussi compte : leur résultat revient à l’agent parent comme un tour supplémentaire de la même exécution, au lieu d’être perdu quand le tour parent se termine.
| Nouveauté du SDK | Périmètre indiqué par le changelog |
|---|---|
run.steer(), pilotage en cours d’exécution | Agents locaux en TypeScript ; sur un agent cloud, le message part comme une relance normale |
| Retour des résultats des sous-agents d’arrière-plan | Agents locaux, en TypeScript et en Python |
| Annotations MCP des outils personnalisés (readOnlyHint, destructiveHint…) | TypeScript ; simples indications, que le SDK ne fait pas respecter |
| Prompt système remplaçable, règles et skills toujours chargés | Agents locaux en TypeScript ; accès activé compte par compte |
Aucun tarif n’accompagne ces changements.
🔗 Le fil de Cursor sur X 🔗 Changelog du SDK de Cursor
Qwen Code v0.25.0 : agents d’espace de travail, canal e-mail et mémoire Mem0
5 octobre — Qwen publie la v0.25.0 de Qwen Code, son agent de programmation en ligne de commande, première version stable depuis la v0.24.7 du 29 septembre : 42 fonctionnalités, dont 23 pour le Managed Agent, 79 correctifs et aucun changement cassant connu. Trois ajouts, tous à activer explicitement, se distinguent. Des agents d’espace de travail collaborent désormais en local : le démon lance et reprend leurs tours, et le Web Shell permet de gérer agents et tâches et d’en solliciter un avec @agent depuis une discussion. Ces agents persistants s’ouvrent au protocole A2A 1.0, par des partages qui expirent et se révoquent. Enfin, la mémoire Mem0 se branche directement sur le CLI : il suffit d’indiquer un point de terminaison et une clé, Qwen Code enregistre lui-même le serveur MCP correspondant. Un canal e-mail donne aussi à l’agent sa propre boîte, en IMAP et SMTP, et le Code Mode exécute en parallèle les appels Bash que le modèle regroupe. Le SDK TypeScript v0.1.18 et l’application Desktop v0.25.0 ont suivi le même matin, sans tweet de Qwen.
🔗 Notes de version de Qwen Code v0.25.0
Together Link : Claude Code, Codex, OpenCode et Pi sur des modèles ouverts
5 octobre — Together AI lance en bêta Together Link, qui fait tourner les agents de code déjà installés sur les modèles ouverts hébergés par la plateforme. Une commande d’installation (macOS ou Linux) branche Claude Code, Claude Desktop, Codex, OpenCode et Pi sur son API, avec la clé du compte ; la documentation ajoute ChatGPT Desktop et prévient que commandes, routage et liste de modèles peuvent encore changer. Outre le mode Auto, quatre modèles sont proposés, tous avec 1M de tokens de contexte :
| Modèle proposé | Équivalent dans le menu /model de Claude Code |
|---|---|
| Kimi K3 | Opus |
| GLM 5.3 | Fable |
| GLM 5.3 Flash | Sonnet |
| DeepSeek V4.1 Flash | Haiku |
Le mode Auto, choisi par défaut, peut confier les tâches difficiles à Opus 5.5 quand l’utilisateur fournit une clé Anthropic, mais le billet et la documentation ne décrivent pas ce routage de la même façon : un choix fait une seule fois par session pour préserver le cache de prompt selon le billet, un tri requête par requête réservé à Claude Code et Claude Desktop selon la documentation. Together AI annonce une dépense réduite de plus de 50 %, sans méthode publiée, et affiche après chaque session son coût à côté de celui qu’elle aurait eu sur Opus 5.5.
🔗 Billet de Together AI 🔗 Documentation de Together Link
IBM Bob auto-hébergé s’appuie sur Nemotron 3 Ultra de NVIDIA
5 octobre — IBM explique pourquoi la version auto-hébergée (self-hosted) de Bob, son assistant de développement agentique, s’appuie sur Nemotron 3 Ultra de NVIDIA, aux côtés de Poolside Laguna S 2.1. Cette option, passée en disponibilité générale la semaine précédente, fait tourner l’assistant sur l’infrastructure du client, jusqu’aux environnements déconnectés (air-gapped). L’équipe a jugé les modèles sur quatre critères (empreinte matérielle, précision en code, latence, ouverture des poids), en les testant avec le harnais d’agent de Bob, des modèles fermés d’Anthropic, OpenAI et Google servant de référence. Trop verbeux au départ, Nemotron a été ajusté avec NVIDIA : prompts, paramètres d’échantillonnage, réglages de raisonnement et correctifs du harnais. Selon des tests internes d’IBM, Nemotron 3 Ultra offre jusqu’à environ 4 fois moins de latence sur GPU Blackwell que des modèles SaaS de pointe appelés par le réseau, et respecte strictement les schémas d’outils ; Laguna S 2.1 est retenu pour son rapport performance/empreinte. Le billet ne publie aucun score de précision.
🔗 Billet d’IBM sur Bob auto-hébergé
ReviewBench : GitHub lance un benchmark ouvert de revue de code par IA
5 octobre — GitHub lance en préversion de recherche (research preview) ReviewBench, un benchmark ouvert pour les agents de revue de code par IA. Le site dédié publie le jeu de données complet, le classement, la méthodologie, le prompt et la configuration du juge, ainsi qu’un exécuteur en libre-service. Le billet est signé Michelle Zhou et Alejandro Carderera de Diego, et ses remerciements associent GitHub et Microsoft au projet.
Le corpus réunit 219 pull requests issues de 187 dépôts open source publics, dans 19 langages. Ses distributions de langages et de tailles de dépôts reproduisent celles de GitHub, établies sur 103,9 millions de pull requests, avec une pondération assumée vers les changements moyens et gros. La vérité terrain (golden set) croise relecteurs humains, problèmes déduits des commits de suivi, outils d’analyse déterministes et plusieurs LLM de pointe ; les constats sont validés par un juge LLM, Claude Sonnet 5 selon le billet. Des ingénieurs seniors extérieurs à la construction du jeu ont ré-étiqueté chaque constat : leur verdict concorde avec ReviewBench dans 96,6 % des cas. Le rappel « ancré » (grounded), mesuré sur la seule vérité terrain, sert de comparaison principale.
Selon le classement initial de GitHub, Copilot code review arrive en tête :
| Agent évalué (configuration) | F1 ancré | Précision ancrée | Rappel ancré | Date d’exécution |
|---|---|---|---|---|
| Copilot Code Review (Balanced) | 40,1 % | 87,8 % | 26,0 % | 1er octobre 2026 |
| Devin AI | 37,0 % | 84,0 % | 23,8 % | 28 septembre 2026 |
| Qodo | 35,1 % | 85,3 % | 22,1 % | 28 septembre 2026 |
| Codex (GPT-5.6 Sol · Ultra) | 32,3 % | 87,0 % | 19,9 % | 19 juillet 2026 |
| Cubic | 27,3 % | 85,5 % | 16,3 % | 29 juin 2026 |
| Greptile | 27,2 % | 86,1 % | 16,2 % | 16 juin 2026 |
| Cursor | 17,3 % | 87,7 % | 9,6 % | 27 septembre 2026 |
Le site précise que ces premières entrées ont été produites par l’équipe ReviewBench en exécutant le produit public de chaque éditeur, à la date indiquée, et que les éditeurs ne les ont ni exécutées ni vérifiées. Chacun peut désormais soumettre son agent : image de conteneur et clé de modèle fournies par le candidat, juge fourni par GitHub, essais sur 25 pull requests puis exécution complète en trois passes ; un score n’est publié qu’après validation par un mainteneur, et seulement s’il améliore le précédent score de l’agent ou s’il s’agit de sa première entrée.
GitHub s’en sert aussi pour faire évoluer Copilot code review. En test A/B, une revue multi-modèles du niveau Lite, qui combine plusieurs exécutions indépendantes, a gagné 13,6 % de rappel pour un coût par revue en baisse de 8,0 %, dans le sens prévu hors ligne. Le billet se contredit sur le volume de commentaires : +61 % selon le texte, +25,0 % selon son graphique.
🔗 Billet de GitHub sur ReviewBench 🔗 Site et classement de ReviewBench
Cohere lance North 2 et noue avec PwC une alliance mondiale
5 octobre — Cohere lance North 2, la nouvelle version de North, sa plateforme d’agents IA pour l’entreprise, annoncée comme « bientôt disponible » le 9 septembre puis promise pour octobre. Le fil de lancement revendique plus de 15 nouvelles fonctionnalités (15+ new features), un décompte que le billet ne reprend pas. Le cœur de la version est un nouveau harnais d’agents (agent harness), repensé pour des automatisations et des agents en plusieurs étapes, sur une plateforme qui reste agnostique : modèles de Cohere ou modèles du client.
| Domaine fonctionnel | Nouveautés citées par Cohere |
|---|---|
| Agents | Agents et automatisations réutilisables, créés par prompt et partagés dans l’organisation ; orchestration multi-agents ; mémoire qui garde le contexte d’une session à l’autre |
| Productivité | Compétences (Skills), bibliothèques (Libraries) et applications qui produisent présentations, tableaux de bord et documents ; Automations, lancées fin juillet, avec modèles prêts à l’emploi et éditeur visuel |
| Connecteurs | Slack, SharePoint, OneDrive, Outlook, Exchange, Jira, Linear, Notion et GitHub ; fournisseurs de données financières (PitchBook, FactSet et d’autres) seulement prévus |
| Déploiement et sécurité | Auto-hébergé, VPC, hybride, sur site ou entièrement déconnecté ; SOC 2 Type 2, ISO 27001 et ISO 42001 ; politiques d’autonomie avec validation humaine des décisions critiques |
| Gouvernance | Console North Admin, paliers de consommation de requêtes et de tokens par utilisateur ou par groupe, alertes avant les plafonds |
Cohere cite deux clients, LG CNS en Corée du Sud et Bell Cyber au Canada, et met en avant un meilleur débit de ses modèles sur GPU NVIDIA Blackwell et Hopper, sans chiffre, avec une citation de Kari Briski, responsable de l’IA générative chez NVIDIA. Aucun tarif ni calendrier de déploiement n’est donné : le billet renvoie vers une démonstration à réserver auprès des équipes commerciales.
🔗 Billet de lancement de North 2 🔗 Fil de lancement de North 2 sur X
L’alliance mondiale avec PwC, qui démarre au Canada
5 octobre — Le même jour, PwC et Cohere annoncent une alliance mondiale (global alliance) qui commence par le Canada, dans un communiqué de PwC Canada daté de Toronto que relaie un court billet de Cohere. Le partage des rôles est net : Cohere fournit North, ses modèles d’entreprise et ses outils de recherche d’information ; PwC apporte son expertise sectorielle, réglementaire, de gestion des risques et de transformation, du choix des cas d’usage à l’intégration de l’IA aux données et aux systèmes de l’entreprise. Les usages annoncés couvrent la recherche d’entreprise, l’accès aux connaissances, la recherche approfondie, l’aide à la décision et l’automatisation de tâches, en cloud privé, sur site ou en environnement déconnecté, avec les secteurs réglementés pour cible première. Le communiqué cite Domenic Marino et Annie Veillet, de PwC Canada, et Aidan Gomez, de Cohere ; il ne donne ni montant, ni client, ni calendrier au-delà du Canada. Cohere avait déjà conclu une alliance avec OpenText le 16 septembre.
🔗 Billet de Cohere sur l’alliance avec PwC 🔗 Communiqué de PwC Canada
Modèles ouverts : Beam, MetaEncoder-30B et Gemma 4 en génomique végétale
Trois modèles ouverts font l’actualité du jour, à trois stades différents : l’un est promis, l’autre mis en ligne sans annonce, le dernier mis en avant un mois après sa publication.
Beam : le modèle ouvert de 501 milliards de paramètres de Reflection AI
5 octobre — Reflection AI présente Beam, son premier modèle à poids ouverts : un MoE clairsemé de 501 milliards de paramètres, dont 23 milliards actifs, conçu pour le code, le raisonnement et les tâches agentiques, et entraîné de bout en bout à partir de zéro. Le pré-entraînement a porté sur 23 800 milliards de tokens ; la phase d’apprentissage par renforcement a mobilisé 10 500 GPU NVIDIA GB300 pendant quatre semaines et produit plus de 100 millions de trajectoires (rollouts).
Selon les tableaux de Reflection AI :
| Benchmark évalué | Beam | Nemotron 3 Ultra | GLM 5.3 | Kimi K3 | Qwen 3.8 Max | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|---|
| SWE-bench Verified | 80,9 | 70,7 | — | — | — | — |
| SWE Bench Pro v1 | 65,5 | 46,4 | — | — | 67,7 | — |
| Terminal Bench v2.1 | 80,1 | 56,4 | 88,2 | 88,3 | 86,6 | 90,6 |
| DeepSWE v1.1 | 44,4 | — | 61,0 | 68,0 | 51,0 | 74,2 |
Un tiret signale un score non rapporté dans le billet. Reflection AI revendique des scores de raisonnement comparables à ceux de GLM-5.2 avec 3 à 4 fois moins de calcul d’inférence, et reconnaît que Kimi K3 reste devant en capacité brute. Rien n’est encore téléchargeable : Beam est en évaluations finales et en tests adverses (red-teaming), l’accès anticipé passe par une inscription, et les poids, le rapport technique, la fiche du modèle et des outils pour développeurs sont promis plus tard en octobre.
🔗 Billet de Reflection AI sur Beam
MetaEncoder-30B, l’encodeur de décision que Meta met en ligne sans annonce
5 octobre — Meta a mis en ligne sur Hugging Face, sous son organisation facebook, MetaEncoder-30B, sans annonce trouvée : le dépôt, créé le 30 septembre et modifié le 5 octobre, ne comptait que deux téléchargements au moment de notre relevé. La fiche présente un encodeur multimodal « System One », le format des modèles de décision de Jev : on lui donne une tâche en langage naturel (question, instruction, description d’état, critères) et une liste de candidats, en texte avec images et vidéos en appui, et il note chaque candidat. Tâche et candidats étant encodés séparément, la comparaison se réduit à un produit scalaire, et un index de plus proches voisins peut couvrir des millions de candidats sans relancer le modèle. MetaEncoder est un affinage contrastif de Muse Glimmer 30B, le modèle agentique à poids ouverts sorti par Meta en août, dont il hérite la licence Apache 2.0 ; le téléchargement passe par l’acceptation de conditions, et vLLM le sert pour le texte et l’image.
| Banc d’évaluation | Score selon la fiche du modèle | Métrique utilisée |
|---|---|---|
| JEVBench (original / facile / difficile) | 0,9444 / 1,0000 / 0,7387 | Exactitude |
| ImaJEV-Bench | 0,8958 | Exactitude |
| NanoBEIR | 0,6632 | NDCG_linear@10 |
| MMEB-V3 (image / vidéo / documents visuels) | 0,7897 / 0,6046 / 0,8138 | Hit@1 / Hit@1 / NDCG@5 |
🔗 Fiche de MetaEncoder-30B sur Hugging Face
Living Models associe Gemma 4 et BOTANIC-1 pour décoder l’ADN des plantes
5 octobre — Google met en avant, dans un X Article de @GoogleAI et sur sa vitrine Gemmaverse, le travail de Living Models, un laboratoire de biologie IA basé à Paris. Gemma 4 E4B y orchestre l’analyse (chaînes de traitement en terminal, filtrage des données, appels d’outils), en local via Ollama sur un seul GPU NVIDIA L4, tandis que BOTANIC-1, un modèle de fondation génomique pré-entraîné sur 320 espèces végétales, évalue l’effet des mutations ; les génomes propriétaires restent sur site. Le cas d’étude reprend une découverte menée à l’INRAE par Adnane Boualem : une seule lettre changée dans le gène CmEIN3 du melon fait passer la fleur de femelle à hermaphrodite. Sur les 2 494 mutations ponctuelles candidates, la mutation validée sort première, sans ex aequo, en moins de quatre minutes selon l’X Article.
| Configuration testée (20 exécutions) | Recall@1 |
|---|---|
| Sans guidage | 0,00 |
| Guidage expert | 0,15 |
| Avec le score de BOTANIC-1 | 0,90 |
Les modèles Botanic1 (de 0,3 à 2 milliards de paramètres) et la prépublication bioRxiv datent de début septembre : la nouveauté est cette mise en avant par Google et le détail des résultats.
🔗 X Article de Google AI 🔗 Page Gemmaverse de Google DeepMind
Publicité dans ChatGPT : un format visuel en test et une mesure élargie
5 octobre — OpenAI prépare un format publicitaire visuel pour ChatGPT : des images montreront l’inspiration autour d’un produit, son usage ou l’expérience qu’il rend possible. Le premier test aura lieu pendant la génération d’images, avec des publicités clairement étiquetées et séparées de l’image en cours de création ; il commencera plus tard ce mois-ci aux États-Unis, avec un premier groupe d’annonceurs. OpenAI rappelle que la publicité n’influence pas les réponses de ChatGPT, qui touche selon l’entreprise 1,2 milliard de personnes chaque semaine.
L’essentiel des annonces porte sur la mesure : envoi des conversions via Hightouch, Tealium et LiveRamp, dix partenaires d’attribution nommés (dont AppsFlyer, Adjust et Triple Whale), expériences géographiques d’incrémentalité avec Haus, Measured et WorkMagic, fenêtre de conversion post-impression d’un jour dans les rapports et indicateur de qualité des signaux (Event Quality Score). Côté sécurité des marques, les annonceurs éligibles peuvent exclure des expressions (Negative Phrases), et des pilotes d’évaluation sont en préparation avec DoubleVerify et Integral Ad Science. Le pixel et la Conversions API existent, eux, depuis le 5 mai.
| Résultat publié par OpenAI | Valeur publiée | Mesure réalisée par |
|---|---|---|
| Coût par acquisition de WeightWatchers face à son benchmark de recherche payante | −15,3 % | DV Rockerbox |
| Achats incrémentaux de la marque Dose réalisés par de nouveaux clients | 67 % | WorkMagic |
| Visiteurs de Portland Leather venus des ChatGPT Ads et nouveaux pour la marque | 93 % | Triple Whale |
🔗 Billet d’OpenAI sur le nouveau format publicitaire 🔗 Billet du blog Ads sur la mesure
Changelog de Perplexity du 5 octobre : extension de navigateur pour Computer, Wiley et Stripe Projects
5 octobre — Perplexity publie un changelog produit de 18 rubriques, sans relais sur X au moment de notre relevé. Huit reprennent des annonces déjà couvertes (Automations, Claude Opus 5.5, génération vidéo, Skills American Express, Portable Computer sur AMD, Fast Search, Profiles de l’Agent API, Claude Fable 5.1), une neuvième ajoute des explications 3D interactives aux graphiques du 1er octobre, et neuf nouveautés sont inédites :
| Nouveauté inédite | Plateforme ou version | Public concerné |
|---|---|---|
| Extension pour Chrome, Edge ou Brave, qui laisse Computer utiliser le navigateur (Comet reste le défaut) | Perplexity pour Mac 26.38.0 et suivantes | Non précisé |
| Tâches Computer dans des onglets et des fenêtres séparés | Perplexity pour Mac 26.37.1 et suivantes | Non précisé |
| Mode d’effort (Light, Standard, High, Ultra) sur mobile | iOS 26.38.0 et Android 2.100.0, et suivantes | Pro, Max, Enterprise Pro, Enterprise Max |
| Revues et livres de Wiley sans abonnement Wiley séparé | Perplexity et Computer | Tous les forfaits, quotas premium variables |
| GPT-6.1 Sol, qui anime aussi l’effort Light de Computer à la place de GPT-6 Sol | Perplexity et Computer | Abonnés payants éligibles |
| Conversation guidée pour lancer une première tâche Computer | Web | Nouveaux comptes gratuits |
| Connexion d’une application depuis la zone de saisie (Connect an app) | Computer sur le Web | Non précisé |
| Connecteur DocSend pour les salles de données d’investissement (deal rooms) | Computer | Compte DocSend éligible |
| Stripe Projects : clé de l’API Perplexity créée depuis la CLI de Stripe | CLI de Stripe | Développeurs de l’API Perplexity |
Avec Stripe Projects, une commande crée ou relie le projet, génère la clé et l’écrit dans le fichier .env, une configuration que Perplexity propose de confier à Claude Code, Cursor ou Codex.
🔗 Changelog de Perplexity du 5 octobre
Création générative : Suno Albums et HyperFrames Studio de HeyGen
Suno ajoute les albums
5 octobre — Suno ajoute les albums, absents jusqu’ici de sa plateforme. Selon le billet qui accompagne l’annonce, la fonction transforme ses meilleurs morceaux en projets complets (full-length projects), et une liste de lecture (playlist) qui servait d’album peut désormais être convertie en Album. Suno présente les artistes de cinq premiers albums : naenia (Oakwood///diskrot), Old Soul (Isaiah Wallace), phenomenal (KakerMix///diskrot), Lost In a Dream (Dream Relic) et VOID (ECHLO). L’éditeur ne précise ni les forfaits concernés, ni le nombre de titres par album, ni la date exacte de mise en service. En juin, Suno interrogeait déjà sa communauté sur son expérience d’écoute, entre listes de lecture, albums et radios.
🔗 Annonce de Suno sur X 🔗 5 Albums You Can’t Miss, blog de Suno
HyperFrames Studio, l’éditeur vidéo de HeyGen conçu pour les agents
5 octobre — HyperFrames, le cadre open source de HeyGen qui transforme du code HTML en vidéo, devient une application de bureau. HyperFrames Studio se présente comme un éditeur vidéo construit pour les agents, à partir de zéro : on décrit la vidéo voulue, l’agent (Claude Code, Codex ou un agent maison) livre un premier montage, puis l’humain et l’agent travaillent sur la même ligne de temps (timeline). La direction passe par le geste plutôt que par le prompt : entourer un élément de l’image, épingler un commentaire à un mot ou couper soi-même. L’application exporte en 4K et revendique des centaines d’inspirations et de modèles ; elle est gratuite selon le compte HyperFrames sur X, et seule une version macOS est proposée au téléchargement. Elle prolonge l’aperçu Studio Preview de juillet, qui permettait déjà d’éditer visuellement une vidéo générée par code.
🔗 Annonce de HyperFrames Studio 🔗 Relais de HeyGen
Brèves
- Warp Factories vers la disponibilité générale — Dans un billet du 3 octobre sur son séminaire d’automne, Warp indique que Warp Factories, son infrastructure d’agents, est en train de passer de l’accès anticipé à la disponibilité générale, sans date ni tarif ; l’équipe dit avoir réduit de 70 % son coût par PR sur le dernier mois en s’appuyant dessus. 🔗 source
- Notes de version de Devin du 2 octobre — Les réglages d’accès de Microsoft Teams sont désormais appliqués, un clic sélectionne tous les constats de sécurité d’une même gravité (API v3 comprise) et les plugins proposés montrent leurs skills, MCP, hooks et règles avant installation ; les constructions d’environnement sur de gros dépôts Perforce disposent de 3 heures au lieu d’échouer après 10 minutes. 🔗 source
- MCP TikTok Ads dans Replit — Replit ajoute TikTok Ads à son catalogue de plus de 450 intégrations : une fois le compte connecté, son Agent peut créer et gérer des publicités TikTok, atteindre des audiences et mesurer les performances depuis l’espace de travail, sans crédits consommés pour la connexion. 🔗 source
- Cockle Finance sur Replit — Replit épingle une vidéo sur Cockle Finance, dont l’outil a été construit sur Replit par Dan et son père Steve pour suivre l’afflux de clients ; selon Replit, Dan a fait croître son activité de 15 % en trois mois, sans préciser la mesure. 🔗 source
- Copilot CLI 1.0.92 en stable — Cette version réunit les nouveautés des préversions 1.0.92-0 à -5 ; seul inédit, après une connexion Microsoft Entra, l’utilisateur choisit le compte à utiliser,
/logoutferme ces sessions OAuth et les serveurs MCP protégés par Entra renouvellent leurs identifiants sans intervention. 🔗 source - Codex CLI 0.160.1 — Ce correctif de la 0.160.0 ne contient qu’un rétroportage : les variables Windows SYSTEMROOT, TEMP et TMP sont conservées au lancement de serveurs MCP stdio distants dont l’environnement distant est configuré explicitement ; c’est la dernière stable, aucune 0.161.0 stable n’étant sortie. 🔗 source
- Nightly de Gemini CLI du 5 octobre — Elle ne contient aucun changement : bâtie sur le même commit que celle du 3 octobre, elle ne diffère que par les numéros de version, et les canaux stable (v0.62.0) et de préversion (v0.63.0-preview.0) restent inchangés. 🔗 source
- SDK TypeScript de SpaceXAI 0.2.1 — Publiée le 2 octobre, cette version ajoute
toJson(schema), qui valide la sortie structurée avec un validateur Standard Schema (Zod, Valibot ou ArkType), et l’optionretryBeforeOutput, qui relance une requête en flux continu (streaming) échouée avant toute sortie ; un 429 sans en-tête Retry-After attend désormais à partir d’une seconde, jusqu’à 30 secondes, au lieu de 250 millisecondes. 🔗 source - Cresta Conductor sur le Claude Agent SDK — Dans la série d’Anthropic consacrée aux startups qui construisent avec Claude, Cresta présente Conductor, un constructeur d’agents de relation client en langage naturel bâti sur le Claude Agent SDK ; selon Cresta, il a réduit d’environ moitié le temps de déploiement initial dans ses premiers cas d’usage, sans date de disponibilité ni tarif. 🔗 source
- npm : expiration des configurations de publication de confiance — Depuis le 2 octobre, une configuration de publication de confiance (trusted publishing) qui n’a servi à aucune publication expire 48 heures après sa création, et npm refuse aussi les jetons issus d’événements
issue_commentde GitHub Actions, comme pourpull_request_target. 🔗 source - npm : la publication en attente crée des paquets — Depuis le 2 octobre,
npm stage publishpeut créer un paquet qui n’existe pas encore, avec une session locale ou un jeton granulaire, y compris limité à la mise en attente (stage-only) ; la première version attend la promotion d’un mainteneur avant d’être installable. 🔗 source - Agent API de Perplexity sur Fast Search — Les préréglages low, medium et high de l’Agent API utilisent désormais Fast Search pour l’outil
web_search, de 2,50 à 1 dollar les 1 000 invocations et environ 800 ms plus rapide ; le préréglage xhigh garde la recherche standard. 🔗 source - Guide RAG de Perplexity — Perplexity publie un guide de neuf exemples de génération augmentée par récupération (retrieval-augmented generation, RAG) et de sept architectures, en se citant pour son index web et sa fonction Instant Buy à côté d’exemples tiers comme Zendesk ou GitHub Copilot ; aucune nouveauté produit. 🔗 source
- Effectifs de Cohere — Selon Cohere, l’entreprise est passée d’environ 400 salariés au début de 2026 à plus de 800 aujourd’hui, chiffre donné dans un message de recrutement. 🔗 source
- IsoVGRBench et Logbook chez Meta — Sans annonce, facebookresearch publie le code d’IsoVGRBench, qui évalue les modèles de récompense vidéo sur 16 000 paires ne différant que sur un aspect (face au même clip aux images mélangées, ces modèles répondent quasiment au hasard), et celui de Logbook, consacré aux événements d’enregistrements audio très longs. 🔗 source
- FiftyOne lit les jeux LeRobot v3 — Selon un billet communautaire de Harpreet Sahota, la boîte à outils open source FiftyOne lit désormais nativement le format LeRobot v3, sans convertisseur ni copie des vidéos ; la démonstration porte sur 497 épisodes tirés des 50 types de robots du jeu communautaire de LeRobot. 🔗 source
- FetchMan-data d’Ai2 — Publié le 1er octobre sans annonce, ce jeu réunit 352 696 épisodes simulés (52 millions de trames, 902 consignes) de préhension d’objets par un humanoïde Unitree G1, générés dans MolmoSpaces, au format LeRobot v3 et sous licence ODC-BY. 🔗 source
- P(doom) sur les profils Hugging Face — Les utilisateurs du Hub peuvent afficher sur leur profil leur P(doom), leur estimation de la probabilité que l’IA provoque une catastrophe existentielle ; les réponses alimentent une enquête dont seuls des résultats agrégés et anonymisés seront publiés, dans deux semaines. 🔗 source
- Extension hf-image — Hugging Face ouvre, sans annonce, une extension de son CLI qui construit, pousse, tire et lance des images de conteneurs sur son registre cr.hf.co ; les couches non compressées sont dédupliquées par Xet, si bien qu’une couche de 2 Go modifiée de 100 Mo n’envoie qu’environ 100 Mo selon le README. 🔗 source
- Trois expériences de Milos Kotlar — Dans trois billets communautaires, Milos Kotlar rend le cache KV d’un petit transformeur 2,71 fois plus compact avec 97,85 % d’accord sur le prochain token, et fait passer la part de tokens sans expert d’un routage MoE de 13,84 % à 8,09 %, sans aucun gain de vitesse. 🔗 source
- Audit d’un juge LLM par Stephen Yu — Stephen Yu a audité, sur 38 400 échantillons, le juge GLM-5.3 qui note la fidélité aux faits dans la récompense GRPO de son modèle de réécriture de 12B : fiable pour repérer qu’un fait a changé, bruité sur sa gravité ; compter les sorties fautives révèle une baisse de 39 % que le premier comptage masquait. 🔗 source
- Symposium de Sakana AI à Tokyo — Sakana AI ouvre les inscriptions à un symposium gratuit le 26 octobre au Hitotsubashi Hall de Tokyo, en anglais, avec une conférence de Jürgen Schmidhuber et un entretien avec David Ha, PDG de Sakana AI. 🔗 source
- Startups NVIDIA Inception et cancer du sein — NVIDIA présente quatre startups de son programme Inception qui appliquent l’IA au parcours de soin, dont iSono Health et son échographe 3D ATUSA autorisé par la FDA (environ deux minutes par sein contre jusqu’à 45 minutes à la main), Whiterabbit.ai, Ataraxis AI et SimBioSys ; certaines de ces technologies ne sont pas approuvées par la FDA. 🔗 source
Ce que ça signifie
La provenance du texte devient une obligation réglementaire. Jusqu’ici, la traçabilité des contenus générés portait surtout sur l’image et l’audio, avec des filigranes et des métadonnées vérifiables ; l’AI Act étend l’exigence au texte, et OpenAI y répond par étapes : filigrane appliqué d’office au texte de ChatGPT et de Codex dans l’Union européenne, simple option dans l’API, détecteur réservé à des organisations approuvées. Les chiffres publiés expliquent cette prudence : environ 95 % des passages de 400 tokens sont détectés sur un contenu de type psychologie, à 1 % de faux positifs visés, mais sur des passages de 400 tokens en anglais, remplacer 10 % des mots par des synonymes ramène la détection d’environ 92 % à 66 %, et une réécriture ou une traduction peut effacer le filigrane. Le filigrane donne un indice de provenance, pas une preuve, et son absence ne dit rien de l’auteur.
La mémoire des agents s’installe et commence à se standardiser. Devin garde ses leçons dans un dépôt Git de fichiers Markdown que Dreaming réorganise chaque jour, et Cognition en publie le format sous licence MIT pour que d’autres agents l’adoptent ; North 2 conserve le contexte d’une session à l’autre ; Qwen Code branche Mem0 directement sur son CLI. Les approches diffèrent, entre fichiers versionnés lisibles par un humain, service de mémoire externe et fonction intégrée à une plateforme, mais elles répondent au même besoin : qu’un agent ne reparte pas de zéro à chaque session. Le choix de Cognition a un avantage pratique : chaque note renvoie à la session où elle a été apprise, se consulte dans l’interface et garde son historique Git, ce qui permet de lire et de corriger ce que l’agent a retenu.
Les modèles ouverts entrent dans les outils de code par plusieurs portes. Together Link les branche sur des agents existants, Claude Code et Codex compris, en annonçant une dépense réduite de plus de moitié ; IBM fait tourner la version auto-hébergée de Bob sur Nemotron 3 Ultra pour les entreprises qui gardent leur développement sur leur propre infrastructure, jusqu’aux environnements déconnectés ; Reflection AI présente Beam comme un modèle ouvert taillé pour le code et les tâches agentiques, avec 80,9 sur SWE-bench Verified selon ses propres tableaux. L’argument commun tient moins au score brut, où Reflection AI reconnaît que Kimi K3 reste devant, qu’au coût, à la latence et au contrôle des données.
Beaucoup de chiffres du jour viennent de ceux qui les publient. GitHub a conçu ReviewBench et produit le classement initial où Copilot code review arrive en tête, sans exécution ni vérification par les autres éditeurs ; la latence de Nemotron 3 Ultra vient de tests internes d’IBM ; les économies de Together Link et les résultats publicitaires de ChatGPT sont ceux qu’annoncent Together AI et OpenAI. GitHub publie toutefois son jeu de données, son juge et sa méthodologie, et ouvre les soumissions : chaque éditeur peut refaire la mesure avec son propre agent. C’est ce qui permettra de dire si ce classement initial tient.
Sources
- Our approach to EU text provenance rules (OpenAI)
- Fil d’OpenAI sur les limites du filigrane
- Memory and dreaming: how Devin learns from working with you (Cognition)
- Fil de Cognition sur X
- Agent Memory Repo
- Fil de Cursor sur le SDK
- Changelog du SDK de Cursor
- Qwen Code v0.25.0 sur GitHub
- Together Link (Together AI)
- Documentation de Together Link
- Why IBM chose NVIDIA Nemotron for IBM Bob self-hosted
- ReviewBench: An open benchmark for AI code review (GitHub Blog)
- Site ReviewBench
- North 2: Enterprise AI Without Compromises (Cohere)
- Fil de lancement de North 2 (Cohere sur X)
- Alliance de Cohere et PwC (blog de Cohere)
- Communiqué de PwC Canada
- Introducing Beam (Reflection AI)
- MetaEncoder-30B sur Hugging Face
- X Article de Google AI sur Living Models
- Living Models sur Gemmaverse (Google DeepMind)
- Building advertising for the way people use AI (OpenAI)
- More ways to measure ChatGPT Ads
- Changelog de Perplexity du 5 octobre
- Annonce des albums par Suno
- 5 Albums You Can’t Miss (Suno)
- Annonce de HyperFrames Studio
- Relais de HeyGen
- Build The Factory. Let It Run. Go Kayaking. (Warp)
- Notes de version de Devin du 2 octobre
- MCP TikTok Ads dans Replit
- Cockle Finance sur Replit
- Copilot CLI v1.0.92
- Codex CLI 0.160.1
- Nightly de Gemini CLI du 5 octobre
- SDK TypeScript de SpaceXAI v0.2.1
- Cresta et le Claude Agent SDK (blog claude.com)
- Unvalidated npm trusted publishing configurations now expire
- npm staged publishing now supports creating new packages
- Changelog de l’API Perplexity
- 9 RAG Examples (blog Perplexity)
- Effectifs de Cohere
- Dépôt IsoVGRBench
- FiftyOne et LeRobot v3 (Harpreet Sahota)
- FetchMan-data sur Hugging Face
- P(doom) sur le Hub (changelog Hugging Face)
- Dépôt hf-image
- Cache KV sous budget KL (Milos Kotlar)
- Audit du juge LLM (Stephen Yu)
- Symposium de Sakana AI
- From Scan to Treatment Plan (NVIDIA)