Rechercher

ChatGPT revient sur WhatsApp, GitHub Copilot CLI plus fiable, Anthropic étudie les valeurs de Claude

ChatGPT revient sur WhatsApp, GitHub Copilot CLI plus fiable, Anthropic étudie les valeurs de Claude

OpenAI ramène ChatGPT sur WhatsApp en Europe et l’étend à deux nouvelles messageries, GitHub améliore la fiabilité de Copilot CLI et Amp change la manière dont ses agents committent le code. Côté recherche, Anthropic publie une étude sur les valeurs exprimées par Claude selon les langues, tandis qu’Ai2 et Sakana AI détaillent respectivement un agent de surveillance maritime en production et une expérience d’intelligence collective physique.


ChatGPT de retour sur WhatsApp dans l’EEE, extension à Kakao et Viber

13 juillet — ChatGPT est de nouveau disponible sur WhatsApp dans l’Espace économique européen (EEE), après une période d’indisponibilité dans la zone. L’accès se fait via le contact vérifié 1-800-CHATGPT, qui permet de poser des questions, envoyer des images, envoyer des notes vocales, générer des images et utiliser ChatGPT dans de nombreuses langues, directement dans l’application de messagerie.

OpenAI étend en parallèle la disponibilité de ChatGPT à deux nouvelles applications : Kakao en Corée du Sud et Viber, dans les marchés pris en charge. La stratégie est claire : rendre l’assistant accessible dans les applications de messagerie déjà utilisées au quotidien, plutôt que de forcer le passage par l’app ou le site ChatGPT dédiés.

🔗 Annonce — @ChatGPTapp


GitHub Copilot CLI v1.0.42 : délégation aux subagents plus fiable

13 juillet — GitHub publie la version 1.0.42+ de Copilot CLI, installable via la commande /update. Cette mise à jour introduit une délégation aux subagents plus intelligente (smarter subagent delegation), pensée pour rendre les sessions de code plus rapides et plus fiables, sans détail technique sur la méthode de mesure.

Type d’échec mesuréRéduction annoncée
Échecs d’outils-23%
Échecs de recherche-27%
Échecs d’édition-18%

GitHub précise qu’aucune régression de qualité n’a été constatée malgré ces changements.

🔗 Annonce — @github


Les orbs d’Amp peuvent désormais committer au nom de l’utilisateur

11 juillet — Amp ajoute, dans ses réglages de projet, une option permettant aux orbs (les machines qui exécutent les agents à distance) de committer sous l’identité de l’utilisateur plutôt que sous celle d’Amp, avec une mention co-authored-by associée au commit.

You can now make Amp orbs commit as you, not Amp (+ co-authored-by you). It’s in project settings. Useful for, e.g., pushing to a repo where Vercel only deploys for known committers.

🇫🇷 Vous pouvez désormais faire en sorte que les orbs Amp committent en votre nom, et non au nom d’Amp (avec une mention co-authored-by vous). C’est dans les réglages de projet. Utile par exemple pour pousser vers un dépôt où Vercel ne déploie que pour des committers connus.@sqs sur X


Anthropic étudie les valeurs exprimées par Claude selon les modèles et les langues

13 juillet — Anthropic prolonge ses travaux sur les valeurs exprimées par Claude en conversation (plus de 3 000 valeurs identifiées, comme l’honnêteté ou la chaleur humaine) en analysant comment elles varient selon le modèle utilisé et selon la langue. L’étude s’appuie sur plus de 300 000 conversations anonymisées, regroupées en quatre axes.

Axe (français / original)Ce qu’il mesure
Déférence vs Prudence (Deference vs. Caution)Tendance à suivre l’utilisateur ou à le tempérer
Chaleur vs Rigueur (Warmth vs. Rigor)Ton chaleureux ou exigence de preuves
Profondeur vs Concision (Depth vs. Brevity)Réponses développées ou synthétiques
Franchise vs Exécution (Candor vs. Execution)Critique directe ou simple exécution

Les écarts entre modèles restent modestes (Sonnet 4.6 plus enjoué et validant, Opus 4.7 plus enclin aux critiques franches), mais les différences les plus marquées apparaissent selon la langue : Claude penche vers la chaleur en hindi et en arabe, vers la rigueur en russe, où il demande plus souvent des preuves à l’appui des affirmations de l’utilisateur.

🔗 Annonce — @AnthropicAI


Ai2 détaille les coulisses de Shippy, son agent de surveillance maritime

13 juillet — Ai2 (AllenAI) publie un retour d’expérience sur Shippy, l’agent construit par son équipe Skylight pour la surveillance du domaine maritime : détection d’événements de pêche, suivi de navires, zones protégées. L’agent sert aujourd’hui plus de 300 partenaires dans plus de 70 pays.

The real work wasn’t the model. It was building a system we could trust to be correct, to stay within appropriate boundaries.

🇫🇷 Le vrai travail n’était pas le modèle. C’était de construire un système en qui nous pouvions avoir confiance pour être correct, pour rester dans des limites appropriées.Ai2 Blog

Techniquement, Shippy repose sur OpenClaw (framework agent open source) avec Claude Opus 4.6 comme modèle, structuré en trois briques — une « âme » (le prompt système et ses garde-fous), des « compétences » (skills) et une « config » (paramètres et choix du modèle). L’isolation entre agences clientes passe par Mothership, une plateforme maison qui provisionne un déploiement Kubernetes par session utilisateur, et l’évaluation par le framework Harbor, où un LLM-juge note les réponses avec un raisonnement écrit.


Sakana AI fait collaborer près de 200 briques physiques pour reconnaître leur propre forme

12 juillet — Sakana AI, avec l’IT University of Copenhagen et Autodesk, publie une recherche sur l’intelligence collective physique : des « briques cellulaires » — modules matériels cubiques exécutant localement le même réseau de neurones (automates cellulaires neuronaux, Neural Cellular Automata) — infèrent collectivement la forme globale qu’elles composent, sans contrôleur central.

At Sakana AI, a recurring theme in our research is collective intelligence: the observation that sophisticated, robust behavior can arise from many simple parts following local rules, with no central controller, as it does in a colony, a tissue, or a brain.

🇫🇷 Chez Sakana AI, un thème récurrent de notre recherche est l’intelligence collective : l’observation qu’un comportement sophistiqué et robuste peut émerger de nombreuses parties simples suivant des règles locales, sans contrôleur central, comme c’est le cas dans une colonie, un tissu ou un cerveau.Sakana AI Blog

Testé sur près de 200 briques et quatre formes assemblées (avion, guitare, bateau, table), le système atteint 100% de précision de classification en 60 cycles (environ 3 minutes), reste robuste jusqu’à 5% de modules défaillants, détecte des dommages structurels avec 94,8% de précision, et passe à l’échelle en simulation jusqu’à des grilles de plus de 18 000 cubes.


Google DeepMind présente le Skill « Predicting the Past » dans Google Antigravity

13 juillet — Google DeepMind détaille un Skill nommé « Predicting the Past », exécuté dans Google Antigravity sans aucune compétence en programmation requise, qui analyse des textes et artefacts anciens. Trois cas d’usage sont documentés : la datation et localisation d’une tablette de malédiction (curse tablet) romaine vieille de 1 800 ans à l’aide du modèle Aeneas, la cartographie du culte des Aufaniae à travers l’Europe (jusqu’à un autel isolé en Espagne, érigé par un vétéran romain), et la reconstruction du réseau des visiteurs de l’oracle de Dodone à partir de tablettes de plomb antiques.

Le Skill génère à chaque fois une explication de sa prédiction, comme un commentaire épigraphique destiné aux experts du domaine.

🔗 Annonce — @GoogleDeepMind


Brèves

  • Amp prépare des threads collaboratifs multi-utilisateurs — un thread Amp peut déjà être suivi depuis de nombreux clients simultanément, mais uniquement sous le compte de son créateur ; l’équipe travaille à une collaboration multi-comptes sur le même thread. 🔗 @sqs sur X
  • Une version native macOS d’Amp est en développement — sans différence fonctionnelle attendue par rapport à la web app actuelle et sans date annoncée. 🔗 @sqs sur X
  • GitHub sépare les pages SSO et Organisations — la page combinée des paramètres utilisateur est scindée en deux pages distinctes pour plus de clarté. 🔗 Changelog GitHub
  • HeyGen CLI : musique et effets sonores en ligne de commande — recherche et téléchargement gratuits du catalogue musique/SFX de HeyGen depuis le terminal, avec démonstration d’un agent synchronisant les sons sur le rythme d’une vidéo. 🔗 @HeyGen sur X

Ce que ça signifie

La distribution redevient un terrain de bataille pour les assistants grand public. Le retour de ChatGPT sur WhatsApp dans l’EEE et son extension à Kakao et Viber montrent qu’OpenAI mise sur la présence dans les applications déjà installées plutôt que sur l’attraction vers ses propres interfaces. C’est une logique de canal de distribution plus que de fonctionnalité : l’assistant va où sont déjà les utilisateurs, quitte à revenir sur des marchés régulés comme l’Europe après une interruption.

La fiabilité des agents devient un axe d’ingénierie à part entière, pas un sous-produit du modèle. GitHub chiffre précisément les gains de sa nouvelle délégation aux subagents (-23% d’échecs d’outils, -27% de recherche, -18% d’édition), et Ai2 formule la même leçon en creux avec Shippy : la fiabilité en production vient des outils déterministes, des garde-fous explicites et d’une infrastructure isolée, pas seulement du modèle choisi. Les orbs d’Amp qui committent désormais au nom de l’utilisateur relèvent de la même préoccupation opérationnelle — s’intégrer proprement dans des pipelines de déploiement existants.

La recherche sur le comportement des modèles s’étend au-delà du texte. L’étude d’Anthropic sur les valeurs exprimées par Claude selon les langues révèle que les écarts culturels (chaleur en hindi et en arabe, rigueur en russe) pèsent davantage que les écarts entre versions du modèle. Les briques cellulaires de Sakana AI posent une question adjacente mais distincte : peut-on obtenir un comportement intelligent et robuste sans modèle central, à partir de règles locales identiques répétées à grande échelle — une piste pour des systèmes physiques capables de s’auto-diagnostiquer.

L’IA sans code progresse vers des usages experts très spécialisés. Le Skill « Predicting the Past » de Google DeepMind, appliqué à l’épigraphie et à l’archéologie, illustre comment des workflows complexes deviennent accessibles à des chercheurs sans compétence en programmation, ouvrant des domaines de niche à des utilisateurs qui n’auraient pas pu construire ces outils eux-mêmes.


Sources