Pas de nouveau modèle ce dimanche, mais deux nouveautés concrètes pour les développeurs. DeepSeek V4.1 Flash, sorti le 10 septembre, arrive sur Together AI au tarif des heures pleines de DeepSeek, et Together le dit trois fois moins cher par tâche que GPT-5.6 Sol, une revendication à lire avec ses nuances ; Perplexity permet de son côté d’enregistrer une fois pour toutes un serveur MCP dans son Agent API. Sakana AI revient sur un numéro spécial de la Royal Society, et trois contributeurs du blog communautaire de Hugging Face s’intéressent, chacun à sa manière, à la vérification des résultats.
Together AI sert DeepSeek V4.1 Flash et le dit trois fois moins cher par tâche que GPT-5.6 Sol
13 septembre — DeepSeek V4.1 Flash arrive sur Together AI, en serverless comme en déploiement dédié, à 0,30 dollar par million de tokens en entrée et 1,20 dollar en sortie : exactement les prix de l’API DeepSeek aux heures pleines, que DeepSeek divise par deux en heures creuses.
Together affirme, mesures d’Artificial Analysis à l’appui, que le modèle bat GPT-5.6 Sol sur les benchmarks agentiques pour un tiers du coût par tâche :
| Mesure comparée | DeepSeek V4.1 Flash | GPT-5.6 Sol (high) |
|---|---|---|
| AutomationBench-AA | 69 % | 55 % |
| Terminal-Bench v4.0 | 27 % | 21 % |
| GDPval-AA v2 | 1632 | 1524 |
| Coût moyen par tâche (Intelligence Index) | 0,27 dollar | 0,81 dollar |
Deux nuances : la fiche de Together place elle-même V4.1 Flash derrière GPT-5.6 Sol en raisonnement (90,9 contre 94,1 % sur GPQA Diamond, 36,8 contre 47 % sur HLE), et sur Terminal-Bench v4.0, l’avantage mesuré par Artificial Analysis s’inverse dans le tableau publié par DeepSeek le 10 septembre, qui donnait 31,2 à V4.1 Flash contre 39,9 à GPT-5.6 Sol.
🔗 Annonce de Together AI sur X
Perplexity ouvre son Agent API aux connecteurs personnalisés, un serveur MCP enregistré une fois pour toutes
13 septembre — Perplexity ajoute à son Agent API les connecteurs personnalisés (custom connectors). Un administrateur enregistre une seule fois un serveur MCP distant dans les connecteurs de son projet (Project) : nom, URL, authentification par clé API ou aucune, transport Streamable HTTP ou SSE. Perplexity conserve la clé d’accès du serveur, et les requêtes de toute clé API du projet se contentent de citer l’identifiant du connecteur avec type: "connector".
Avec un serveur MCP passé dans la requête (type: "mcp"), son URL et ses identifiants accompagnent au contraire chaque appel, en Streamable HTTP uniquement. Ces connecteurs prolongent les connecteurs gérés (managed connectors) arrivés le 27 août pour GitHub, Slack, Google Drive et Datadog, six désormais avec Linear et Notion. La découverte des outils, différée par défaut, fait chercher le modèle avant de charger les schémas utiles, d’où un max_steps à prévoir assez haut. Aucun tarif spécifique n’est indiqué.
🔗 Documentation des connecteurs Perplexity 🔗 Changelog de l’API Perplexity
Brèves
- Sakana AI revient sur un numéro spécial consacré aux modèles du monde (world models) — billet en japonais du 12 septembre sur le numéro de Philosophical Transactions of the Royal Society A paru le 14 mai 2026, dont David Ha, PDG de Sakana AI, cosigne l’introduction avec treize autres coauteurs. L’actualité tient au billet, pas à la parution. 🔗 source
- REINFORCE sort d’un piège où la montée de gradient exacte reste bloquée — contribution individuelle au blog communautaire de Hugging Face, et non publication de laboratoire : après quarante-deux tours de vérification par un même lecteur, RDTvlokip montre qu’à 20 000 pas la montée exacte n’aboutit à un code sans ambiguïté (une bijection) dans aucun des 12 essais, contre 11 sur 12 pour REINFORCE. Tous ces chiffres dépendent toutefois de l’optimiseur Adam. 🔗 source
- Phionyx propose un contrat de preuve pour les audits d’IA — autre contribution individuelle : Ali Toygar Abak veut empêcher qu’un tableau de bord ou un rapport élargisse en silence ce qu’une preuve établit, par exemple qu’un appel d’outil refusé finisse présenté comme un incident stoppé par le garde-fou. Sa proposition, huit groupes de métadonnées attachés à chaque affirmation, reste un plan d’ingénierie et de tests, sans résultat expérimental. 🔗 source
- darkc0de propose de juger les modèles d’agents au temps nécessaire pour obtenir un résultat validé — troisième contribution individuelle : Sonny DeSorbo soutient qu’un modèle plus faible mais plus rapide peut se corriger plusieurs fois avant qu’un modèle lent ait fini sa première tentative, et esquisse un benchmark, Persistent Challenge Completion, qui mesure le travail validé par seconde. Une réflexion sans expérimentation, que l’auteur invite à ne pas prendre trop au sérieux. 🔗 source
Ce que ça signifie
Le premier fil concerne l’outillage des agents. Avec les connecteurs personnalisés, un serveur MCP devient une ressource du projet plutôt qu’un paramètre répété dans chaque requête : un administrateur l’enregistre une fois, Perplexity en conserve la clé d’accès, et le code qui appelle l’Agent API n’a plus à le transporter. Perplexity étend ainsi aux serveurs MCP de chacun, protégés par une clé API ou sans authentification, la logique des connecteurs gérés arrivés fin août, et accepte au passage le transport SSE en plus de Streamable HTTP. La contrepartie tient à la découverte différée des outils, qui oblige à laisser au modèle assez d’étapes pour chercher avant d’agir. Brancher un outil devient une opération d’administration, faite une fois pour tout un projet, plus qu’un réglage à reproduire dans chaque appel.
Le second fil tient au prix et à la mesure. Together AI facture un modèle ouvert, publié sous licence MIT, exactement au tarif de DeepSeek aux heures pleines : pour qui peut concentrer ses appels en heures creuses, l’API de DeepSeek reste deux fois moins chère. Le coût par tâche mis en avant se lit, lui, avec ses écarts. La revendication de Together porte sur les benchmarks agentiques, pas sur le raisonnement où V4.1 Flash reste derrière GPT-5.6 Sol, et même sur un test agentique comme Terminal-Bench v4.0, le classement dépend de la source : V4.1 Flash devance GPT-5.6 Sol chez Artificial Analysis (27 contre 21 %), mais le suit dans le tableau de DeepSeek (31,2 contre 39,9). Les trois billets communautaires du jour reviennent chacun à cette exigence de vérification : RDTvlokip a soumis ses résultats à quarante-deux tours de relecture par un même lecteur, Phionyx veut empêcher qu’un rapport élargisse en silence ce qu’une preuve établit, et darkc0de propose de mesurer le travail validé par seconde plutôt que la réussite au premier essai. Qu’il s’agisse d’un score, d’un coût ou d’une conclusion d’audit, la question reste de savoir dans quelles conditions le chiffre a été obtenu.
Sources
- Together AI sur X, DeepSeek V4.1 Flash
- Together AI, fiche du modèle DeepSeek V4.1 Flash
- DeepSeek, page Models & Pricing de l’API
- DeepSeek, changelog de l’API
- Perplexity, documentation des connecteurs de l’Agent API
- Perplexity, changelog de l’API
- Sakana AI, billet sur le numéro spécial de la Royal Society
- Hugging Face, Forty-two more rounds with the same reader
- Hugging Face, Access Is Not Yet Verifiability
- Hugging Face, I love speed. We all love speed