Rechercher

ESPnet triple son corpus vocal ouvert avec YODAS v3, Mistral sert GLM 5.3 sur son API, JEV-27B et OpenDecider revendiquent la parité avec Jev

Article généré par intelligence artificielle
ESPnet triple son corpus vocal ouvert avec YODAS v3, Mistral sert GLM 5.3 sur son API, JEV-27B et OpenDecider revendiquent la parité avec Jev

ESPnet publie YODAS v3, un jeu de données vocal ouvert de 1,1 million d’heures en plus de 100 langues, trois fois plus volumineux que la première version et entièrement en 48 kHz. Mistral sert désormais sur son API GLM 5.3, le modèle à poids ouverts de Z.ai, avec 1 million de tokens de contexte et un SLA de 99,5 %, tandis que JEV-27B et OpenDecider, deux modèles de décision ouverts, revendiquent la parité avec Jev sur les bancs de leurs auteurs. MiniMax lance M3.1-Flash-Preview sans benchmark ni tarif API, et les Brèves reviennent notamment sur une préversion de Copilot CLI qui lit les règles de Claude Code et sur Space Bunny Alpha, un modèle furtif gratuit chez OpenRouter.


ESPnet publie YODAS v3, 1,1 million d’heures de parole ouvertes en 48 kHz

27 septembre — L’équipe ESPnet (William Chen et Shinji Watanabe) publie YODAS v3, un jeu de données vocal multilingue de 1,1 million d’heures, trois fois plus que la première version. Tout l’audio est distribué en 48 kHz, avec en métadonnée la fréquence réellement utile, car beaucoup d’audio du web est suréchantillonné.

Caractéristique de YODAS v3Valeur publiée
Langues couvertesPlus de 100, dont 34 au-delà de 1 000 heures
Audio multicanalPlus de 70 % avec au moins deux canaux distincts
AnnotationsTranscriptions horodatées au mot, traduction anglaise pour plus de la moitié du multilingue
Taille et licence60 To au format OPUS, CC BY 3.0

Selon les auteurs, ce volume suffit à entraîner de zéro un modèle du niveau de Whisper, et la première version, téléchargée plus de 2,5 millions de fois, a servi à entraîner IBM Granite, NVIDIA Canary et Parakeet ou encore OLMoASR d’Ai2. Un article associé figure dans les actes d’Interspeech 2026.

🔗 YODAS v3 sur le blog Hugging Face


Mistral ouvre GLM 5.3 de Z.ai sur son API, avec 1M de contexte et un SLA de 99,5 %

26 septembre — Z.ai a lancé GLM 5.3 le 14 août et ouvert ses poids le 28 : la nouveauté est son arrivée sur l’API Mistral, annoncée par le compte @MistralDevs. En préversion publique sous l’identifiant zai-glm-5-3, le modèle est servi sans modification sur l’infrastructure de Mistral, avec 1 million de tokens de contexte, 128k en sortie, plus de 100 tokens par seconde et un SLA de 99,5 % sur le niveau prioritaire (priority tier).

Tarif par million de tokensAPI MistralTogether AI (29 août)
Entrée1,40 dollar1,40 dollar
Entrée en cache0,14 dollar0,26 dollar
Sortie4,40 dollars4,40 dollars

Mistral avait annoncé le 11 août l’ouverture de sa plateforme aux modèles tiers, en commençant par GLM 5.2, et GLM 5.3 était arrivé le 21 septembre dans Vibe Code, comme modèle par défaut de l’application web.

🔗 Annonce de @MistralDevs · Fiche du modèle


Modèles de décision ouverts : JEV-27B d’AutoTrust AI et OpenDecider face à Jev

Deux billets communautaires du 27 septembre publient, sous licence Apache-2.0, des modèles de décision ouverts. Ces modèles répondent vite, avec une probabilité pour chaque réponse, aux petites questions typées que posent les agents : vrai ou faux, choix parmi plusieurs options, note. Ils arrivent quatre jours après Tev1-4B-experimental de Together AI et se comparent tous deux à Jev 1.13, le modèle fermé et hébergé de TypeSafe AI ; les scores ci-dessous viennent des mesures de leurs auteurs.

JEV-27B d’AutoTrust AI : la parité avec Jev 1.13 en moyenne, selon ses auteurs

27 septembre — AutoTrust AI, qui se déclare sans lien avec TypeSafe AI, publie JEV-27B, un élève de Jev 1.13 distillé sur un corpus ouvert. La recette garde Qwen3.8-27B gelé et lui ajoute un bloc détachable de 108,9 millions de paramètres, entraîné en environ 9,2 heures sur un B200 : le modèle de base reste intact, à 78,0 % sur HumanEval. Scores mesurés par les auteurs le 26 septembre :

Banc de décisionJEV-27BJev 1.13 (API)
JevBench (jeu public)88,7087,18
Kev83,7585,52
OpenJev text73,8972,96
Nimble92,9191,84
VitaminC77,4678,46
MASSIVE-en87,7187,14
Moyenne des six84,0783,85

Sa latence médiane est de 137 ms par décision sur un B200. Les auteurs reconnaissent que la parité ne vaut qu’en moyenne et que l’élève hérite des angles morts de Jev ; ils annoncent des soumissions aux classements indépendants.

🔗 Le billet d’AutoTrust AI

OpenDecider : un nano de 400 millions de paramètres devant Laya et Jev sur typed-decisions

27 septembre — Manjunath Janardhan publie OpenDecider, une famille de modèles de décision : un nano d’environ 400 millions de paramètres sur l’encodeur Ettin, un small de 4 milliards sur Qwen3-4B et des versions MLX pour Mac. Ils sont distillés depuis deux professeurs ouverts, Qwen3-235B et DeepSeek V4.1 Flash, pour moins de 30 dollars de GPU.

Modèle évaluétyped-decisions (2 000)Décisions générales inédites (200)Erreur de calibration
OpenDecider-nano0,7960,6800,092
OpenDecider-small0,6720,7350,087
Laya (checkpoint spécialisé)0,7660,5700,162
Jev 1.13 (API)0,7540,7300,164

Selon ces mesures de l’auteur, le small égale Jev sur des décisions jamais vues, avec une erreur de calibration presque deux fois plus faible. Jev reste devant sur la batterie d’applications de Laya (0,774), notamment sur le phishing (0,90 contre 0,63). Prédictions et banc reproductible sont publiés ; les résultats tiennent sur une seule graine.

🔗 Le billet OpenDecider


MiniMax lance M3.1-Flash-Preview sur MiniMax Code et dans le Token Plan, sans benchmark ni tarif API

27 septembre — MiniMax présente M3.1-Flash-Preview, en préversion, comme son dernier modèle texte. Il fait ses débuts le matin dans MiniMax Code, l’agent de codage maison, puis arrive le soir dans le Token Plan, l’abonnement de la plateforme MiniMax :

MiniMax-M3.1 Flash Preview is now live on the Token Plan! Faster, lighter, and built for teams running high-volume, latency-sensitive workloads, now available under your existing Token Plan subscription, no extra setup required.

🇫🇷 MiniMax-M3.1 Flash Preview est désormais disponible dans le Token Plan ! Plus rapide, plus léger et conçu pour les équipes qui font tourner des charges de travail à fort volume et sensibles à la latence, il est désormais accessible dans votre abonnement Token Plan existant, sans aucune configuration supplémentaire. — @MiniMax_AI sur X

MiniMax ne publie ni benchmark, ni tarif API, ni taille, ni fenêtre de contexte, ni poids : ses notes de version des modèles s’arrêtent encore au 31 juillet.

🔗 Les débuts dans MiniMax Code, sur X


Brèves

  • Copilot CLI lit les règles de Claude Code — Dans la préversion 1.0.89-5 publiée le 27 septembre (aucune 1.0.89 stable n’est encore sortie), Copilot CLI prend en charge les fichiers de règles de Claude Code rangés dans .claude/rules comme instructions personnalisées ; les notes ne précisent ni le format reconnu ni l’ordre de priorité. 🔗 source
  • CLI mistral 0.7.0 — Publiée le 26 septembre sans annonce, cette version de l’outil en ligne de commande de Mistral ajoute mistral apps deploy, qui déploie une application sur la plateforme jusqu’en production, mistral apps publish, qui la publie dans le catalogue Vibe, et mistral evals pour les évaluations hors ligne. 🔗 source
  • L’Agent API de Perplexity passe à GPT-6 — Rattrapage du 25 septembre : les préréglages low et medium passent de openai/gpt-5.6-luna à openai/gpt-6-luna, le préréglage high de openai/gpt-5.6-sol à openai/gpt-6-sol ; prompts, effort de raisonnement, outils, budgets de tokens et limites d’étapes restent inchangés. 🔗 source
  • Space Bunny Alpha sur OpenRouter — Rattrapage du 23 septembre : OpenRouter liste un modèle furtif (stealth) gratuit dont l’éditeur n’est pas nommé, avec 1 million de tokens de contexte et des entrées texte, image et vidéo. Le fournisseur tiers qui l’opère peut conserver prompts et réponses, sans s’en servir pour l’entraînement ; aucun banc officiel. 🔗 source
  • Un juge de 4B pour les chiffres financiers — Tony Esposito publie FinCalc-NLI, un jeu synthétique aux étiquettes calculées par code sur dix métriques bancaires, et openjev-fincalc-4b, un juge affiné en 40 minutes sur un A100 qui vérifie les affirmations chiffrées : 94,4 % de réussite sur 4 000 cas contre 63,2 % pour le meilleur juge ouvert testé. 🔗 source
  • Affiner un modèle sur un Mac de 16 Go — Sur dix affinages LoRA, Harshit Kumar Gupta mesure PyTorch MPS de 2,2 à 5,7 fois plus rapide qu’Apple MLX, mais plafonné vers 1,5 milliard de paramètres, quand MLX en 4 bits loge un modèle de 3 milliards ; rang LoRA et optimiseur différaient entre les deux piles. 🔗 source

Ce que ça signifie

Les données ouvertes restent l’infrastructure discrète des modèles ouverts. Selon ses auteurs, la première version de YODAS a servi à entraîner des modèles d’IBM, de NVIDIA et d’Ai2 ; la v3 triple le volume, passe en 48 kHz et en multicanal, et garde la licence CC BY 3.0, de quoi entraîner de zéro, toujours selon eux, un modèle du niveau de Whisper. Les modèles de décision du jour suivent la même logique : JEV-27B apprend sur un corpus ouvert, OpenDecider distille deux professeurs ouverts pour moins de 30 dollars, et tous deux sortent sous Apache-2.0.

Un modèle à poids ouverts se vend comme une ligne de catalogue, et les hébergeurs se distinguent par le service. GLM 5.3 coûte le même prix hors cache chez Mistral et chez Together AI, 1,40 dollar en entrée et 4,40 dollars en sortie par million de tokens ; Mistral met en avant l’entrée en cache, 0,14 dollar contre 0,26 chez Together AI, un débit de plus de 100 tokens par seconde et un SLA de 99,5 %. Mistral, qui accueille des modèles tiers depuis GLM 5.2, se place ainsi en hébergeur autant qu’en éditeur. Le modèle change aussi sous le capot chez Perplexity : les requêtes passées par les préréglages de l’Agent API tournent désormais sur GPT-6, sans que le développeur ait choisi le modèle.

Reste à savoir qui mesure. JEV-27B et OpenDecider revendiquent la parité avec Jev sur des bancs que leurs auteurs ont exécutés eux-mêmes ; ils publient du moins leurs limites, leurs prédictions ou un banc reproductible, et leurs propres tableaux laissent Jev devant sur plusieurs épreuves, de VitaminC au phishing. À l’autre bout, MiniMax lance un modèle sans aucun chiffre vérifiable, ni benchmark, ni tarif API, ni fenêtre de contexte. Dans les deux cas, la mesure indépendante reste à faire ; AutoTrust AI annonce justement ses soumissions aux classements indépendants.

Chez Mistral comme chez MiniMax, le modèle passe d’abord par l’agent de code maison : GLM 5.3 est devenu le 21 septembre le modèle par défaut de Vibe Code sur le web avant d’arriver sur l’API Mistral, et M3.1-Flash-Preview fait ses débuts dans MiniMax Code avant le Token Plan. Les consignes, elles, commencent à circuler d’un agent à l’autre : la préversion 1.0.89-5 de Copilot CLI lit les fichiers .claude/rules écrits pour Claude Code, si bien qu’un même dépôt peut guider les deux agents avec les mêmes règles, du moins dans cette préversion.


Sources