Cerca

ESPnet triplica il suo corpus vocale aperto con YODAS v3, Mistral offre GLM 5.3 tramite la sua API, JEV-27B e OpenDecider rivendicano la parità con Jev

Articolo generato da intelligenza artificiale
ESPnet triplica il suo corpus vocale aperto con YODAS v3, Mistral offre GLM 5.3 tramite la sua API, JEV-27B e OpenDecider rivendicano la parità con Jev

ai-powered-markdown-translator

Articolo tradotto dal francese all’italiano con gpt-6-sol.

Vedi progetto su GitHub ↗

ESPnet pubblica YODAS v3, un set di dati vocali aperto di 1,1 milioni di ore in oltre 100 lingue, tre volte più grande della prima versione e interamente a 48 kHz. Mistral offre ora tramite la sua API GLM 5.3, il modello a pesi aperti di Z.ai, con 1 milione di token di contesto e uno SLA del 99,5 %, mentre JEV-27B e OpenDecider, due modelli decisionali aperti, rivendicano la parità con Jev nei benchmark condotti dai rispettivi autori. MiniMax lancia M3.1-Flash-Preview senza benchmark né tariffa API, e le Brevi si soffermano, tra l’altro, su una versione preliminare di Copilot CLI che legge le regole di Claude Code e su Space Bunny Alpha, un modello stealth gratuito su OpenRouter.


ESPnet pubblica YODAS v3, 1,1 milioni di ore di parlato aperto a 48 kHz

27 settembre — Il team di ESPnet (William Chen e Shinji Watanabe) pubblica YODAS v3, un set di dati vocali multilingue di 1,1 milioni di ore, tre volte più grande della prima versione. Tutto l’audio è distribuito a 48 kHz, con la frequenza effettivamente utile indicata nei metadati, perché molto audio sul web è sovracampionato.

Caratteristica di YODAS v3Valore pubblicato
Lingue copertePiù di 100, di cui 34 con oltre 1 000 ore
Audio multicanalePiù del 70 % con almeno due canali distinti
AnnotazioniTrascrizioni con marcatura temporale per parola, traduzione inglese per più della metà del contenuto multilingue
Dimensioni e licenza60 To in formato OPUS, CC BY 3.0

Secondo gli autori, questo volume basta ad addestrare da zero un modello al livello di Whisper; la prima versione, scaricata più di 2,5 milioni di volte, è stata usata per addestrare IBM Granite, NVIDIA Canary e Parakeet, nonché OLMoASR di Ai2. Un articolo correlato figura negli atti di Interspeech 2026.

🔗 YODAS v3 sul blog Hugging Face


Mistral rende disponibile GLM 5.3 di Z.ai tramite la sua API, con 1M di contesto e uno SLA del 99,5 %

26 settembre — Z.ai ha lanciato GLM 5.3 il 14 agosto e ne ha pubblicato i pesi il 28: la novità è il suo arrivo sull’API Mistral, annunciato dall’account @MistralDevs. In anteprima pubblica con l’identificativo zai-glm-5-3, il modello viene offerto senza modifiche sull’infrastruttura di Mistral, con 1 milione di token di contesto, 128k in uscita, più di 100 token al secondo e uno SLA del 99,5 % per il livello prioritario (priority tier).

Tariffa per milione di tokenAPI MistralTogether AI (29 agosto)
Input1,40 dollari1,40 dollari
Input nella cache0,14 dollari0,26 dollari
Output4,40 dollari4,40 dollari

L’11 agosto Mistral aveva annunciato l’apertura della sua piattaforma ai modelli di terze parti, a partire da GLM 5.2, e GLM 5.3 era arrivato il 21 settembre in Vibe Code come modello predefinito dell’applicazione web.

🔗 Annuncio di @MistralDevs · Scheda del modello


Modelli decisionali aperti: JEV-27B di AutoTrust AI e OpenDecider a confronto con Jev

Due articoli della comunità del 27 settembre presentano modelli decisionali aperti con licenza Apache-2.0. Questi modelli rispondono rapidamente, assegnando una probabilità a ogni risposta, alle brevi domande strutturate poste dagli agenti: vero o falso, scelta tra più opzioni, punteggio. Arrivano quattro giorni dopo Tev1-4B-experimental di Together AI ed entrambi si confrontano con Jev 1.13, il modello chiuso e ospitato di TypeSafe AI; i punteggi riportati sotto provengono dalle misurazioni dei rispettivi autori.

JEV-27B di AutoTrust AI: parità media con Jev 1.13, secondo gli autori

27 settembre — AutoTrust AI, che dichiara di non avere legami con TypeSafe AI, pubblica JEV-27B, un modello allievo di Jev 1.13 distillato su un corpus aperto. Il metodo mantiene Qwen3.8-27B congelato e vi aggiunge un blocco rimovibile di 108,9 milioni di parametri, addestrato in circa 9,2 ore su un B200: il modello di base resta intatto, con il 78,0 % su HumanEval. Punteggi misurati dagli autori il 26 settembre:

Benchmark decisionaleJEV-27BJev 1.13 (API)
JevBench (set pubblico)88,7087,18
Kev83,7585,52
OpenJev text73,8972,96
Nimble92,9191,84
VitaminC77,4678,46
MASSIVE-en87,7187,14
Media dei sei84,0783,85

La sua latenza mediana è di 137 ms per decisione su un B200. Gli autori riconoscono che la parità vale solo in media e che il modello allievo eredita i punti ciechi di Jev; annunciano l’invio dei risultati a classifiche indipendenti.

🔗 L’articolo di AutoTrust AI

OpenDecider: un nano da 400 milioni di parametri davanti a Laya e Jev su typed-decisions

27 settembre — Manjunath Janardhan pubblica OpenDecider, una famiglia di modelli decisionali: un nano da circa 400 milioni di parametri basato sull’encoder Ettin, uno small da 4 miliardi basato su Qwen3-4B e versioni MLX per Mac. Sono distillati da due modelli insegnanti aperti, Qwen3-235B e DeepSeek V4.1 Flash, con una spesa GPU inferiore a 30 dollari.

Modello valutatotyped-decisions (2 000)Decisioni generali inedite (200)Errore di calibrazione
OpenDecider-nano0,7960,6800,092
OpenDecider-small0,6720,7350,087
Laya (checkpoint specializzato)0,7660,5700,162
Jev 1.13 (API)0,7540,7300,164

Secondo queste misurazioni dell’autore, lo small eguaglia Jev su decisioni mai viste, con un errore di calibrazione quasi dimezzato. Jev resta avanti nella serie di test sulle applicazioni di Laya (0,774), in particolare sul phishing (0,90 contro 0,63). Sono pubblicati le predizioni e un benchmark riproducibile; i risultati si basano su un solo seed.

🔗 L’articolo su OpenDecider


MiniMax lancia M3.1-Flash-Preview su MiniMax Code e nel Token Plan, senza benchmark né tariffa API

27 settembre — MiniMax presenta M3.1-Flash-Preview, in anteprima, come il suo più recente modello testuale. Debutta al mattino in MiniMax Code, l’agente di codifica dell’azienda, e arriva la sera nel Token Plan, l’abbonamento della piattaforma MiniMax:

MiniMax-M3.1 Flash Preview is now live on the Token Plan! Faster, lighter, and built for teams running high-volume, latency-sensitive workloads, now available under your existing Token Plan subscription, no extra setup required.

🇮🇹 MiniMax-M3.1 Flash Preview è ora disponibile nel Token Plan! Più veloce, più leggero e progettato per i team che gestiscono carichi di lavoro ad alto volume e sensibili alla latenza, è ora accessibile con il vostro abbonamento Token Plan esistente, senza alcuna configurazione aggiuntiva. — @MiniMax_AI su X

MiniMax non pubblica benchmark, tariffa API, dimensioni, finestra di contesto né pesi: le sue note di versione dei modelli si fermano ancora al 31 luglio.

🔗 Il debutto in MiniMax Code, su X


Brevi

  • Copilot CLI legge le regole di Claude Code — Nella versione preliminare 1.0.89-5 pubblicata il 27 settembre (non è ancora uscita alcuna versione stabile 1.0.89), Copilot CLI supporta i file di regole di Claude Code nella directory .claude/rules come istruzioni personalizzate; le note non precisano né il formato riconosciuto né l’ordine di priorità. 🔗 fonte
  • CLI mistral 0.7.0 — Pubblicata il 26 settembre senza annuncio, questa versione dello strumento a riga di comando di Mistral aggiunge mistral apps deploy, che distribuisce un’applicazione sulla piattaforma fino alla produzione, mistral apps publish, che la pubblica nel catalogo Vibe, e mistral evals per le valutazioni offline. 🔗 fonte
  • L’Agent API di Perplexity passa a GPT-6 — Aggiornamento del 25 settembre: i preset low e medium passano da openai/gpt-5.6-luna a openai/gpt-6-luna, il preset high da openai/gpt-5.6-sol a openai/gpt-6-sol; prompt, impegno di ragionamento, strumenti, budget di token e limiti dei passaggi restano invariati. 🔗 fonte
  • Space Bunny Alpha su OpenRouter — Aggiornamento del 23 settembre: OpenRouter elenca un modello stealth (stealth) gratuito il cui sviluppatore non è nominato, con 1 milione di token di contesto e input di testo, immagini e video. Il fornitore terzo che lo gestisce può conservare prompt e risposte, senza usarli per l’addestramento; nessun benchmark ufficiale. 🔗 fonte
  • Un valutatore da 4B per i dati finanziari — Tony Esposito pubblica FinCalc-NLI, un set sintetico con etichette calcolate tramite codice su dieci metriche bancarie, e openjev-fincalc-4b, un valutatore affinato in 40 minuti su un A100 che verifica le affermazioni numeriche: 94,4 % di risposte corrette su 4 000 casi contro il 63,2 % del miglior valutatore aperto testato. 🔗 fonte
  • Affinare un modello su un Mac da 16 Go — In dieci operazioni di affinamento LoRA, Harshit Kumar Gupta misura PyTorch MPS da 2,2 a 5,7 volte più veloce di Apple MLX, ma limitato a circa 1,5 miliardi di parametri, mentre MLX a 4 bit riesce a contenere un modello da 3 miliardi; il rango LoRA e l’ottimizzatore differivano tra i due stack. 🔗 fonte

Che cosa significa

I dati aperti restano l’infrastruttura discreta dei modelli aperti. Secondo gli autori, la prima versione di YODAS è stata usata per addestrare modelli di IBM, NVIDIA e Ai2; la v3 triplica il volume, passa a 48 kHz e all’audio multicanale e mantiene la licenza CC BY 3.0, abbastanza, sempre secondo loro, per addestrare da zero un modello al livello di Whisper. I modelli decisionali di oggi seguono la stessa logica: JEV-27B apprende da un corpus aperto, OpenDecider distilla due modelli insegnanti aperti per meno di 30 dollari ed entrambi sono pubblicati con licenza Apache-2.0.

Un modello a pesi aperti si vende come voce di catalogo e i fornitori di hosting si distinguono per il servizio. GLM 5.3 costa lo stesso prezzo fuori dalla cache presso Mistral e Together AI, 1,40 dollari per l’input e 4,40 dollari per l’output per milione di token; Mistral mette in evidenza l’input nella cache, 0,14 dollari contro 0,26 presso Together AI, una velocità di oltre 100 token al secondo e uno SLA del 99,5 %. Mistral, che ospita modelli di terze parti da GLM 5.2, si posiziona così sia come fornitore di hosting sia come sviluppatore di modelli. Il modello cambia sotto il cofano anche presso Perplexity: le richieste che passano attraverso i preset dell’Agent API girano ora su GPT-6, senza che lo sviluppatore abbia scelto il modello.

Resta da capire chi effettua le misurazioni. JEV-27B e OpenDecider rivendicano la parità con Jev su benchmark eseguiti dai rispettivi autori; pubblicano comunque i propri limiti, le predizioni o un benchmark riproducibile, e le loro stesse tabelle mostrano Jev in vantaggio in diverse prove, da VitaminC al phishing. All’altro estremo, MiniMax lancia un modello senza alcun dato verificabile: nessun benchmark, nessuna tariffa API, nessuna finestra di contesto. In entrambi i casi mancano ancora misurazioni indipendenti; AutoTrust AI annuncia infatti l’invio dei suoi risultati a classifiche indipendenti.

Sia presso Mistral sia presso MiniMax, il modello passa prima dall’agente di codifica dell’azienda: GLM 5.3 è diventato il 21 settembre il modello predefinito di Vibe Code sul web prima di arrivare sull’API Mistral, e M3.1-Flash-Preview debutta in MiniMax Code prima del Token Plan. Le istruzioni, intanto, iniziano a passare da un agente all’altro: la versione preliminare 1.0.89-5 di Copilot CLI legge i file .claude/rules scritti per Claude Code, così uno stesso repository può guidare entrambi gli agenti con le stesse regole, almeno in questa versione preliminare.


Fonti