Sök

ESPnet tredubblar sin öppna taldatamängd med YODAS v3, Mistral erbjuder GLM 5.3 via sitt API, JEV-27B och OpenDecider hävdar jämförbara resultat med Jev

Artikel genererad av artificiell intelligens
ESPnet tredubblar sin öppna taldatamängd med YODAS v3, Mistral erbjuder GLM 5.3 via sitt API, JEV-27B och OpenDecider hävdar jämförbara resultat med Jev

ai-powered-markdown-translator

Artikel översatt från franska till svenska med gpt-6-sol.

Visa projekt på GitHub ↗

ESPnet publicerar YODAS v3, en öppen taldatamängd med 1,1 miljoner timmar på över 100 språk. Den är tre gånger större än den första versionen och allt ljud distribueras i 48 kHz. Mistral erbjuder nu Z.ai:s modell med öppna vikter GLM 5.3 via sitt API, med 1 miljon tokens i kontextfönstret och ett SLA på 99,5 %. Samtidigt hävdar JEV-27B och OpenDecider, två öppna beslutsmodeller, att de når jämförbara resultat med Jev i upphovspersonernas egna tester. MiniMax lanserar M3.1-Flash-Preview utan benchmarkresultat eller API-pris, och bland kortnyheterna finns en förhandsversion av Copilot CLI som läser regler för Claude Code samt Space Bunny Alpha, en gratis modell med okänd utgivare hos OpenRouter.


ESPnet publicerar YODAS v3: 1,1 miljoner timmar öppet talmaterial i 48 kHz

27 september — ESPnet-teamet (William Chen och Shinji Watanabe) publicerar YODAS v3, en flerspråkig taldatamängd på 1,1 miljoner timmar, tre gånger större än den första versionen. Allt ljud distribueras i 48 kHz, med den faktiska användbara samplingsfrekvensen angiven i metadata, eftersom mycket ljud från webben har samplats upp.

Egenskap hos YODAS v3Publicerat värde
Språk som omfattasÖver 100, varav 34 med mer än 1 000 timmar
Flerkanaligt ljudÖver 70 % med minst två separata kanaler
AnnoteringarOrdvisa transkriptioner med tidsstämplar, engelsk översättning för över hälften av det flerspråkiga materialet
Storlek och licens60 To i OPUS-format, CC BY 3.0

Enligt upphovspersonerna räcker mängden för att träna en modell på Whisper-nivå från grunden. Den första versionen, som har laddats ned över 2,5 miljoner gånger, har använts för att träna IBM Granite, NVIDIA Canary och Parakeet samt Ai2:s OLMoASR. En tillhörande artikel finns i konferenspublikationen från Interspeech 2026.

🔗 YODAS v3 på Hugging Face-bloggen


Mistral erbjuder Z.ai:s GLM 5.3 via sitt API, med 1M kontext och ett SLA på 99,5 %

26 september — Z.ai lanserade GLM 5.3 den 14 augusti och släppte modellens vikter den 28 augusti. Nyheten är att modellen nu finns på Mistrals API, enligt ett tillkännagivande från kontot @MistralDevs. I offentlig förhandsversion under identifieraren zai-glm-5-3 körs modellen utan ändringar på Mistrals infrastruktur, med 1 miljon tokens i kontextfönstret, 128k tokens som utdata, över 100 tokens per sekund och ett SLA på 99,5 % på prioritetsnivån (priority tier).

Pris per miljon tokensMistrals APITogether AI (29 augusti)
Indata1,40 dollar1,40 dollar
Cachad indata0,14 dollar0,26 dollar
Utdata4,40 dollar4,40 dollar

Mistral meddelade den 11 augusti att plattformen skulle öppnas för tredjepartsmodeller, med GLM 5.2 som första modell. GLM 5.3 kom till Vibe Code den 21 september som webbappens standardmodell.

🔗 Tillkännagivande från @MistralDevs · Modellspecifikation


Öppna beslutsmodeller: AutoTrust AI:s JEV-27B och OpenDecider jämförs med Jev

Två inlägg från communityn den 27 september presenterar öppna beslutsmodeller under licensen Apache-2.0. Modellerna ger snabba svar, med en sannolikhet för varje svar, på de små frågor av bestämda typer som agenter ställer: sant eller falskt, val mellan flera alternativ och betyg. De kommer fyra dagar efter Together AI:s Tev1-4B-experimental och jämförs båda med Jev 1.13, TypeSafe AI:s slutna och hostade modell. Resultaten nedan kommer från upphovspersonernas egna mätningar.

AutoTrust AI:s JEV-27B: i genomsnitt jämförbar med Jev 1.13, enligt upphovspersonerna

27 september — AutoTrust AI, som uppger att företaget saknar koppling till TypeSafe AI, publicerar JEV-27B, en modell destillerad från Jev 1.13 med hjälp av en öppen datamängd. Metoden håller Qwen3.8-27B fryst och lägger till ett löstagbart block med 108,9 miljoner parametrar, tränat på cirka 9,2 timmar på en B200. Basmodellen förblir intakt och får 78,0 % på HumanEval. Resultat uppmätta av upphovspersonerna den 26 september:

BeslutstestJEV-27BJev 1.13 (API)
JevBench (öppen datamängd)88,7087,18
Kev83,7585,52
OpenJev text73,8972,96
Nimble92,9191,84
VitaminC77,4678,46
MASSIVE-en87,7187,14
Genomsnitt för de sex84,0783,85

Medianlatensen är 137 ms per beslut på en B200. Upphovspersonerna medger att resultaten bara är jämförbara i genomsnitt och att modellen ärver Jevs blinda fläckar. De aviserar bidrag till oberoende rankningar.

🔗 AutoTrust AI:s inlägg

OpenDecider: en nanomodell med 400 miljoner parametrar före Laya och Jev på typed-decisions

27 september — Manjunath Janardhan publicerar OpenDecider, en familj av beslutsmodeller: en nanomodell med cirka 400 miljoner parametrar baserad på Ettin-enkodern, en small-modell med 4 miljarder parametrar baserad på Qwen3-4B och MLX-versioner för Mac. De har destillerats från två öppna lärarmodeller, Qwen3-235B och DeepSeek V4.1 Flash, för mindre än 30 dollar i GPU-kostnad.

Utvärderad modelltyped-decisions (2 000)Nya allmänna beslut (200)Kalibreringsfel
OpenDecider-nano0,7960,6800,092
OpenDecider-small0,6720,7350,087
Laya (specialiserad checkpoint)0,7660,5700,162
Jev 1.13 (API)0,7540,7300,164

Enligt upphovspersonens mätningar matchar small-modellen Jev på tidigare osedda beslut, med nästan hälften så stort kalibreringsfel. Jev ligger fortfarande före på Layas uppsättning av applikationstester (0,774), särskilt på phishing (0,90 mot 0,63). Förutsägelserna och ett reproducerbart test har publicerats; resultaten bygger på ett enda slumpfrö.

🔗 Inlägget om OpenDecider


MiniMax lanserar M3.1-Flash-Preview i MiniMax Code och Token Plan, utan benchmarkresultat eller API-pris

27 september — MiniMax presenterar M3.1-Flash-Preview i förhandsversion som sin senaste textmodell. Den debuterar på morgonen i MiniMax Code, företagets egen kodningsagent, och kommer på kvällen till Token Plan, abonnemanget på MiniMax-plattformen:

MiniMax-M3.1 Flash Preview is now live on the Token Plan! Faster, lighter, and built for teams running high-volume, latency-sensitive workloads, now available under your existing Token Plan subscription, no extra setup required.

🇸🇪 MiniMax-M3.1 Flash Preview finns nu i Token Plan! Den är snabbare, lättare och byggd för team som kör stora volymer av arbetslaster där latensen är viktig. Den ingår nu i ditt befintliga Token Plan-abonnemang, utan någon extra konfigurering. — @MiniMax_AI på X

MiniMax publicerar inga benchmarkresultat, inget API-pris och inga uppgifter om storlek, kontextfönster eller vikter. Versionsinformationen för företagets modeller sträcker sig fortfarande bara till den 31 juli.

🔗 Debuten i MiniMax Code, på X


Kortnyheter

  • Copilot CLI läser regler för Claude Code — I förhandsversion 1.0.89-5, som publicerades den 27 september (någon stabil 1.0.89 har ännu inte släppts), stöder Copilot CLI regelfiler för Claude Code som ligger i .claude/rules som anpassade instruktioner. Versionsinformationen anger varken vilket format som stöds eller prioritetsordningen. 🔗 källa
  • CLI mistral 0.7.0 — Den här versionen av Mistrals kommandoradsverktyg publicerades den 26 september utan tillkännagivande. Den lägger till mistral apps deploy, som driftsätter en applikation på plattformen ända till produktion, mistral apps publish, som publicerar den i Vibe-katalogen, och mistral evals för utvärderingar offline. 🔗 källa
  • Perplexitys Agent API går över till GPT-6 — En uppföljning från den 25 september: förinställningarna low och medium går från openai/gpt-5.6-luna till openai/gpt-6-luna, och high från openai/gpt-5.6-sol till openai/gpt-6-sol. Promptar, resonemangsnivå, verktyg, tokenbudgetar och gränser för antal steg är oförändrade. 🔗 källa
  • Space Bunny Alpha på OpenRouter — En uppföljning från den 23 september: OpenRouter listar en gratis modell med okänd utgivare (stealth), med 1 miljon tokens i kontextfönstret och stöd för text, bild och video som indata. Tredjepartsleverantören som kör modellen kan spara promptar och svar, men använder dem inte för träning. Inga officiella benchmarkresultat finns. 🔗 källa
  • En domarmodell på 4B för finansiella siffror — Tony Esposito publicerar FinCalc-NLI, en syntetisk datamängd där etiketterna har beräknats med kod utifrån tio bankmått, och openjev-fincalc-4b, en domarmodell som finjusterats på 40 minuter på en A100 och kontrollerar påståenden med siffror: 94,4 % korrekta bedömningar i 4 000 fall, mot 63,2 % för den bästa testade öppna domarmodellen. 🔗 källa
  • Finjustera en modell på en Mac med 16 Go — I tio LoRA-finjusteringar mäter Harshit Kumar Gupta att PyTorch MPS är 2,2 till 5,7 gånger snabbare än Apple MLX, men når sitt tak vid cirka 1,5 miljarder parametrar. MLX med 4 bitar rymmer däremot en modell med 3 miljarder parametrar. LoRA-rang och optimerare skilde sig mellan de två lösningarna. 🔗 källa

Vad det innebär

Öppna data fortsätter att vara den mindre synliga infrastrukturen bakom öppna modeller. Enligt upphovspersonerna användes den första versionen av YODAS för att träna modeller från IBM, NVIDIA och Ai2. Version 3 tredubblar mängden, går över till 48 kHz och flerkanaligt ljud samt behåller licensen CC BY 3.0. Enligt dem räcker det för att träna en modell på Whisper-nivå från grunden. Dagens beslutsmodeller följer samma mönster: JEV-27B tränas på en öppen datamängd, OpenDecider destillerar två öppna lärarmodeller för mindre än 30 dollar, och båda släpps under Apache-2.0.

En modell med öppna vikter säljs som en post i en katalog, medan leverantörerna skiljer sig åt genom tjänsten. GLM 5.3 kostar lika mycket utan cache hos Mistral och Together AI: 1,40 dollar för indata och 4,40 dollar för utdata per miljon tokens. Mistral lyfter fram cachad indata, 0,14 dollar mot 0,26 hos Together AI, en hastighet på över 100 tokens per sekund och ett SLA på 99,5 %. Mistral, som har erbjudit tredjepartsmodeller sedan GLM 5.2, tar därmed rollen som både värd och modellutvecklare. Även hos Perplexity byts modellen ut i bakgrunden: förfrågningar via förinställningarna i Agent API körs nu på GPT-6 utan att utvecklaren själv har valt modellen.

Frågan är vem som mäter resultaten. JEV-27B och OpenDecider hävdar att de matchar Jev i tester som deras upphovspersoner själva har genomfört. De publicerar åtminstone sina begränsningar, sina förutsägelser eller ett reproducerbart test, och deras egna tabeller visar att Jev ligger före i flera prövningar, från VitaminC till phishing. I andra änden lanserar MiniMax en modell utan verifierbara siffror: inga benchmarkresultat, inget API-pris och inga uppgifter om kontextfönstret. I båda fallen återstår oberoende mätningar. AutoTrust AI aviserar också att modellen ska skickas in till oberoende rankningar.

Hos både Mistral och MiniMax kommer modellen först till företagets egen kodningsagent: GLM 5.3 blev standardmodell i Vibe Code på webben den 21 september innan den kom till Mistrals API, och M3.1-Flash-Preview debuterar i MiniMax Code före Token Plan. Instruktionerna börjar i sin tur följa med mellan agenter: förhandsversion 1.0.89-5 av Copilot CLI läser filer i .claude/rules skrivna för Claude Code. Samma kodförråd kan därmed styra båda agenterna med samma regler, åtminstone i denna förhandsversion.


Källor