ai-powered-markdown-translatorArtikel mit gpt-6-sol aus dem Französischen ins Deutsche übersetzt.
ESPnet veröffentlicht YODAS v3, einen offenen Sprachdatensatz mit 1,1 Millionen Stunden in über 100 Sprachen, dreimal so umfangreich wie die erste Version und vollständig mit 48 kHz. Mistral bietet das Modell mit offenen Gewichten GLM 5.3 von Z.ai nun über seine API an, mit 1 Million Tokens Kontext und einem SLA von 99,5 %. Zugleich beanspruchen JEV-27B und OpenDecider, zwei offene Entscheidungsmodelle, auf den Benchmarks ihrer Autoren Gleichstand mit Jev. MiniMax führt M3.1-Flash-Preview ohne Benchmark oder API-Preise ein. In den Kurzmeldungen geht es unter anderem um eine Vorschauversion von Copilot CLI, die Regeln von Claude Code liest, und um Space Bunny Alpha, ein kostenloses Stealth-Modell bei OpenRouter.
ESPnet veröffentlicht YODAS v3: 1,1 Millionen Stunden offene Sprachaufnahmen mit 48 kHz
27. September — Das ESPnet-Team (William Chen und Shinji Watanabe) veröffentlicht YODAS v3, einen mehrsprachigen Sprachdatensatz mit 1,1 Millionen Stunden, dreimal so viel wie die erste Version. Sämtliches Audiomaterial wird mit 48 kHz bereitgestellt. Die Metadaten enthalten die tatsächlich nutzbare Abtastrate, da viele Audiodateien aus dem Web hochgerechnet wurden.
| Merkmal von YODAS v3 | Veröffentlichter Wert |
|---|---|
| Abgedeckte Sprachen | Über 100, davon 34 mit mehr als 1 000 Stunden |
| Mehrkanal-Audio | Über 70 % mit mindestens zwei getrennten Kanälen |
| Annotationen | Wortgenaue Transkripte mit Zeitstempeln, englische Übersetzung für mehr als die Hälfte des mehrsprachigen Materials |
| Umfang und Lizenz | 60 To im OPUS-Format, CC BY 3.0 |
Den Autoren zufolge reicht dieser Umfang aus, um ein Modell auf dem Niveau von Whisper von Grund auf zu trainieren. Die erste Version wurde mehr als 2,5 Millionen Mal heruntergeladen und diente zum Training von IBM Granite, NVIDIA Canary und Parakeet sowie OLMoASR von Ai2. Ein zugehöriger Fachartikel ist in den Tagungsbeiträgen von Interspeech 2026 erschienen.
🔗 YODAS v3 im Hugging Face Blog
Mistral stellt GLM 5.3 von Z.ai über seine API bereit, mit 1M Kontext und einem SLA von 99,5 %
26. September — Z.ai stellte GLM 5.3 am 14. August vor und veröffentlichte die Gewichte am 28. August. Neu ist die Verfügbarkeit über die Mistral API, die der Account @MistralDevs ankündigte. In der öffentlichen Vorschau unter der Kennung zai-glm-5-3 wird das Modell unverändert auf der Infrastruktur von Mistral betrieben, mit 1 Million Tokens Kontext, 128k Ausgabetokens, mehr als 100 Tokens pro Sekunde und einem SLA von 99,5 % auf der Prioritätsstufe (priority tier).
| Preis pro Million Tokens | Mistral API | Together AI (29. August) |
|---|---|---|
| Eingabe | 1,40 Dollar | 1,40 Dollar |
| Eingabe aus dem Cache | 0,14 Dollar | 0,26 Dollar |
| Ausgabe | 4,40 Dollar | 4,40 Dollar |
Mistral hatte am 11. August angekündigt, seine Plattform für Modelle von Drittanbietern zu öffnen, beginnend mit GLM 5.2. GLM 5.3 war am 21. September als Standardmodell der Webanwendung in Vibe Code verfügbar geworden.
🔗 Ankündigung von @MistralDevs · Modellbeschreibung
Offene Entscheidungsmodelle: JEV-27B von AutoTrust AI und OpenDecider im Vergleich mit Jev
Zwei Community-Beiträge vom 27. September veröffentlichen offene Entscheidungsmodelle unter der Lizenz Apache-2.0. Diese Modelle beantworten kleine, klar definierte Fragen von Agenten schnell und geben für jede Antwort eine Wahrscheinlichkeit an: wahr oder falsch, Auswahl zwischen mehreren Optionen oder Bewertung. Sie erscheinen vier Tage nach Tev1-4B-experimental von Together AI und werden beide mit Jev 1.13 verglichen, dem geschlossenen, gehosteten Modell von TypeSafe AI. Die folgenden Werte stammen aus Messungen ihrer Autoren.
JEV-27B von AutoTrust AI: laut seinen Autoren im Durchschnitt gleichauf mit Jev 1.13
27. September — AutoTrust AI, das nach eigenen Angaben keine Verbindung zu TypeSafe AI hat, veröffentlicht JEV-27B. Das Modell wurde mithilfe von Jev 1.13 auf einem offenen Korpus destilliert. Bei diesem Verfahren bleibt Qwen3.8-27B eingefroren und erhält einen abnehmbaren Block mit 108,9 Millionen Parametern, der in etwa 9,2 Stunden auf einem B200 trainiert wurde. Das Basismodell bleibt unverändert und erreicht 78,0 % auf HumanEval. Von den Autoren am 26. September gemessene Werte:
| Entscheidungsbenchmark | JEV-27B | Jev 1.13 (API) |
|---|---|---|
| JevBench (öffentlicher Datensatz) | 88,70 | 87,18 |
| Kev | 83,75 | 85,52 |
| OpenJev text | 73,89 | 72,96 |
| Nimble | 92,91 | 91,84 |
| VitaminC | 77,46 | 78,46 |
| MASSIVE-en | 87,71 | 87,14 |
| Durchschnitt der sechs | 84,07 | 83,85 |
Die mediane Latenz beträgt 137 ms pro Entscheidung auf einem B200. Die Autoren räumen ein, dass der Gleichstand nur im Durchschnitt gilt und das destillierte Modell die blinden Flecken von Jev übernimmt. Sie kündigen Einreichungen bei unabhängigen Ranglisten an.
OpenDecider: ein Nano-Modell mit 400 Millionen Parametern vor Laya und Jev auf typed-decisions
27. September — Manjunath Janardhan veröffentlicht OpenDecider, eine Familie von Entscheidungsmodellen: ein Nano-Modell mit etwa 400 Millionen Parametern auf Basis des Ettin-Encoders, ein Small-Modell mit 4 Milliarden Parametern auf Basis von Qwen3-4B sowie MLX-Versionen für Mac. Sie wurden für weniger als 30 Dollar GPU-Kosten aus zwei offenen Lehrermodellen destilliert, Qwen3-235B und DeepSeek V4.1 Flash.
| Bewertetes Modell | typed-decisions (2 000) | Neue allgemeine Entscheidungen (200) | Kalibrierungsfehler |
|---|---|---|---|
| OpenDecider-nano | 0,796 | 0,680 | 0,092 |
| OpenDecider-small | 0,672 | 0,735 | 0,087 |
| Laya (spezialisierter Checkpoint) | 0,766 | 0,570 | 0,162 |
| Jev 1.13 (API) | 0,754 | 0,730 | 0,164 |
Nach den Messungen des Autors erreicht das Small-Modell bei zuvor ungesehenen Entscheidungen das Niveau von Jev, mit einem fast halb so hohen Kalibrierungsfehler. Auf der Testsammlung für Laya-Anwendungen liegt Jev weiterhin vorn (0,774), insbesondere bei Phishing (0,90 gegenüber 0,63). Vorhersagen und ein reproduzierbarer Benchmark wurden veröffentlicht; die Ergebnisse beruhen auf einem einzigen Zufallsstartwert.
MiniMax führt M3.1-Flash-Preview in MiniMax Code und im Token Plan ein, ohne Benchmark oder API-Preise
27. September — MiniMax stellt M3.1-Flash-Preview als sein neuestes Textmodell in einer Vorschauversion vor. Es erscheint am Morgen zunächst in MiniMax Code, dem hauseigenen Programmieragenten, und am Abend im Token Plan, dem Abonnement der MiniMax-Plattform:
MiniMax-M3.1 Flash Preview is now live on the Token Plan! Faster, lighter, and built for teams running high-volume, latency-sensitive workloads, now available under your existing Token Plan subscription, no extra setup required.
🇩🇪 MiniMax-M3.1 Flash Preview ist jetzt im Token Plan verfügbar! Es ist schneller, leichter und für Teams konzipiert, die umfangreiche, latenzkritische Workloads ausführen. Sie können es jetzt mit Ihrem bestehenden Token-Plan-Abonnement nutzen, ohne zusätzliche Konfiguration. — @MiniMax_AI auf X
MiniMax veröffentlicht weder Benchmarks noch API-Preise, Modellgröße, Kontextfenster oder Gewichte. Die Versionshinweise zu den Modellen enden weiterhin beim 31. Juli.
🔗 Erste Verfügbarkeit in MiniMax Code auf X
Kurzmeldungen
- Copilot CLI liest Regeln von Claude Code — In der am 27. September veröffentlichten Vorschauversion 1.0.89-5 (eine stabile Version 1.0.89 ist noch nicht erschienen) unterstützt Copilot CLI Regeldateien von Claude Code unter
.claude/rulesals benutzerdefinierte Anweisungen. Die Versionshinweise nennen weder das unterstützte Format noch die Prioritätsreihenfolge. 🔗 Quelle - mistral CLI 0.7.0 — Diese am 26. September ohne Ankündigung veröffentlichte Version des Kommandozeilenwerkzeugs von Mistral ergänzt
mistral apps deploy, womit eine Anwendung auf der Plattform bis in die Produktion bereitgestellt wird,mistral apps publish, womit sie im Vibe-Katalog veröffentlicht wird, sowiemistral evalsfür Offline-Evaluierungen. 🔗 Quelle - Perplexitys Agent API wechselt zu GPT-6 — Nachtrag vom 25. September: Die Voreinstellungen low und medium wechseln von
openai/gpt-5.6-lunazuopenai/gpt-6-luna, die Voreinstellung high vonopenai/gpt-5.6-solzuopenai/gpt-6-sol. Prompts, Denkaufwand, Werkzeuge, Token-Budgets und Schrittlimits bleiben unverändert. 🔗 Quelle - Space Bunny Alpha auf OpenRouter — Nachtrag vom 23. September: OpenRouter listet ein kostenloses Stealth-Modell (stealth), dessen Entwickler nicht genannt wird, mit 1 Million Tokens Kontext sowie Text-, Bild- und Videoeingaben. Der Drittanbieter, der es betreibt, darf Prompts und Antworten speichern, sie aber nicht zum Training verwenden. Es gibt keinen offiziellen Benchmark. 🔗 Quelle
- Ein 4B-Judge für Finanzzahlen — Tony Esposito veröffentlicht FinCalc-NLI, einen synthetischen Datensatz mit per Code berechneten Labels für zehn Bankkennzahlen, sowie openjev-fincalc-4b, einen in 40 Minuten auf einem A100 feinabgestimmten Judge, der Zahlenangaben überprüft: 94,4 % Erfolgsquote bei 4 000 Fällen gegenüber 63,2 % für den besten getesteten offenen Judge. 🔗 Quelle
- Ein Modell auf einem Mac mit 16 Go feinabstimmen — Bei zehn LoRA-Feinabstimmungen misst Harshit Kumar Gupta PyTorch MPS als 2,2- bis 5,7-mal schneller als Apple MLX. Allerdings liegt seine Grenze bei etwa 1,5 Milliarden Parametern, während MLX mit 4 Bit ein Modell mit 3 Milliarden Parametern unterbringt. LoRA-Rang und Optimierer unterschieden sich zwischen den beiden Stacks. 🔗 Quelle
Was das bedeutet
Offene Daten bleiben die wenig sichtbare Infrastruktur offener Modelle. Den Autoren zufolge wurde die erste Version von YODAS zum Training von Modellen von IBM, NVIDIA und Ai2 verwendet. Die v3 verdreifacht den Umfang, bietet 48 kHz und Mehrkanal-Audio und behält die Lizenz CC BY 3.0 bei. Damit lässt sich laut den Autoren ein Modell auf dem Niveau von Whisper von Grund auf trainieren. Die heutigen Entscheidungsmodelle folgen derselben Logik: JEV-27B lernt auf einem offenen Korpus, OpenDecider destilliert zwei offene Lehrermodelle für weniger als 30 Dollar, und beide erscheinen unter Apache-2.0.
Ein Modell mit offenen Gewichten wird als Katalogeintrag angeboten, während sich die Hoster über ihren Service unterscheiden. GLM 5.3 kostet außerhalb des Caches bei Mistral und Together AI gleich viel: 1,40 Dollar für die Eingabe und 4,40 Dollar für die Ausgabe pro Million Tokens. Mistral hebt die Eingabe aus dem Cache für 0,14 Dollar gegenüber 0,26 Dollar bei Together AI hervor, außerdem einen Durchsatz von mehr als 100 Tokens pro Sekunde und ein SLA von 99,5 %. Mistral, das seit GLM 5.2 Modelle von Drittanbietern aufnimmt, positioniert sich damit sowohl als Hoster als auch als Modellentwickler. Auch bei Perplexity ändert sich das Modell im Hintergrund: Anfragen über die Voreinstellungen der Agent API laufen nun auf GPT-6, ohne dass der Entwickler das Modell ausgewählt hat.
Entscheidend bleibt, wer die Messungen durchführt. JEV-27B und OpenDecider beanspruchen auf Benchmarks, die ihre Autoren selbst ausgeführt haben, Gleichstand mit Jev. Immerhin veröffentlichen sie ihre Grenzen, ihre Vorhersagen oder einen reproduzierbaren Benchmark. Ihre eigenen Tabellen zeigen Jev bei mehreren Prüfungen vorn, von VitaminC bis Phishing. Am anderen Ende führt MiniMax ein Modell ohne überprüfbare Kennzahlen ein: ohne Benchmark, API-Preise oder Angaben zum Kontextfenster. In beiden Fällen stehen unabhängige Messungen noch aus. AutoTrust AI kündigt seine Einreichungen bei unabhängigen Ranglisten bereits an.
Sowohl bei Mistral als auch bei MiniMax kommt das Modell zuerst im hauseigenen Programmieragenten zum Einsatz: GLM 5.3 wurde am 21. September zum Standardmodell von Vibe Code im Web, bevor es über die Mistral API verfügbar wurde. M3.1-Flash-Preview erscheint zunächst in MiniMax Code und danach im Token Plan. Auch Anweisungen wandern inzwischen von einem Agenten zum anderen: Die Vorschauversion 1.0.89-5 von Copilot CLI liest die für Claude Code geschriebenen Dateien .claude/rules. So kann ein und dasselbe Repository beide Agenten mit denselben Regeln anleiten, zumindest in dieser Vorschauversion.
Quellen
- YODAS v3 (Hugging Face Blog)
- Der Datensatz espnet/yodas3 (Hugging Face)
- Der Fachartikel zu YODAS v3 in den Tagungsbeiträgen von Interspeech 2026 (ISCA Archive)
- @MistralDevs: GLM 5.3 über die Mistral API
- Modellbeschreibung zu zai-glm-5-3 (Mistral-Dokumentation)
- @mistralvibe: GLM 5.3 in Vibe Code
- @togethercompute: GLM-5.3 bei Together AI
- Modellbeschreibung und Preise für GLM-5.3 bei Together AI
- Der Beitrag von AutoTrust AI zu JEV-27B (Hugging Face Blog)
- Das Modell autotrust/JEV-27B (Hugging Face)
- Der Beitrag zu OpenDecider (Hugging Face Blog)
- Das GitHub-Repository von OpenDecider
- @MiniMax_AI: M3.1 Flash Preview im Token Plan
- @MiniMaxAgent: M3.1-Flash-Preview in MiniMax Code
- Copilot CLI 1.0.89-5 (GitHub)
- mistral CLI 0.7.0 (GitHub)
- Änderungsprotokoll der Perplexity API
- Space Bunny Alpha (OpenRouter)
- Der Judge openjev-fincalc von Tony Esposito (Hugging Face Blog)
- Programmieragenten auf Mac feinabstimmen: PyTorch MPS im Vergleich zu MLX (Hugging Face Blog)