検索

ESPnet、オープンな音声コーパスをYODAS v3で3倍に拡大、MistralのAPIでGLM 5.3を提供、JEV-27BとOpenDeciderがJevと同等の性能を主張

人工知能によって生成された記事
ESPnet、オープンな音声コーパスをYODAS v3で3倍に拡大、MistralのAPIでGLM 5.3を提供、JEV-27BとOpenDeciderがJevと同等の性能を主張

ai-powered-markdown-translator

gpt-6-solを使用してフランス語から日本語に翻訳された記事。

GitHub でプロジェクトを見る ↗

ESPnetは、100以上の言語を収録した110万時間のオープンな音声データセットYODAS v3を公開した。初版の3倍の規模で、音声はすべて48 kHzだ。MistralはZ.aiのオープンウェイトモデルGLM 5.3を、自社APIで提供し始めた。コンテキストは100万トークン、SLAは99.5%。一方、2つのオープンな判断モデルJEV-27BとOpenDeciderは、開発者自身の評価でJevと同等の性能を主張している。MiniMaxはベンチマークやAPI料金を示さずにM3.1-Flash-Previewを投入。短報では、Claude Codeのルールを読み込むCopilot CLIのプレビュー版や、OpenRouterで無料提供される非公開モデルSpace Bunny Alphaなどを取り上げる。


ESPnetがYODAS v3を公開、48 kHzのオープンな音声110万時間

9月27日 — ESPnetチームのWilliam ChenとShinji Watanabeが、多言語音声データセットYODAS v3を公開した。収録時間は110万時間で、初版の3倍に当たる。音声はすべて48 kHzで配布されるが、ウェブ上の音声にはアップサンプリングされたものが多いため、実際に有効なサンプリング周波数もメタデータに記録されている。

YODAS v3の特徴公表値
対応言語100以上。うち34言語はそれぞれ1,000時間超
マルチチャンネル音声70%超が少なくとも2つの異なるチャンネルを持つ
アノテーション単語単位のタイムスタンプ付き文字起こし、多言語音声の半数超に英訳
容量とライセンスOPUS形式で60 To、CC BY 3.0

著者らによれば、この規模ならWhisper級のモデルをゼロから学習できる。250万回以上ダウンロードされた初版は、IBM Granite、NVIDIA Canary、Parakeet、Ai2のOLMoASRの学習に使われたという。関連論文はInterspeech 2026の予稿集に収録されている。

🔗 Hugging FaceブログのYODAS v3記事


Mistral、Z.aiのGLM 5.3をAPIで提供。100万トークンのコンテキストと99.5%のSLA

9月26日 — Z.aiは8月14日にGLM 5.3を発表し、28日にウェイトを公開した。今回の新展開は、@MistralDevsが発表したMistral APIでの提供だ。公開プレビューでは識別子zai-glm-5-3で利用でき、Mistralのインフラ上でモデルに変更を加えずに提供される。コンテキストは100万トークン、出力は最大128kトークン、処理速度は毎秒100トークン超で、優先サービス階層(priority tier)には99.5%のSLAが付く。

100万トークン当たりの料金Mistral APITogether AI(8月29日)
入力1.40ドル1.40ドル
キャッシュ済み入力0.14ドル0.26ドル
出力4.40ドル4.40ドル

Mistralは8月11日、GLM 5.2を皮切りに自社プラットフォームで他社モデルを提供すると発表していた。GLM 5.3は9月21日にVibe Codeにも導入され、ウェブアプリの既定モデルとなった。

🔗 @MistralDevsの発表 · モデルの詳細


オープンな判断モデル:AutoTrust AIのJEV-27BとOpenDeciderがJevに挑む

9月27日に公開された2本のコミュニティ記事は、Apache-2.0ライセンスのオープンな判断モデルを紹介している。これらのモデルは、エージェントが投げかける真偽判定、複数選択肢からの選択、評価点の付与といった短い定型質問に、各回答の確率を添えて素早く答える。Together AIのTev1-4B-experimentalが登場した4日後の公開で、いずれもTypeSafe AIがホストする非公開モデルJev 1.13と比較している。以下のスコアは各モデルの著者による測定値だ。

AutoTrust AIのJEV-27B:著者らによれば平均でJev 1.13と同等

9月27日 — AutoTrust AIは、TypeSafe AIとは無関係だと明示したうえで、オープンなコーパスを使ってJev 1.13から蒸留したJEV-27Bを公開した。Qwen3.8-27B本体のパラメータは固定し、約1億890万パラメータの取り外し可能なブロックを追加する方式で、B200上で約9.2時間学習した。基盤モデルは変更されず、HumanEvalのスコアは78.0%を維持している。著者らが9月26日に測定した結果は次のとおり。

判断ベンチマークJEV-27BJev 1.13 (API)
JevBench(公開データセット)88,7087,18
Kev83,7585,52
OpenJev text73,8972,96
Nimble92,9191,84
VitaminC77,4678,46
MASSIVE-en87,7187,14
6項目の平均84,0783,85

B200上での判断1回当たりのレイテンシー中央値は137 ms。著者らは、同等という結果は平均値に限られ、生徒モデルがJevの弱点も引き継ぐと認めている。独立したランキングへの提出も予定している。

🔗 AutoTrust AIの記事

OpenDecider:4億パラメータのnanoがtyped-decisionsでLayaとJevを上回る

9月27日 — Manjunath Janardhanが判断モデル群OpenDeciderを公開した。Ettinエンコーダーを使う約4億パラメータのnano、Qwen3-4Bを基盤とする40億パラメータのsmall、Mac向けのMLX版がある。2つのオープンな教師モデルQwen3-235BとDeepSeek V4.1 Flashから、GPU費用30ドル未満で蒸留した。

評価モデルtyped-decisions(2 000)未知の一般的な判断(200)較正誤差
OpenDecider-nano0,7960,6800,092
OpenDecider-small0,6720,7350,087
Laya(特化型チェックポイント)0,7660,5700,162
Jev 1.13 (API)0,7540,7300,164

著者の測定によれば、smallは未知の判断課題でJevと同等の成績を収め、較正誤差は半分近くに抑えられた。一方、Layaのアプリケーション評価群ではJevが0,774で上回り、特にフィッシング判定では0,90対0,63だった。予測結果と再現可能なベンチマークは公開されているが、結果は単一の乱数シードによる。

🔗 OpenDeciderの記事


MiniMaxがM3.1-Flash-PreviewをMiniMax CodeとToken Planに投入、ベンチマークとAPI料金は未公表

9月27日 — MiniMaxは最新のテキストモデルとして、プレビュー版のM3.1-Flash-Previewを発表した。午前中に自社のコーディングエージェントMiniMax Codeで提供を始め、夜にはMiniMaxプラットフォームのサブスクリプションToken Planにも追加した。

MiniMax-M3.1 Flash Preview is now live on the Token Plan! Faster, lighter, and built for teams running high-volume, latency-sensitive workloads, now available under your existing Token Plan subscription, no extra setup required.

🇯🇵 MiniMax-M3.1 Flash PreviewがToken Planで利用できるようになりました!より高速で軽量になり、大量の処理を低遅延で実行するチーム向けに設計されています。追加の設定なしで、現在ご利用中のToken Planからアクセスできます。 — Xの@MiniMax_AI

MiniMaxはベンチマーク、API料金、モデルサイズ、コンテキストウィンドウ、ウェイトのいずれも公表していない。モデルのリリースノートも7月31日で更新が止まっている。

🔗 Xで発表されたMiniMax Codeへの導入


短報

  • Copilot CLIがClaude Codeのルールを読み込む — 9月27日公開のプレビュー版1.0.89-5では、.claude/rulesに置かれたClaude Codeのルールファイルをカスタム指示として利用できる。安定版1.0.89はまだ出ていない。リリースノートには、対応する形式や指示の優先順位は記載されていない。🔗 出典
  • mistral CLI 0.7.0 — 9月26日に告知なしで公開されたMistralのコマンドラインツールの新バージョン。アプリを本番環境までプラットフォームにデプロイするmistral apps deploy、Vibeのカタログに公開するmistral apps publish、オフライン評価に使うmistral evalsが追加された。🔗 出典
  • PerplexityのAgent APIがGPT-6に移行 — 9月25日の動きを振り返ると、lowとmediumのプリセットはopenai/gpt-5.6-lunaからopenai/gpt-6-lunaへ、highのプリセットはopenai/gpt-5.6-solからopenai/gpt-6-solへ切り替わった。プロンプト、推論の強度、ツール、トークン予算、ステップ数の上限は変わらない。🔗 出典
  • OpenRouterのSpace Bunny Alpha — 9月23日の動きを振り返ると、OpenRouterは開発元を明かしていない無料の非公開モデル(stealth)を掲載した。コンテキストは100万トークンで、テキスト、画像、動画を入力できる。運用する第三者プロバイダーはプロンプトと回答を保存する場合があるが、学習には使用しない。公式ベンチマークはない。🔗 出典
  • 金融数値を検証する4Bの判定モデル — Tony Espositoは、10種類の銀行指標についてコードで正解ラベルを計算した合成データセットFinCalc-NLIと、数値を含む主張を検証するファインチューニング済みの判定モデルopenjev-fincalc-4bを公開した。後者の学習にはA100上で40分かかり、4 000件の評価で正答率94,4%を記録。比較対象のオープンな判定モデルの最高値は63,2%だった。🔗 出典
  • メモリ16 GoのMacでモデルをファインチューニング — Harshit Kumar Guptaは10件のLoRAファインチューニングで、PyTorch MPSがApple MLXより2,2~5,7倍高速だと測定した。ただしPyTorch MPSでは約15億パラメータが上限だった一方、4ビットのMLXでは30億パラメータのモデルを収められた。LoRAのランクとオプティマイザーは両環境で異なっていた。🔗 出典

これらの動きが示すこと

オープンなデータは、オープンモデルを支える目立たない基盤であり続けている。著者らによれば、YODASの初版はIBM、NVIDIA、Ai2のモデルの学習に使われた。v3はデータ量を3倍に増やし、48 kHzとマルチチャンネルに対応しながら、CC BY 3.0ライセンスを維持する。著者らは、Whisper級のモデルをゼロから学習できる規模だとしている。この日の判断モデルも同じ流れにある。JEV-27Bはオープンなコーパスで学習し、OpenDeciderは30ドル未満で2つのオープンな教師モデルから蒸留され、どちらもApache-2.0で公開された。

オープンウェイトモデルはサービスのラインアップの一つとなり、ホスティング事業者は提供条件で差をつけている。GLM 5.3のキャッシュを使わない料金はMistralとTogether AIで同じで、100万トークン当たり入力1.40ドル、出力4.40ドル。Mistralが打ち出すのは、キャッシュ済み入力の料金がTogether AIの0.26ドルに対して0.14ドルであること、毎秒100トークン超の処理速度、99.5%のSLAだ。GLM 5.2以来、他社モデルも受け入れるMistralは、モデル開発元であると同時にホスティング事業者にもなっている。Perplexityでも内部で使うモデルが変わった。Agent APIのプリセットを通るリクエストは、開発者がモデルを指定していなくても、現在はGPT-6で処理される。

残る問題は、誰が性能を測るかだ。JEV-27BとOpenDeciderは、開発者自身が実施したベンチマークでJevと同等の性能を主張する。それでも、限界や予測結果、再現可能なベンチマークを公開しており、自らの表にもVitaminCやフィッシングなど、Jevが上回る課題がいくつも残っている。一方、MiniMaxはベンチマーク、API料金、コンテキストウィンドウを含め、検証可能な数値を示さずにモデルを投入した。どちらについても独立した評価が待たれる。AutoTrust AIは、独立したランキングへの提出を予定している。

MistralもMiniMaxも、新モデルをまず自社のコーディングエージェントに導入している。GLM 5.3は9月21日にウェブ版Vibe Codeの既定モデルとなり、その後Mistral APIに登場した。M3.1-Flash-PreviewもMiniMax Codeで先行し、次にToken Planへ加わった。指示もエージェント間で共有され始めている。Copilot CLIのプレビュー版1.0.89-5はClaude Code向けに書かれた.claude/rulesファイルを読み込むため、少なくともこのプレビュー版では、同じリポジトリから同じルールで両方のエージェントを導ける。


出典