搜索

ESPnet 推出规模扩大三倍的开放语音语料库 YODAS v3,Mistral 通过其 API 提供 GLM 5.3,JEV-27B 和 OpenDecider 宣称达到 Jev 的水平

由人工智能生成的文章
ESPnet 推出规模扩大三倍的开放语音语料库 YODAS v3,Mistral 通过其 API 提供 GLM 5.3,JEV-27B 和 OpenDecider 宣称达到 Jev 的水平

ai-powered-markdown-translator

使用 gpt-6-sol 将文章从法语翻译成中文。

在 GitHub 上查看项目 ↗

ESPnet 发布 YODAS v3:这个开放语音数据集包含 110 万小时、覆盖 100 多种语言的音频,规模是第一版的三倍,全部采用 48 kHz 采样率。Mistral 现已通过其 API 提供 Z.ai 的开放权重模型 GLM 5.3,支持 100 万 token 上下文,并提供 99.5% 的 SLA。JEV-27B 和 OpenDecider 这两个开放决策模型则宣称,在各自作者运行的基准测试中达到了 Jev 的水平。MiniMax 推出 M3.1-Flash-Preview,但未公布基准测试结果或 API 价格。简讯还涉及可读取 Claude Code 规则的 Copilot CLI 预览版,以及 OpenRouter 上免费的匿名模型 Space Bunny Alpha。


ESPnet 发布 YODAS v3:110 万小时、48 kHz 的开放语音数据

9 月 27 日 — ESPnet 团队的 William Chen 和 Shinji Watanabe 发布 YODAS v3。这个多语言语音数据集包含 110 万小时音频,规模是第一版的三倍。所有音频均以 48 kHz 分发;由于许多网络音频经过上采样,元数据还标明了实际有效的采样率。

YODAS v3 特性公布的数据
覆盖语言100 多种,其中 34 种超过 1,000 小时
多声道音频超过 70% 至少有两个不同声道
标注精确到词的时间戳转录;超过半数的多语言内容配有英文翻译
规模与许可证60 To,OPUS 格式,CC BY 3.0

作者称,这一数据量足以从零训练出达到 Whisper 水平的模型。第一版下载量超过 250 万次,曾用于训练 IBM Granite、NVIDIA Canary、Parakeet 以及 Ai2 的 OLMoASR。相关论文收录于 Interspeech 2026 会议论文集。

🔗 Hugging Face 博客上的 YODAS v3


Mistral 通过其 API 提供 Z.ai 的 GLM 5.3:100 万 token 上下文和 99.5% 的 SLA

9 月 26 日 — Z.ai 于 8 月 14 日推出 GLM 5.3,并于 28 日开放其权重。新进展是:据 @MistralDevs 宣布,该模型现已接入 Mistral API。公开预览版的标识符为 zai-glm-5-3。Mistral 在自己的基础设施上提供未经修改的模型,支持 100 万 token 上下文、128k 输出、每秒超过 100 token 的生成速度,并在优先级服务层级(priority tier)提供 99.5% 的 SLA。

每百万 token 的价格Mistral APITogether AI(8 月 29 日)
输入1.40 美元1.40 美元
缓存输入0.14 美元0.26 美元
输出4.40 美元4.40 美元

Mistral 曾于 8 月 11 日宣布向第三方模型开放平台,首个接入的是 GLM 5.2。GLM 5.3 则于 9 月 21 日进入 Vibe Code,成为其网页应用的默认模型。

🔗 @MistralDevs 的公告 · 模型资料


开放决策模型:AutoTrust AI 的 JEV-27B 和 OpenDecider 对比 Jev

9 月 27 日的两篇社区文章分别发布了采用 Apache-2.0 许可证的开放决策模型。这类模型针对智能体提出的简短结构化问题——判断真假、多项选择或评分——快速给出答案,并为每个答案提供概率。它们比 Together AI 的 Tev1-4B-experimental 晚四天发布,均与 TypeSafe AI 的闭源托管模型 Jev 1.13 进行了比较;以下分数来自各自作者的测试。

AutoTrust AI 的 JEV-27B:作者称平均表现与 Jev 1.13 持平

9 月 27 日 — AutoTrust AI 表示自己与 TypeSafe AI 没有关联,并发布了 JEV-27B:一个利用开放语料库从 Jev 1.13 蒸馏而来的学生模型。训练方法将 Qwen3.8-27B 冻结,再添加一个包含 1.089 亿参数的可拆卸模块;训练在一张 B200 上耗时约 9.2 小时。基础模型保持不变,在 HumanEval 上的成绩仍为 78.0%。作者于 9 月 26 日测得的分数如下:

决策基准测试JEV-27BJev 1.13(API)
JevBench(公开测试集)88,7087,18
Kev83,7585,52
OpenJev text73,8972,96
Nimble92,9191,84
VitaminC77,4678,46
MASSIVE-en87,7187,14
六项平均值84,0783,85

在 B200 上,每次决策的延迟中位数为 137 ms。作者承认,持平的结论仅适用于平均分,学生模型也继承了 Jev 的盲点;他们表示将提交模型参加独立排行榜评测。

🔗 AutoTrust AI 的文章

OpenDecider:4 亿参数的 nano 模型在 typed-decisions 上超过 Laya 和 Jev

9 月 27 日 — Manjunath Janardhan 发布决策模型家族 OpenDecider:基于 Ettin 编码器、约有 4 亿参数的 nano,基于 Qwen3-4B、拥有 40 亿参数的 small,以及适用于 Mac 的 MLX 版本。这些模型由两个开放教师模型 Qwen3-235B 和 DeepSeek V4.1 Flash 蒸馏而来,GPU 成本不到 30 美元。

参评模型typed-decisions(2 000)未见过的通用决策(200)校准误差
OpenDecider-nano0,7960,6800,092
OpenDecider-small0,6720,7350,087
Laya(专用检查点)0,7660,5700,162
Jev 1.13(API)0,7540,7300,164

按作者的测试结果,small 在从未见过的决策任务上与 Jev 持平,校准误差则几乎低了一半。Jev 在 Laya 的应用测试集上仍领先,得分为 0,774;其中网络钓鱼检测的成绩为 0,90,对比之下 OpenDecider 为 0,63。作者公布了预测结果和可复现的基准测试,但结果只基于一个随机种子。

🔗 OpenDecider 的文章


MiniMax 在 MiniMax Code 和 Token Plan 中推出 M3.1-Flash-Preview,未公布基准测试或 API 价格

9 月 27 日 — MiniMax 将预览版 M3.1-Flash-Preview 介绍为其最新文本模型。它于当天上午率先进入 MiniMax Code——该公司的编程智能体,随后在晚上加入 MiniMax 平台的订阅服务 Token Plan:

MiniMax-M3.1 Flash Preview is now live on the Token Plan! Faster, lighter, and built for teams running high-volume, latency-sensitive workloads, now available under your existing Token Plan subscription, no extra setup required.

🇨🇳 MiniMax-M3.1 Flash Preview 现已加入 Token Plan!它速度更快、更轻量,专为运行高吞吐量、对延迟敏感的工作负载的团队设计。现有 Token Plan 订阅用户无需进行任何额外配置,即可使用。 — @MiniMax_AI 在 X 上

MiniMax 尚未公布基准测试结果、API 价格、模型规模、上下文窗口或权重;其模型更新说明仍只更新到 7 月 31 日。

🔗 MiniMax Code 首发消息,发布于 X


简讯

  • Copilot CLI 读取 Claude Code 的规则 — 在 9 月 27 日发布的 1.0.89-5 预览版中,Copilot CLI 支持将存放在 .claude/rules 中的 Claude Code 规则文件作为自定义指令;更新说明没有明确支持的格式或优先级顺序。目前尚未发布稳定版 1.0.89。🔗 来源
  • mistral CLI 0.7.0 — Mistral 的命令行工具于 9 月 26 日发布了这一版本,但未另行公告。新版本增加了 mistral apps deploy,可将应用部署到平台直至生产环境;增加了 mistral apps publish,可将应用发布到 Vibe 目录;还增加了用于离线评估的 mistral evals。🔗 来源
  • Perplexity 的 Agent API 切换至 GPT-6 — 补充 9 月 25 日的消息:low 和 medium 预设从 openai/gpt-5.6-luna 切换到 openai/gpt-6-luna,high 预设从 openai/gpt-5.6-sol 切换到 openai/gpt-6-sol;提示词、推理力度、工具、token 预算和步骤限制保持不变。🔗 来源
  • OpenRouter 上的 Space Bunny Alpha — 补充 9 月 23 日的消息:OpenRouter 上架了一个免费的匿名模型(stealth),未公布模型开发者;它支持 100 万 token 上下文,接受文本、图像和视频输入。运营该模型的第三方服务商可以保留提示词和回复,但不会将其用于训练;目前没有官方基准测试结果。🔗 来源
  • 用于金融数字核查的 4B 评判模型 — Tony Esposito 发布了 FinCalc-NLI:一个涵盖十项银行业指标、标签由代码计算得出的合成数据集;同时发布了 openjev-fincalc-4b:一个在 A100 上微调 40 分钟、用于核查数字陈述的评判模型。在 4 000 个案例中,其正确率为 94.4%,而测试中表现最好的开放评判模型为 63.2%。🔗 来源
  • 在配备 16 Go 内存的 Mac 上微调模型 — Harshit Kumar Gupta 在十次 LoRA 微调测试中测得,PyTorch MPS 的速度是 Apple MLX 的 2.2 至 5.7 倍,但可处理的模型规模约止于 15 亿参数;MLX 使用 4 位量化则能容纳 30 亿参数的模型。两套技术栈采用的 LoRA 秩和优化器不同。🔗 来源

这意味着什么

开放数据仍是开放模型背后不太显眼的基础设施。据作者介绍,第一版 YODAS 已用于训练 IBM、NVIDIA 和 Ai2 的模型。v3 将数据量扩大至三倍,提供 48 kHz 多声道音频,并继续采用 CC BY 3.0 许可证;作者认为,这足以从零训练出达到 Whisper 水平的模型。当天发布的决策模型也沿着这条路径:JEV-27B 使用开放语料库学习,OpenDecider 以不到 30 美元的成本从两个开放教师模型中蒸馏,两者都以 Apache-2.0 许可证发布。

开放权重模型也成为服务商目录中的一项产品,托管服务的差异随之凸显。GLM 5.3 在 Mistral 和 Together AI 的非缓存价格相同:每百万 token 的输入价格为 1.40 美元,输出价格为 4.40 美元。Mistral 强调其缓存输入价格为 0.14 美元,低于 Together AI 的 0.26 美元;此外还提供每秒超过 100 token 的生成速度和 99.5% 的 SLA。自接入 GLM 5.2 起,Mistral 便开始托管第三方模型,因此它如今既开发模型,也提供托管服务。Perplexity 的底层模型同样发生变化:通过 Agent API 预设发出的请求现在运行在 GPT-6 上,即使开发者没有亲自选择这一模型。

评测结果仍需检验。JEV-27B 和 OpenDecider 宣称在各自作者运行的基准测试中与 Jev 持平;作者至少公开了局限、预测结果或可复现的测试集。他们自己的表格也显示,Jev 在 VitaminC、网络钓鱼检测等多项测试中仍然领先。另一边,MiniMax 推出的模型没有任何可核查的数据:没有基准测试结果、API 价格或上下文窗口。在这两种情况下,独立评测都有待完成;AutoTrust AI 已表示会提交模型参加独立排行榜评测。

在 Mistral 和 MiniMax,模型都先进入自家的编程智能体:GLM 5.3 于 9 月 21 日成为网页端 Vibe Code 的默认模型,随后才接入 Mistral API;M3.1-Flash-Preview 则先在 MiniMax Code 亮相,再进入 Token Plan。指令也开始在智能体之间流通:Copilot CLI 的 1.0.89-5 预览版能够读取为 Claude Code 编写的 .claude/rules 文件。因此,至少在这个预览版中,同一代码仓库可以用同一套规则指导这两个智能体。


来源