ai-powered-markdown-translator使用 gpt-6-sol 将文章从法语翻译成中文。
ESPnet 发布 YODAS v3:这个开放语音数据集包含 110 万小时、覆盖 100 多种语言的音频,规模是第一版的三倍,全部采用 48 kHz 采样率。Mistral 现已通过其 API 提供 Z.ai 的开放权重模型 GLM 5.3,支持 100 万 token 上下文,并提供 99.5% 的 SLA。JEV-27B 和 OpenDecider 这两个开放决策模型则宣称,在各自作者运行的基准测试中达到了 Jev 的水平。MiniMax 推出 M3.1-Flash-Preview,但未公布基准测试结果或 API 价格。简讯还涉及可读取 Claude Code 规则的 Copilot CLI 预览版,以及 OpenRouter 上免费的匿名模型 Space Bunny Alpha。
ESPnet 发布 YODAS v3:110 万小时、48 kHz 的开放语音数据
9 月 27 日 — ESPnet 团队的 William Chen 和 Shinji Watanabe 发布 YODAS v3。这个多语言语音数据集包含 110 万小时音频,规模是第一版的三倍。所有音频均以 48 kHz 分发;由于许多网络音频经过上采样,元数据还标明了实际有效的采样率。
| YODAS v3 特性 | 公布的数据 |
|---|---|
| 覆盖语言 | 100 多种,其中 34 种超过 1,000 小时 |
| 多声道音频 | 超过 70% 至少有两个不同声道 |
| 标注 | 精确到词的时间戳转录;超过半数的多语言内容配有英文翻译 |
| 规模与许可证 | 60 To,OPUS 格式,CC BY 3.0 |
作者称,这一数据量足以从零训练出达到 Whisper 水平的模型。第一版下载量超过 250 万次,曾用于训练 IBM Granite、NVIDIA Canary、Parakeet 以及 Ai2 的 OLMoASR。相关论文收录于 Interspeech 2026 会议论文集。
Mistral 通过其 API 提供 Z.ai 的 GLM 5.3:100 万 token 上下文和 99.5% 的 SLA
9 月 26 日 — Z.ai 于 8 月 14 日推出 GLM 5.3,并于 28 日开放其权重。新进展是:据 @MistralDevs 宣布,该模型现已接入 Mistral API。公开预览版的标识符为 zai-glm-5-3。Mistral 在自己的基础设施上提供未经修改的模型,支持 100 万 token 上下文、128k 输出、每秒超过 100 token 的生成速度,并在优先级服务层级(priority tier)提供 99.5% 的 SLA。
| 每百万 token 的价格 | Mistral API | Together AI(8 月 29 日) |
|---|---|---|
| 输入 | 1.40 美元 | 1.40 美元 |
| 缓存输入 | 0.14 美元 | 0.26 美元 |
| 输出 | 4.40 美元 | 4.40 美元 |
Mistral 曾于 8 月 11 日宣布向第三方模型开放平台,首个接入的是 GLM 5.2。GLM 5.3 则于 9 月 21 日进入 Vibe Code,成为其网页应用的默认模型。
🔗 @MistralDevs 的公告 · 模型资料
开放决策模型:AutoTrust AI 的 JEV-27B 和 OpenDecider 对比 Jev
9 月 27 日的两篇社区文章分别发布了采用 Apache-2.0 许可证的开放决策模型。这类模型针对智能体提出的简短结构化问题——判断真假、多项选择或评分——快速给出答案,并为每个答案提供概率。它们比 Together AI 的 Tev1-4B-experimental 晚四天发布,均与 TypeSafe AI 的闭源托管模型 Jev 1.13 进行了比较;以下分数来自各自作者的测试。
AutoTrust AI 的 JEV-27B:作者称平均表现与 Jev 1.13 持平
9 月 27 日 — AutoTrust AI 表示自己与 TypeSafe AI 没有关联,并发布了 JEV-27B:一个利用开放语料库从 Jev 1.13 蒸馏而来的学生模型。训练方法将 Qwen3.8-27B 冻结,再添加一个包含 1.089 亿参数的可拆卸模块;训练在一张 B200 上耗时约 9.2 小时。基础模型保持不变,在 HumanEval 上的成绩仍为 78.0%。作者于 9 月 26 日测得的分数如下:
| 决策基准测试 | JEV-27B | Jev 1.13(API) |
|---|---|---|
| JevBench(公开测试集) | 88,70 | 87,18 |
| Kev | 83,75 | 85,52 |
| OpenJev text | 73,89 | 72,96 |
| Nimble | 92,91 | 91,84 |
| VitaminC | 77,46 | 78,46 |
| MASSIVE-en | 87,71 | 87,14 |
| 六项平均值 | 84,07 | 83,85 |
在 B200 上,每次决策的延迟中位数为 137 ms。作者承认,持平的结论仅适用于平均分,学生模型也继承了 Jev 的盲点;他们表示将提交模型参加独立排行榜评测。
OpenDecider:4 亿参数的 nano 模型在 typed-decisions 上超过 Laya 和 Jev
9 月 27 日 — Manjunath Janardhan 发布决策模型家族 OpenDecider:基于 Ettin 编码器、约有 4 亿参数的 nano,基于 Qwen3-4B、拥有 40 亿参数的 small,以及适用于 Mac 的 MLX 版本。这些模型由两个开放教师模型 Qwen3-235B 和 DeepSeek V4.1 Flash 蒸馏而来,GPU 成本不到 30 美元。
| 参评模型 | typed-decisions(2 000) | 未见过的通用决策(200) | 校准误差 |
|---|---|---|---|
| OpenDecider-nano | 0,796 | 0,680 | 0,092 |
| OpenDecider-small | 0,672 | 0,735 | 0,087 |
| Laya(专用检查点) | 0,766 | 0,570 | 0,162 |
| Jev 1.13(API) | 0,754 | 0,730 | 0,164 |
按作者的测试结果,small 在从未见过的决策任务上与 Jev 持平,校准误差则几乎低了一半。Jev 在 Laya 的应用测试集上仍领先,得分为 0,774;其中网络钓鱼检测的成绩为 0,90,对比之下 OpenDecider 为 0,63。作者公布了预测结果和可复现的基准测试,但结果只基于一个随机种子。
MiniMax 在 MiniMax Code 和 Token Plan 中推出 M3.1-Flash-Preview,未公布基准测试或 API 价格
9 月 27 日 — MiniMax 将预览版 M3.1-Flash-Preview 介绍为其最新文本模型。它于当天上午率先进入 MiniMax Code——该公司的编程智能体,随后在晚上加入 MiniMax 平台的订阅服务 Token Plan:
MiniMax-M3.1 Flash Preview is now live on the Token Plan! Faster, lighter, and built for teams running high-volume, latency-sensitive workloads, now available under your existing Token Plan subscription, no extra setup required.
🇨🇳 MiniMax-M3.1 Flash Preview 现已加入 Token Plan!它速度更快、更轻量,专为运行高吞吐量、对延迟敏感的工作负载的团队设计。现有 Token Plan 订阅用户无需进行任何额外配置,即可使用。 — @MiniMax_AI 在 X 上
MiniMax 尚未公布基准测试结果、API 价格、模型规模、上下文窗口或权重;其模型更新说明仍只更新到 7 月 31 日。
简讯
- Copilot CLI 读取 Claude Code 的规则 — 在 9 月 27 日发布的 1.0.89-5 预览版中,Copilot CLI 支持将存放在
.claude/rules中的 Claude Code 规则文件作为自定义指令;更新说明没有明确支持的格式或优先级顺序。目前尚未发布稳定版 1.0.89。🔗 来源 - mistral CLI 0.7.0 — Mistral 的命令行工具于 9 月 26 日发布了这一版本,但未另行公告。新版本增加了
mistral apps deploy,可将应用部署到平台直至生产环境;增加了mistral apps publish,可将应用发布到 Vibe 目录;还增加了用于离线评估的mistral evals。🔗 来源 - Perplexity 的 Agent API 切换至 GPT-6 — 补充 9 月 25 日的消息:low 和 medium 预设从
openai/gpt-5.6-luna切换到openai/gpt-6-luna,high 预设从openai/gpt-5.6-sol切换到openai/gpt-6-sol;提示词、推理力度、工具、token 预算和步骤限制保持不变。🔗 来源 - OpenRouter 上的 Space Bunny Alpha — 补充 9 月 23 日的消息:OpenRouter 上架了一个免费的匿名模型(stealth),未公布模型开发者;它支持 100 万 token 上下文,接受文本、图像和视频输入。运营该模型的第三方服务商可以保留提示词和回复,但不会将其用于训练;目前没有官方基准测试结果。🔗 来源
- 用于金融数字核查的 4B 评判模型 — Tony Esposito 发布了 FinCalc-NLI:一个涵盖十项银行业指标、标签由代码计算得出的合成数据集;同时发布了 openjev-fincalc-4b:一个在 A100 上微调 40 分钟、用于核查数字陈述的评判模型。在 4 000 个案例中,其正确率为 94.4%,而测试中表现最好的开放评判模型为 63.2%。🔗 来源
- 在配备 16 Go 内存的 Mac 上微调模型 — Harshit Kumar Gupta 在十次 LoRA 微调测试中测得,PyTorch MPS 的速度是 Apple MLX 的 2.2 至 5.7 倍,但可处理的模型规模约止于 15 亿参数;MLX 使用 4 位量化则能容纳 30 亿参数的模型。两套技术栈采用的 LoRA 秩和优化器不同。🔗 来源
这意味着什么
开放数据仍是开放模型背后不太显眼的基础设施。据作者介绍,第一版 YODAS 已用于训练 IBM、NVIDIA 和 Ai2 的模型。v3 将数据量扩大至三倍,提供 48 kHz 多声道音频,并继续采用 CC BY 3.0 许可证;作者认为,这足以从零训练出达到 Whisper 水平的模型。当天发布的决策模型也沿着这条路径:JEV-27B 使用开放语料库学习,OpenDecider 以不到 30 美元的成本从两个开放教师模型中蒸馏,两者都以 Apache-2.0 许可证发布。
开放权重模型也成为服务商目录中的一项产品,托管服务的差异随之凸显。GLM 5.3 在 Mistral 和 Together AI 的非缓存价格相同:每百万 token 的输入价格为 1.40 美元,输出价格为 4.40 美元。Mistral 强调其缓存输入价格为 0.14 美元,低于 Together AI 的 0.26 美元;此外还提供每秒超过 100 token 的生成速度和 99.5% 的 SLA。自接入 GLM 5.2 起,Mistral 便开始托管第三方模型,因此它如今既开发模型,也提供托管服务。Perplexity 的底层模型同样发生变化:通过 Agent API 预设发出的请求现在运行在 GPT-6 上,即使开发者没有亲自选择这一模型。
评测结果仍需检验。JEV-27B 和 OpenDecider 宣称在各自作者运行的基准测试中与 Jev 持平;作者至少公开了局限、预测结果或可复现的测试集。他们自己的表格也显示,Jev 在 VitaminC、网络钓鱼检测等多项测试中仍然领先。另一边,MiniMax 推出的模型没有任何可核查的数据:没有基准测试结果、API 价格或上下文窗口。在这两种情况下,独立评测都有待完成;AutoTrust AI 已表示会提交模型参加独立排行榜评测。
在 Mistral 和 MiniMax,模型都先进入自家的编程智能体:GLM 5.3 于 9 月 21 日成为网页端 Vibe Code 的默认模型,随后才接入 Mistral API;M3.1-Flash-Preview 则先在 MiniMax Code 亮相,再进入 Token Plan。指令也开始在智能体之间流通:Copilot CLI 的 1.0.89-5 预览版能够读取为 Claude Code 编写的 .claude/rules 文件。因此,至少在这个预览版中,同一代码仓库可以用同一套规则指导这两个智能体。
来源
- YODAS v3(Hugging Face 博客)
- espnet/yodas3 数据集(Hugging Face)
- Interspeech 2026 会议论文集中的 YODAS v3 论文(ISCA Archive)
- @MistralDevs:Mistral API 上的 GLM 5.3
- zai-glm-5-3 模型资料(Mistral 文档)
- @mistralvibe:Vibe Code 中的 GLM 5.3
- @togethercompute:Together AI 上的 GLM-5.3
- Together AI 上的 GLM-5.3 资料和价格
- AutoTrust AI 的 JEV-27B 文章(Hugging Face 博客)
- autotrust/JEV-27B 模型(Hugging Face)
- OpenDecider 文章(Hugging Face 博客)
- OpenDecider 的 GitHub 仓库
- @MiniMax_AI:Token Plan 中的 M3.1 Flash Preview
- @MiniMaxAgent:MiniMax Code 中的 M3.1-Flash-Preview
- Copilot CLI 1.0.89-5(GitHub)
- mistral CLI 0.7.0(GitHub)
- Perplexity API 更新日志
- Space Bunny Alpha(OpenRouter)
- Tony Esposito 的 openjev-fincalc 评判模型(Hugging Face 博客)
- 在 Mac 上微调编程智能体:PyTorch MPS 与 MLX 对比(Hugging Face 博客)