ai-powered-markdown-translator文章由 gpt-6.1-sol 从法语翻译成中文。
10 月 3 日星期六,Aleph Alpha 发布了 Kolibri,这是一款采用 Apache 2.0 许可、拥有 781 亿参数的英德双语开放权重模型。Cohere 当晚转发了这一消息,其与 Aleph Alpha 的合并仍在等待监管批准。前一天,Meta 将安全框架扩展至模型训练阶段,OpenAI 的 Agents API 则新增了三种沙箱规格。Devin 9 月 30 日的发行说明宣布其成为 Jira 原生智能体,Qwen-Image-2.1-Pro 以每张图像 0,04 美元的价格开放 API,Apron 的开发者则介绍了如何在租用显卡前预测开放模型所需的 GPU 内存。
Aleph Alpha 以 Apache 2.0 许可发布 Kolibri,一款拥有 780 亿参数的英德双语模型
10 月 3 日 — 在德国统一日当天,Aleph Alpha 发布了 Kolibri,一款开放权重的英德双语语言模型。这款混合专家模型(Mixture-of-Experts)拥有 781 亿参数,每个 token 激活其中的 34.6 亿参数,其权重已在 Hugging Face 上以 Apache 2.0 许可发布。Aleph Alpha 将其定位于受监管行业的自主可控工作场景:公共行政、工业和航空航天。
其架构首先着眼于降低服务成本:384 个专家中激活 6 个,50 层中的 40 层使用仅包含 512 个 token 的滑动窗口。模型最多支持 1 048 576 个 token,但训练时的最大长度为 262 144,其模型说明也建议不要超过这一长度。根据文章介绍,一个拥有 1230 亿参数的版本在两张 H100 上只能处理 3 个长度为 256k token 的请求,而最终选定的规模可处理 18 个。训练在德国和芬兰使用了 768 张 B200 GPU,处理了近 24T token;德语占预训练数据的 21,3 %。
根据 Aleph Alpha 的测量结果(使用自研评测工具,推理强度设为最高),Kolibri 的综合得分超过 Qwen3.5 35B-A3B 和激活 120 亿参数的 Nemotron 3 Super,但稠密模型 Qwen3.8 27B 几乎在所有项目上仍然领先:
| Benchmark(Aleph Alpha 测量结果) | Kolibri 78B-A3,46B | Qwen3.5 35B-A3B | Nemotron 3 Super 120B-A12B | Mistral Small 4 119B-A6B | Qwen3.8 27B(稠密) |
|---|---|---|---|---|---|
| 综合得分(英语) | 75,5 | 74,7 | 73,0 | 63,1 | 80,2 |
| 综合得分(德语) | 70,8 | 69,8 | 67,9 | 61,4 | 79,9 |
| GPQA Diamond(英语) | 84,3 | 83,8 | 78,0 | 74,7 | 89,2 |
| AIME 2026(英语) | 96,0 | 92,1 | 90,4 | 83,1 | 97,7 |
| SWE-Bench Verified | 66,4 | 71,6 | 60,2 | 60,8 | 72,6 |
因此,Aleph Alpha 的卖点是质量与服务成本之间的帕累托前沿,而非排名第一。Kolibri 还接受了弃答训练:在其未能正确作答的 AA-Omniscience 问题中,有 44 % 选择不作答或仅部分作答,而非给出错误答案。它在德国开发,“不受外国控制”(不受外国控制),设计时考虑了 AI Act 和 RGPD,并可在本地部署;此次发布还附带一份近 200 页的技术报告。
Cohere 与 Aleph Alpha 合并的最终协议仍须获得监管批准。继其首席执行官艾丹·戈麦斯表示祝贺后,Cohere 当晚也转发了发布消息;Kolibri 仍是 Aleph Alpha 的模型。
New Apache 2.0 model from @Aleph__Alpha. It’s really good. If you like that, you’re going to love what we build together.
🇨🇳 Aleph Alpha 推出了采用 Apache 2.0 许可的新模型。它确实很出色。如果你喜欢这个模型,你一定会爱上我们接下来共同打造的成果。 — @cohere 在 X 上
🔗 Aleph Alpha 的文章 · Hugging Face 上的权重
Meta 将安全框架扩展至训练阶段,并明确开放权重的规则
10 月 2 日 — Meta Superintelligence Labs 更新了 Meta Superintelligence Scaling Framework,该框架规定了训练和部署前的安全要求。据 Meta 介绍,此版本反映了本周在白宫作出的承诺,包括实施内部控制,并由公司内部的独立团队以及外部审计机构或评估人员进行验证。
失控(loss of control)风险如今也纳入训练和评估阶段的管控,因为据 Meta 表示,网络安全能力强的模型可能利用其运行环境中的漏洞。存在风险的强化学习训练必须使用经过验证的沙箱、包含思维链在内的不可篡改日志,以及能够停止训练运行的自动监控。
对于开放权重,该框架考虑了发布后可能发生的修改,例如通过微调移除拒答行为。计划在未来几个月内成立的董事会人工智能委员会,将独立核查框架的遵守情况。该框架原名为“Advanced AI Scaling Framework”,在此次 2.1 版本中更名:4 月评估 Muse Spark 时采用的就是这一框架。
OpenAI 的 Agents API 新增三种沙箱规格,并支持环境复用
10 月 2 日 — 据 X 个人简介介绍,史蒂夫(@stevendcoffey)参与 OpenAI API 的开发。他列出了本周 Agents API 的更新,@OpenAIDevs 转发了这条消息。除三项 DevDay 内容回顾外,还有四项新内容。第一项已得到文档确认:在创建会话时设置的 environment.container_size 参数,用于选择 OpenAI 托管沙箱的 CPU 和内存配置。
| 容器规格 | 分配的 vCPU | 分配的内存 |
|---|---|---|
| small | 1 | 1 Go |
| medium(默认) | 2 | 4 Go |
| large | 4 | 16 Go |
其余三项仅出现在这条推文中:可通过控制面板配置子智能体、跨会话复用环境,以及可靠性提升,但未公布测量方法。
Overall better reliability: 99.97% turn reliability, fewer SSE disconnects, 20% faster tool calls 🪨
🇨🇳 整体可靠性提升:每轮可靠性达 99,97 %,SSE 断连更少,工具调用速度提升 20 %。 — @stevendcoffey 在 X 上
编程智能体:Devin 入驻 Jira,Antigravity CLI 1.2.13 和 1.2.14
Devin 成为 Jira 原生智能体,并将 Devin Review 的发现交给其会话处理
9 月 30 日 — Devin 9 月 30 日的发行说明包含 25 个条目。其中最主要的更新是 Devin 成为 Jira 的原生智能体(native agent):管理员安装 Devin for Jira 应用后,将工单分配给 Devin 或提及它,即可启动会话,并在 Jira 的智能体面板中跟踪进展。如果 Devin 无法启动(权限缺失、使用额度达到上限),Jira 会显示它给出的原因,而非通用错误信息。
对于由仍在运行的 Devin 会话创建的 pull request,Devin Review 会先将发现的问题(findings)交给该会话:启用自动修复(Auto-fix)后,Devin 会修复能够处理的问题,只有剩余问题才会发布。自动化流程新增了预先检查(preflight checks):每次触发后、Devin 开始工作前,会先执行脚本,以验证、补充或忽略该事件。文中未提及价格。
Antigravity CLI 1.2.13 和 1.2.14:重试等待时间、消息队列,以及无需 systemd 的 Remote Control
9 月 29 日和 30 日 — Google 的 Antigravity CLI 更新日志列出了两个版本。1.2.13 会遵循模型 API 指定的重试等待时间,而非固定等待 5 秒;如果等待时间超过 30 秒,或触及的是每日额度或计费上限,则立即放弃重试。
1.2.14(6 项改进、3 项修复)在 /config 中新增了 Queued Messages 选项:默认模式(Queue)下,在智能体工作期间发送的消息会等到当前轮次结束;在 Send Immediately 模式下,消息会中断当前轮次。在没有 systemd 用户服务管理器的 Linux 机器上,例如大多数容器,Remote Control 会将其守护进程作为普通后台进程启动,该进程不会在崩溃后或系统启动时自动重启。--json-schema 选项变得严格:无效模式会触发错误,并返回退出码 1。此次更新将用几天时间逐步推出。
Qwen-Image-2.1-Pro 在 Model Studio 和 QwenCloud 开放 API,每张图像 0,04 美元
10 月 2 日 — Alibaba 将 Qwen-Image-2.1-Pro 加入其 API 平台 Model Studio 的模型目录,适用于 International 服务范围;QwenCloud 也为其建立了标注“新增”的模型页面,Qwen 尚未发布相关推文或文章。该模型延续了 9 月 20 日以开放权重形式发布的 Qwen-Image-2.1:在同一个模型中支持图像生成和编辑,视觉生成部分拥有 70 亿参数,并原生支持透明图像。模型说明没有说明在线提供的版本是否与已发布的权重有所不同。
| 比较项目 | qwen-image-2.1-pro | qwen-image-2.0-pro |
|---|---|---|
| 每张输出图像的价格 | 0,04 美元 | 0,075 美元 |
| 免费额度 | 10 张图像 | 100 张图像 |
价格下降了近一半,但免费额度也缩减为原来的十分之一。在 QwenCloud 上,该模型每分钟最多支持 20 个请求,同时最多支持 10 次调用。
🔗 Model Studio 模型更新日志 · QwenCloud 模型页面
据作者介绍,Apron 可在租用前预测 14 个开放模型的 GPU 内存需求
10 月 3 日 — Apron 的开发者弗拉德·雷日科夫在 Hugging Face 社区博客上介绍了这款开源工具。它能在租用 GPU 前预测开放模型是否能装入内存,并在指定版本的 vLLM 下启动,随后再用真实显卡进行验证。
据作者介绍,在已启动的 14 个模型中,有 11 个模型的权重内存预测值与实测值相差不到 2 %,测试硬件从一张 RTX 4090 到八张 H200 不等。四个模型最初运行失败,后来通过修复解决,并经第二次启动验证;DeepSeek-V4.1-Flash 默认占用 189 Gio 主机内存,这部分占用无法通过仅检查 GPU 的方式发现。
作者提醒,每个模型只测量了一次启动,这些结果不构成任何排名。该命令行工具尚未准备好供外部使用,其代码仓库仍将自身描述为尚无实现的规格说明。
简讯
- Copilot CLI 1.0.92-3 与 Copilot SDK 1.0.17-preview.3 — Copilot CLI 预览版新增了一个选择器,可在对话开始前通过 Ctrl+E 打开,选择在本地或云端运行;SDK 预览版则实验性地支持在进行中的会话里替换客户端工具。最新稳定版仍为 1.0.91。🔗 CLI · 🔗 SDK
- 通过 API 调用 Copilot code review — 现在可以通过 REST 和 GraphQL API 请求 Copilot 审查,并在每次请求中指定投入级别;该功能已向 Pro、Pro+、Max、Business 和 Enterprise 套餐全面开放。文档估算,Lite 级别每次审查消耗价值 0.05 至 1 美元的人工智能额度,默认的 Balanced 级别则为 0.25 至 5 美元。🔗 来源
- Gemini CLI 夜间构建版 — 10 月 3 日的 v0.64.0-nightly 仅包含一项修复:回车键和空格键现在能够可靠地确认选项列表中的选择,包括在不支持 Kitty 键盘协议的终端上,例如 Windows 下 PyCharm 的终端;此前,在按下其他按键后不到 30 ms 内按下回车键,会被识别为 Shift+Enter。稳定版和预览版均未变化。🔗 来源
- DeepSeek Harness 0.2.1-alpha.1 — 这是第 25 个预览版,仍无稳定版。它新增了一个实验性的 Claude Code 模组兼容层;DeepSeek 表示,其目的是验证这些模组的 API 是否大体构成 Harness 插件所支持功能的子集,而非提供完整兼容性。🔗 来源
- Warp 中的 GPT-6.1 Sol — 9 月 29 日晚,Warp 在其智能体终端中开放了 GPT-6.1 Sol,可通过 Codex 或 ChatGPT 订阅使用;公告未给出价格,也未提供针对 Warp 的测评数据。🔗 来源
- grok-voice-transcribe-1.0 停止支持 — SpaceXAI 于 10 月 2 日停止支持其转录模型的旧版 API:请求将重定向至 grok-voice-transcribe-2.0,价格不变,且据 SpaceXAI 称,准确度更高。弃用计划已于 9 月 18 日公布,当时未给出日期。🔗 来源
- OpenAI 开发者九月回顾 — @OpenAIDevs 在一篇 X 文章中回顾了九月的开发者公告,涵盖 29 日的 DevDay,以及 GPT-6 Sol 和 Luna,没有发布新消息;唯一的补充说明是,OpenAI 的 Decisions API 自 9 月 29 日起处于有限预览阶段,文中称其即将全面开放,但未给出日期。🔗 来源
- ElevenLabs 的两项智能体部署 — Banner Health 将初级医疗预约交给 ElevenAgents 处理,支持转接人工并符合 HIPAA 要求;保险公司 Admiral 则介绍了其语音智能体的生产部署,每次修改都能在几小时内将覆盖流量从 1 % 提升至 100 %,此前则需要数周。两者均未公布成效数据。🔗 Banner Health · 🔗 Admiral
- Kling 4.0 开放抢先体验 — 日期为 9 月 30 日的 Kling 4.0 介绍博文说明,完整模型将在十月扩大部署前开放抢先体验,而 Kling 4.0 Flash 已于 9 月 28 日向 Ultra 年度订阅用户开放;同时新增了 21:9 画幅,但未给出价格、API 或准入标准。🔗 来源
- Runway Agent、Runway MCP 与 OpenAI 的 dots — Runway 更新日志列出了三项新增内容,未在 X 上发布公告:Runway Agent 使用 Seedance 2.5 的 Draft 模式,生成可在生成后继续加工的 480p 草稿;Ideogram 4.5 加入 Runway MCP,供付费套餐使用;Runway 自 10 月 1 日起可在 OpenAI 的 dots 中使用。未说明任何额度消耗。🔗 来源
- GitHub Apps 的无状态令牌 — 在非人工智能领域,GitHub 完成了自 4 月 27 日开始的部署,所有新生成的 GitHub Apps 安装令牌均采用无状态格式
ghs_APPID_JWT:长度约为 520 个字符,而此前为 40 个;权限和一小时有效期均不变。测试请求头X-GitHub-Stateless-S2S-Token将于 2026 年 11 月 30 日弃用。🔗 来源 - Rapidata 的实时人工反馈 — Rapidata 介绍了其 Flows 功能,该功能以实时人工成对比较替代 Flow-GRPO 的奖励模型;这篇供应商博文未公布任何实测训练结果。🔗 来源
- 衡量智能体之间的依赖关系 — 在一篇没有实验或测量数据的文章中,阿努阿尔·伊梅尔提出,应根据智能体之间的依赖关系,而非智能体数量来评估多智能体系统,并在每一轮跟踪准确性、推理的多样性以及智能体之间的耦合程度。🔗 来源
这意味着什么
Kolibri 表明,开放模型即使不追求第一名,也能具备竞争力。Aleph Alpha 自行公布的测评显示,稠密模型 Qwen3.8 27B 几乎在所有项目上都领先于 Kolibri,而它强调的是另一个标准:用少量 GPU 服务大量长请求,同时支持英语和德语,并采用允许完全本地部署的许可证。对于受 AI Act 和 RGPD 约束的政府部门或工业企业,这种权衡可能比基准测试中多出的几分更重要。Cohere 与 Aleph Alpha 的整合仍在等待监管批准,但 Cohere 已承诺带来后续成果。
服务成本正成为开放模型的核心议题。Qwen-Image-2.1 于 9 月 20 日以开放权重形式发布,如今以 Qwen-Image-2.1-Pro 的名称通过 API 提供服务,每张图片 0.04 美元,比上一代便宜近一半,适合不想自行部署的用户。Apron 的博文则提醒人们,自行部署需要应对哪些问题:模型可能因缺少某项 vLLM 设置而无法启动,也可能占用 189 Gio 的主机内存,而仅检查 GPU 的验证流程无法察觉这一点。
Meta 将安全措施提前到部署之前。高风险的强化学习训练现在必须使用经过验证的沙箱、不可篡改的日志和自动停止机制,因为擅长网络安全的模型可能会利用自身运行环境中的漏洞。宣布在董事会内设立的人工智能委员会,还必须独立核查这些规则是否得到执行。至于在白宫作出的承诺,Meta 表示这些措施体现了相关承诺,但博文仅介绍了其基本原则:内部控制措施由公司内的独立团队,以及外部审计人员或评估人员核查。
最后,智能体正融入工具和运维流程。OpenAI 允许选择沙箱大小,并在不同会话之间复用环境;Devin 集成到 Jira,并在发布自身审查结果前修复发现的问题;Copilot code review 可通过 API 触发,并按投入级别估算费用。Antigravity CLI 遵循服务器规定的重试等待时间,并让 Remote Control 在容器中运行:这些更多是运维设置,而非引人注目的功能,但当智能体持续运行时,它们才是关键。
来源
- Aleph Alpha 关于 Kolibri 的博文
- Hugging Face 上的 Kolibri-1
- @Aleph__Alpha 发布的 Kolibri 公告
- Kolibri 技术报告(PDF)
- @cohere 对 Kolibri 的转发
- 艾丹·戈麦斯的祝贺
- Cohere 与 Aleph Alpha 的最终协议
- 负责任地开发高能力模型(Meta)
- Meta 超级智能扩展框架
- @stevendcoffey 介绍的 Agents API 新功能
- @OpenAIDevs 的转发
- OpenAI 托管的沙箱(OpenAI 文档)
- Devin 9 月 30 日版本说明
- Antigravity 更新日志
- Model Studio 模型日志
- Model Studio 价格
- QwenCloud 上的 qwen-image-2.1-pro 说明页
- 我知道你在运行 LLMs。它能启动吗?(Hugging Face)
- Apron 的 GitHub 仓库
- Copilot CLI v1.0.92-3
- GitHub Copilot SDK v1.0.17-preview.3
- Copilot code review:API 支持与新的默认投入级别(GitHub)
- Gemini CLI 10 月 3 日的夜间构建版 v0.64.0
- DeepSeek Harness 0.2.1-alpha.1 版本说明
- Warp 中的 GPT-6.1 Sol(@warpdotdev)
- SpaceXAI API 版本说明
- OpenAI 开发者九月回顾(@OpenAIDevs)
- ElevenLabs 在 Banner Health 的应用
- Admiral 网络研讨会回顾(ElevenLabs)
- Kling 4.0 介绍
- Runway 更新日志
- GitHub App 无状态安装令牌已全面推出(GitHub)
- 训练循环中的实时人工反馈(Rapidata)
- 当人工智能智能体成为彼此的证据(阿努阿尔·伊梅尔)