搜索

GPT-6 Astra 面向大众开放,Claude 形式化证明费马大定理,GitHub 通过 HydraFusion 编排多个模型

ai-powered-markdown-translator

使用 gpt-5.6-sol 将文章从法语翻译成中文。

在 GitHub 上查看项目 ↗

GPT-6 Astra 在发布二十四小时后结束限制性部署:该模型现已向 Pro、Enterprise 和 Business Premium 套餐开放,在 GitHub Copilot 中正式全面可用,并在 Perplexity 的有据可查研究基准测试中取得其有史以来测得的最高分。与此同时,Anthropic 发布了首个经计算机验证的费马大定理证明,由 Claude 在十一天内完成。GitHub 开放 HydraFusion,这一模式可为每项任务自主选择模型与工作流;Google 在 Gemini 应用中发布 Lyria 3.5;SpaceXAI 则面向企业开放 Grok Bot,并公开介绍了一个为其雇主节省超过 100,000 美元的采购智能体。


GPT-6 Astra 结束限制性部署并在 Copilot 中正式全面可用

9 月 4 日 — OpenAI 于巴黎时间 22 时 13 分宣布,GPT-6 Astra 正式结束限制性部署。所有 Pro、Enterprise 和 Business Premium 用户现均可在 ChatGPT Work 和 Codex 中使用该模型,API 也已全面开放,不再像 9 月 3 日的公告那样受分阶段部署限制。同一消息还指出,Plus 订阅者和 Business 用户仍需再等待几天。

涉及的平台9 月 4 日的开放情况
OpenAI API全面开放
ChatGPT Work 和 Codex、Pro已开放
Enterprise 和 Business Premium已开放
Plus 和其他 Business 套餐延迟数日

🔗 OpenAI 在 X 上的公告

在 GitHub Copilot 中正式全面可用,首日起即按公开价格计费

同一天,GPT-6 Astra 在 GitHub Copilot 中正式全面可用。GitHub 强调的是该模型的工作方式,而非评分:在内部测试中,Astra 会在执行过程中进行规划和验证,将诊断与核验结合起来,并在宣布任务完成前自行确认结果,因此在长时任务中,它以比以往 OpenAI 模型更少的步骤取得了更好的表现。公告未附带任何基准测试数据。

该模型出现在十个平台中,涵盖 Visual Studio Code、JetBrains IDE、Copilot CLI、GitHub Mobile、Xcode 和 Eclipse,但仍仅限 Pro+、Max、Business 和 Enterprise 套餐使用。Copilot Pro 未被纳入。计费方式值得注意:Astra 从第一天起即按供应商的公开价格按量计费,没有促销期;相比之下,前一天推出的 Gemini 3.8 Flash 可享受截至 2026 年 12 月 31 日的推广价格。

🔗 GitHub 更新日志

Perplexity 给予其 WANDR 最高评分

Perplexity 于 9 月 3 日 23 时 10 分公布了 Astra 在 WANDR 上的成绩;WANDR 是该公司用于大规模有据可查研究的内部基准测试。该模型取得 0.682 分,每项任务成本为 11.98 美元,是该公司测试过的所有模型中的最高分。

受测模型WANDR 分数每项任务成本测量结果发布日期
GPT-6 Astra0.68211.98 美元2026 年 9 月 3 日
Claude Fable 5.10.60112.76 美元2026 年 9 月 1 日

Perplexity 还给出了两组相对差异:与 Claude Fable 5.1 相比,得分高出 13.5%,成本低 6.1%;与 Opus 5 相比,得分高出 27.0%,成本高 3.3%。不过有两点需要保留意见。WANDR 是专有基准测试,其详细方法并未公开,而 Perplexity 同时也是其所评模型的客户。该公司没有公布 Opus 5 的任何绝对数值。

🔗 Perplexity 在 X 上公布的测量结果

三项 Codex CLI 修正完成集成

在命令行方面,9 月 3 日夜间发布的 0.153.0 版本之后,不到两天内又接连发布了三项修正,全部与 Astra 有关。0.153.1 支持通过 API 配置该模型,无需更改默认模型,也不会让它出现在选择器中。0.153.2 修正了一处标签:Fast 层级被描述为提供 2 倍而非 1.5 倍速度,但请求处理方式并未改变。于 9 月 4 日 21 时 01 分发布的 0.153.3,将 Astra 添加到 Mantle 和 Runtime 路由的 Amazon Bedrock 模型选择器中,并修正了针对异步澄清问题向模型提供的指令。

OpenAI 当天还补充了三篇实践分享:两篇开发者博客文章,其中一篇介绍在 Codex 中构建的程序化太空探索游戏,另一篇介绍使用 Blender 和 Unreal Engine 5 设计一座可供探索的房屋;此外还有 Dominik Kundel 撰写的一篇文章,介绍他使用 Codex 方式上的五项改变。

🔗 Codex CLI 0.153.3 版本说明 · 🔗 使用 Astra 构建游戏


Claude 完成首个费马大定理形式化证明

9 月 4 日 — Anthropic 发布了首个完全由计算机验证的费马大定理证明。Claude 用十一天时间完成了 Lean 版本的编写,其中大部分工作以自主方式进行。该公司称其为迄今构建的规模最大的 Lean 证明。

测量指标测得数值
Claude 的工作时长11 天
编写的 Lean 代码行数1300 万
证明的中间定理数量29,500
Wiles 完成的首个人类证明1995 年,129 页
从提出猜想到完成证明的时间跨度超过 350 年

该定理指出,当指数大于二时,不存在满足费马方程的正整数三元组。约在 1637 年,Pierre de Fermat 将其潦草地写在自己所藏 Diophantus《算术》一书的页边。首个正确证明由 Sir Andrew Wiles 于 1995 年完成:全文 129 页,历经数月人工验证,而他在 1993 年首次公布的版本,两个月后便被一位审稿人发现了一个关键漏洞。

最初的尝试均告失败,智能体虽能迅速取得一些进展,却随后失去方向。突破来自 Prove2Me,这是一个开放的协作式形式化平台,并与基于 Claude Code 的多智能体框架结合使用。该平台维护一个由命题组成的有向无环图,供智能体选择接下来要尝试证明的内容;它将命题与证明分别保存在不同文件中,以加快 Lean 编译;还为每个命题保留自然语言描述,以便搜索和复用。最终生成的证明遵循 Henri Darmon、Fred Diamond 和 Richard Taylor 对 Wiles 证明的简化阐释。

This extraordinary autoformalization achievement, which Anthropic researchers say only took 11 days, proves Fermat’s Last Theorem with no assumptions other than the axioms of mathematics.

🇨🇳 据 Anthropic 的研究人员称,这项非凡的自动形式化成果仅用十一天便告完成,它在除数学公理之外不依赖任何其他假设的情况下证明了费马大定理。 — 结果审稿人 Kevin Buzzard,引自 Anthropic 研究页面

Anthropic 将其意义定位于验证而非发现,这与近期人工智能围绕黎曼猜想开展并产生新数学成果的研究不同。随着证明数量持续增加,同行评审正成为一个以年计的瓶颈。

🔗 GitHub 上的完整证明


Project HydraFusion:GitHub 让工具而非开发者选择模型

9 月 4 日 — GitHub 开放 Project HydraFusion 研究预览版,这一模式不再指定某个模型,而是指定一个工作流。此前,Copilot 的选择器要求用户从二十多个模型中进行选择;HydraFusion 则会针对每个请求,自行决定由哪个模型处理任务以及采用何种执行方案。它的选择方式与任何普通模型相同,但在这一个选择背后会编排多个模型。

目前共有三种方案。Single 模式将任务交给单一模型。Cascade 模式先由一个高效模型拟定初步解决方案,再由质量关卡决定接受该方案,还是升级交给能力更强的模型。Critique 模式则让来自另一模型系列的独立只读评审模型审查草稿。

受测基准测试相较 Opus 5 的成本差异相较 Opus 5 的质量差异
TerminalBench 2.1低 67%高 4.9 个百分点
DeepSWE低 36%低 1.5 个百分点
CheckpointBench低 65%低 0.1 个百分点

执行过程受五项工程原则约束:汇总核算每个步骤的成本;明确设置超时与取消机制;在隔离且无工具的上下文中进行审查;采用内置安全机制,若工作流失败便不应用任何补丁;并在执行前验证路由。GitHub 坦承其界面存在取舍:系统会显示各个步骤,但在最终结果产生前不会展示中间草稿;该公司也承认,在缺乏足够可见性的情况下等待确实是一项明显缺点。

开发文档罕见地直言不讳:GitHub 将 TerminalBench 2.1 视为最完整的一组运行序列,明确指出进展并非线性,并承认评估框架的两次运行故障导致 8 月 11 日至 25 日间产生了无效运行。这些运行已从趋势中剔除并得到修正,该公司认为记录序列中的最佳运行点出现在 8 月 25 日。所有套餐均可通过 Copilot CLI 使用该功能,按工作流的 token 总量以标准费率计费;需先执行 /update,再执行 /experimental on

🔗 Project HydraFusion


Lyria 3.5 登陆 Gemini 应用与 API

9 月 4 日 — Google 发布 Lyria 3.5,并称其为自身声音还原效果最佳的音乐生成模型,能够呈现更富表现力的人声和更丰富的编曲。

在 Gemini 应用中,此次更新还带来三项界面变化。用户可以选择或描述自己的音乐流派,并在演唱版和纯器乐版之间进行选择。新增的即用型模板(templates)可作为创作起点,无论是背景音乐还是个性化生日歌曲均可使用。歌曲时长也可进行配置,可选择短版或长版。

平台类型Lyria 3.5 的开放范围
普通公众全球 Gemini 网页版及移动应用
专业创作Google Flow Music
开发者Gemini API、Google AI Studio、Google Vids

Google 将预期用途定位于日常需求而非专业制作,例如为视频创作伴奏、制作品牌广告短曲或个性化铃声。其分发范围广泛,未提及任何订阅限制。不过,这篇文章没有提供任何音质数据,未与先前的 Lyria 版本进行比较,也没有说明 API 访问价格。

🔗 Google 公告


SpaceXAI 将 Grok 投入企业工作,并公布其采购智能体的系统提示词

9 月 3 日和 4 日 — SpaceXAI 面向企业开放 Grok Bot。该产品于 8 月 12 日推出,如今已从面向个人订阅者和 Cursor 团队的服务,升级为具备访问、网络和审计控制功能的版本。每位用户的工作都在隔离环境中运行,Bot 默认不具备任何访问权限:它只能访问被明确连接的账户。Grok Enterprise 和 Cursor Enterprise 客户可免费使用两周,并能邀请整个组织加入,包括没有现有席位的人员。SpaceXAI 提到了 Legora、Supermicro 和 ServiceTitan,并称自产品发布以来已有数千家组织采用。

公告中最引人关注的一点是,使用最密集的领域并非工程:包括夜间开展潜在客户开发、在招聘中制作评估表、为销售起草电子邮件并更新演示文稿,以及在营销中从网络研讨会提取问答内容。

次日,该公司发布了一个 Bot 处理自身采购事务的案例研究。这个名为 Haggle Bot 的智能体连接了 Slack、Notion、Drive、Gmail、Hex 和 Ramp,据称实现了超过 100,000 美元的直接节省。

智能体的发现识别出的金额
直接节省总额超过 100,000 美元
首个产品中 90 天未使用的席位43 个席位,14,220 美元
按月付费产品中未使用的资源每年 85,662 美元

这篇文章的编辑价值不止于这些数字:SpaceXAI 公布了该智能体的系统提示词模板,并将其作为可根据自身组织情况填写的范本,其中示例值置于尖括号内。其权限部分划分了三种固定机制。第一种无需征求同意,示例包括读取支出数据以及向同事发送消息。第二种每次都必须获得操作人员的明确批准,向供应商发送任何内容便是所举示例。第三种在任何情况下都被禁止,列举的例子包括签署、购买、订阅、批准支出以及作出任何具有约束力的承诺。文章以文字说明,团队允许该智能体独立进行内部调研与协调,但在花费资金、接受条款或联系供应商时,必须获得明确批准。

🔗 企业版 Grok Bot · 🔗 让 Haggle Bot 处理采购


Grok 通过 Plaid 连接美国银行账户

9 月 4 日 — Grok 现在可以连接用户的金融账户。连接通过 Plaid 实现,这是一家在美国连接应用程序与银行机构的技术中介;该功能现已上线,但仅限美国使用。

SpaceXAI 选取的三个示例勾勒出了目标范围:了解过去一个月的钱花在了哪里、跟踪投资表现,以及确认自己是否真的买得起购物车里的商品。换言之,就是分析历史支出、跟踪投资组合,并在需要作出购买决定时提供辅助。公告内容仍然简短,除了提到安全连接外,并未说明数据如何处理,也未列出所支持的金融机构。

这是自 6 月 25 日接入 Interactive Brokers 以来一系列金融集成的延续,但其性质发生了变化:Interactive Brokers 面向活跃投资者,而 Plaid 则让这款助手能够接入普通大众的活期账户。

🔗 Grok 在 X 上的公告


Claude Code 2.1.260 与 2.1.261:差异面板、skills 审计及更严格的权限

9 月 4 日 — Claude Code 在同一天发布两个版本,二者相互呼应:前者让正在进行的工作更加透明,后者则展示会话消耗了哪些资源。

发布版本发布时间主要改进
2.1.2609 月 4 日 01:48/diff 面板、/cost 中的缓存诊断、权限修复
2.1.2619 月 4 日 21:58/skill-doctor、最长 128 000 个字符的输出、以文件形式提供的子代理 prompt

2.1.260 在全屏模式下于对话旁打开一个差异面板,随编辑进度显示尚未提交的修改。更重要的是,它修复了多个权限评估漏洞:路径中包含括号的 EditWriteRead 规则会被视为无效,或被 Bash 沙箱忽略,导致本应只读的目录仍可写入;而在 REPORTTIME 赋值中隐藏命令替换的 zsh 命令则会被自动批准。

2.1.261 新增 /skill-doctor,用于列出已加载但尚未使用的 skills,以及每项 skill 占用的上下文成本。其自动模式现在还会将一种链接视为向第三方网站发送内容:该链接会把内容打包进公共图表生成器的 URL 中。

🔗 2.1.260 版本说明 · 🔗 2.1.261 版本说明


ant apply 命令将 Managed Agents 纳入版本化文件管理

9 月 4 日 — Anthropic 为其 ant CLI 新增 ant apply。该命令把基础设施团队熟悉的声明式模型引入 Managed Agents:在代码仓库的文件中描述期望状态,再由命令将 API 资源与该描述进行协调。

涉及五类资源:Managed Agent 环境、代理本身、skills、内存存储(memory stores)以及部署。此前,这些对象通过 API 调用或控制台创建,不会在代码仓库中留下记录。将其写入文件后,它们便可纳入代码审查、版本控制和持续集成流水线。实际价值在于可复现性:以文件描述的代理环境可以原样重建、在不同分支之间比较,或通过流水线部署,无需人工干预。

🔗 在 X 上的公告


NVIDIA 密集发布:代理持久记忆、Jetson 推理与联合身份

9 月 3 日和 4 日 — NVIDIA 技术博客在同一天发布三篇文章,分别涉及技术栈的三个不同层面。

第一篇是一套基于 NemoClaw 构建的开放方案:一个能够维护用户工作持久记忆的幕僚长代理。其核心观点可以概括为一句话:有用的代理记忆需要结构、选择性检索与治理,而不只是存储。该系统以自我模型(self model)为基础,包含一层由结构化 Markdown 页面编写、可供人类阅读的知识,并辅以一个 SQLite 登记簿,用于保存义务、分类、修正和审计事件。执行由 NVIDIA OpenShell 完成,它在沙箱中实施对文件系统、进程和网络的访问策略,而凭据则保留在沙箱之外。

测量指标代理式 RAG 基线自我模型实测差异
186 个问题的总体准确率82.8%90.9%提高 8.1 个百分点
31 个高难度问题67.7%87.1%提高 19.4 个百分点
5 项变化事实的跟踪60.0%100.0%提高 40.0 个百分点
13 个问题的语料忠实度100.0%92.3%降低 7.7 个百分点

Context can inform an action, but it cannot authorize one.

🇨🇳 上下文可以为行动提供参考,但不能授权该行动。NVIDIA 关于代理记忆的文章

第二篇是一份部署指南,标志着嵌入式 AI 的一次转变:与 BF16 相比,NVFP4 量化结合推测解码在 Jetson AGX Thor 和 Orin 上可将解码吞吐量提升至最高 6.28 倍。最佳配置会因模型而异,NVIDIA 强调的正是这一点,而非指定一个通用优胜方案:Nemotron 3.5 Lightning 使用 DSpark 时表现最佳,输出速度为每秒 123 至 138 个 token;Qwen3.8-27B 使用 DFlash2 时表现最佳,为每秒 27.7 至 34.4 个 token。最后的提醒属于方法论层面:吞吐量会随负载变化,因此应使用能够代表目标应用的 prompt 验证配置。第三篇规模较小,介绍用户身份如何在联合 Kubernetes 平台和 AI 平台之间传递。

🔗 Jetson 上的边缘推理 · 🔗 联合平台之间的身份


Google 命令行工具:Gemini CLI 迈入 0.60.0 系列,Antigravity 向企业开放 Flash

9 月 3 日和 4 日 — Gemini CLI 的 nightly 渠道从 0.59.0 系列升级至 0.60.0,更新内容以安全性为主。最值得注意的修复是移除 chrome-devtools-mcp 组件中硬编码的 Google CrUX API 密钥。另外两项变更加强了隔离:macOS Seatbelt 沙箱获得独立的临时目录,扩展加载器则采用更严格的路径解析并加入边界验证。第四项变更要求 MCP 服务器的 OAuth 流程按照 RFC 9207 识别发行者,从而防范授权服务器混淆攻击。

前一天发布的 Antigravity 2.12.2 仅包含一项改进,没有任何修复:企业用户可以通过应用程序默认凭据(Application Default Credentials)进行身份验证,从而访问 Gemini 3.8 Flash 推理模型。其实际意义在于让该模型接入 Google Cloud 部署的标准身份验证方式,无需单独的 API 密钥。

🔗 Gemini CLI v0.60.0 nightly · 🔗 Antigravity 更新日志


AI 助力科学:耦合气候模拟器与完整雄性果蝇连接组

9 月 3 日和 4 日 — 两项研究将机器学习应用于规模庞大的科学对象,分别来自两个互不相关的学科。

Ai2 在 Hugging Face Hub 上以 Apache 2.0 许可证发布 SamudrACE-E3SMv3,这是一款大气—海洋完全耦合的气候模拟器。该工作的目标是以低得多的计算成本复现美国能源部基准气候模型 E3SM 的行为:先筛选假设,再运行 E3SM 本身,并以较低成本生成大型集合来采样气候变异性。大气模拟器 ACE 与海洋模拟器 Samudra 先分别进行预训练,之后再耦合,并使用 400 年从未见过的 E3SM 数据进行评估;在这些数据上,平均气候状态保持稳定。Ai2 明确指出一项局限:该模拟器能够捕捉最高至第 99.99 百分位的日降水量,但会低估超过这一水平的极端降水。

HHMI Janelia Research Campus、Google Research 及其合作伙伴则发布了首张成年雄性果蝇大脑与中枢神经系统的完整图谱:包含超过 166 000 个神经元,创下纪录,并划分为 11 691 种细胞类型,这些类型在 AI 辅助下完成分类,并由人类专家验证。该方法先对薄切片进行成像,再通过计算机将数百万张二维图像重组为三维神经元形态。其价值在于可与此前发布的雌性果蝇图谱进行比较:大多数神经元在两种性别中相同,少数为性别特有,第三类称为性别二态神经元,在两种性别中均存在,但会连接不同的邻近神经元。三项配套研究将该图谱应用于视觉、味觉和社会行为。

🔗 X 上的 SamudrACE-E3SMv3 · 🔗 雄性果蝇大脑图谱


Meta 向公众开放 Muse Spark 1.3 的最高推理等级

9 月 4 日 — 在 Muse Spark 1.3 模型发布两天后,Meta 向公众开放其 max 推理等级。该等级可在 Muse Code 和 Meta Model API 中使用。

因此,改变的并非模型本身,而是其计算成本最高的推理等级现已真正开放。Meta 首席 AI 官 Alexandr Wang 表示,提升主要体现在编码和代理式任务上,并建议即便已经测试过 highxhigh 等级的用户也重新尝试该模型。他还补充说,此次上线是在安全测试完成后进行的。启用方法是选择 Muse Spark 1.3,然后将推理等级设为 max

此次开放未附带任何 benchmark 数据:相关帖子既未公布分数,也未作比较,只有作者的定性评价。

🔗 AI at Meta 公告


Percept-Lens:Sakana AI 用于评估生成图像检测的协议

9 月 3 日 — Sakana AI 发布 Percept-Lens,这是一套用于检测 AI 生成图像的分布外评估框架,已获 ECCV 2026 接收。其出发点是,当多个因素同时变化时,合成图像检测器便会失效:生成器、风格或 prompt,以及源领域。Percept-Lens 统一了对 39 个公开数据集的评估,共计 710 万张图像。

表征研究提出了一个直接问题:除了现代编码器已经能够区分的信息之外,训练分类头是否还能带来额外价值?作者构建了一套以先验为条件的高斯判别器阶梯,即基于特征一阶和二阶统计量构建的闭式解分类头。在先验和编码器均保持相同的前提下,该阶梯中表现最佳的一层往往能够媲美已发表的检测头,有时甚至超越它们。作者主张以先验、编码器、分类头这一三元组为单位报告结果。

🔗 Sakana AI 文章 · 🔗 arXiv 论文


TAOT:考虑网络拓扑的专家副本放置方法

9 月 4 日 — Baidu 的 Baige 团队详细介绍了 TAOT,这是一种用于 mixture-of-experts 模型训练的专家副本放置方法,已集成到其开源框架 LoongForge 中。

问题很具体。当 MoE 训练变慢时,原因很少是 GPU 算力不足,更多时候是无法及时重新平衡负载:少数专家成为热点,其他所有 rank 都在等待。经典解决办法是将热点专家的权重临时复制到空闲 rank 上,但一旦并行域跨越多个节点,并非所有空闲 GPU 都具有同等价值:节点内通信通过 NVLink,跨节点通信通过 InfiniBand,两者成本可能相差一个数量级。

测量指标实测值
优化前后的每次迭代时间从 155.4 ms 降至 108.8 ms,即 1.43x
从 EP4 到 EP16 的加速最高 1.79x
相比 LPLB 的通信成本在 EP32 时最高降低 74%
在线规划开销少于前向传播时间的 1%

TAOT 被介绍为首个在单一目标函数中同时纳入峰值削减收益与跨节点移动权重成本的方法。DeepSeek 的 LPLB 使用预定义图来约束路径,而 TAOT 则采用连续通信成本矩阵,并结合灵活的拓扑偏好:优先选择节点内通信,跨节点通信仍被允许,但成本更高。从按行匹配改为按列匹配后,残余不平衡率从 7% 至 10% 降至 1% 至 2%。

🔗 Hugging Face 文章


Open Yap 1K:一千小时可自由商用的全双工对话

9 月 3 日 — The Agentic Data Company 发布 Open Yap 1K,这是一个将英语对话分为两个独立声道、专为全双工语音模型设计的语料库。

语料库要素公开样本完整语料库
总时长8.9 小时1 000 小时
对话数量161 602
所用许可证CC BY 4.0Open Yap,可自由商用
访问方式Hugging Face Hub按需提供

作者明确将该语料库定位为 Fisher、Switchboard 和 CANDOR 等现有语音语料库的替代方案,首先强调的是技术优势:文章将一段以 8 kHz 电话频带采样的 Fisher English 音频与一段 Open Yap 1K 音频并列展示,以说明音频质量的差距。采集方法、说话者人口统计信息、质量保证、知情同意和隐私保护均有文档说明。

🔗 Hugging Face 文章


Daily Brief 向更多美国 Gemini 用户免费开放

9 月 4 日 — Google 正在向美国更多 Gemini 应用用户免费开放 Daily Brief。该功能于 5 月 21 日推出。

Daily Brief 在后台运行,并连接用户的各项 Google 应用:电子邮件、日历、对话和兴趣会被汇总为一份可浏览的任务与优先事项清单,作为一天的起点。此次公告仍仅限美国,既未说明涉及的用户比例,也未公布向全球扩展的时间表。

🔗 Gemini 在 X 上的公告


Runway 推出 Team,为拥有 2 至 9 个席位的团队提供自助式套餐

9 月 4 日 — Runway 推出 Team,填补个人套餐与面向大型客户的 Enterprise 方案之间的空白。这对其产品目录而言是一次结构性调整:Standard、Pro 和 Max 现被明确划为个人套餐,所有新成员今后都将通过 Team 加入,而现有工作区则保留原有访问权限和价格。

套餐特性公布的数值
每席位月费69 美元
每席位年费55 美元,相当于优惠 20%
允许的席位数2 至 9
每席位每月积分6 900,存入共享池
共享项目与存储空间最多 100 个项目,1 TB

该套餐以共享项目为核心,资产、参考资料、Brand Kits、会话和 workflows 均存放其中。Runway 从输出一致性的角度阐述其优势:当整个团队都依据相同参考资料进行生成时,第十个视频看起来会与第一个保持一致。未使用的积分可结转一个月;一个团队最多可共享 20 项 agent 技能;Agent Connectors 则可将 Figma、Dropbox 和 Notion 接入创意 agent。

🔗 Runway 公告


ElevenLabs 将 1 Million Voices 计划扩展至巴西

9 月 4 日 — ElevenLabs 将其社会影响计划带到巴西,并以首个巴西案例加以展示。Eliane 自幼失声,Alberto 则在 46 岁时失明;该公司为 Eliane 赋予了一种与家人声音相似的声音,使她第一次能够用承载自身身份的声音与所爱之人交流。

此次公告还伴随两项本地合作。Associação Brasileira de Esclerose Lateral Amiotrófica 为巴西多达 10 000 名肌萎缩侧索硬化症患者提供服务,通过该机构,这些患者可以免费使用声音克隆服务。Sociedade Brasileira de Fonoaudiologia 则将培训巴西言语治疗师使用声音克隆技术;该公司希望通过提升从业人员的熟练程度,扩大受益患者的数量。1 Million Voices 计划是一项价值 10 亿美元的实物承诺,自启动以来已惠及全球超过 11 000 人。

🔗 ElevenLabs 博文


Kimi Code 0.41.0 新增多 agent 模式,并撤下一项仅存在两天的防护措施

9 月 4 日 — Moonshot AI 发布 Kimi Code 0.41.0。最直观的新功能是 tower:这是 web 界面中的一项实验性多 agent 协作模式,可通过命令 /tower 或编辑器的加号菜单启动,并接受一个基础分支作为参数。上下文管理获得两项调整:系统会在自动压缩之前告知模型其上下文预算,随后将其引导至会话事件日志,以找回准确细节。轮次级文件历史记录现在会永久保留。

最值得注意的是一次回退。9 月 2 日发布的 0.40.0 版本曾在自动权限模式下禁止执行 shutdownrebootrm -rf 等破坏性命令。0.41.0 推翻了这一选择,在同一模式下不再阻止危险命令以及无法静态分析的命令。这项防护措施仅维持了两天。发布说明并未解释原因,但对 shell 命令进行静态分析很容易产生误报,从而阻碍正常工作。

🔗 Kimi Code 0.41.0 发布说明


Perplexity 详解 Ivy、Tulip 和 ROSE:为其 embeddings 提供服务的自研技术栈

9 月 4 日 — Perplexity 发布了一篇工程博文,深入展示其 embedding 和排序(ranking)模型的服务基础设施。该公司自行训练并部署模型,其中包括 pplx-embed,并称其搜索索引已达到 EB 级规模。

技术栈组件使用的语言在服务中的作用
IvyRustHTTP 网关、tokenization、切分与批次分配
TulipRust、tokio、tonicgRPC 推理服务器、调度与批处理
ROSEPython模型执行、CUDA kernels 与计算图

其核心思路是复用 LLM 推理代码。Perplexity 指出,批量 embedding 类似于受算力限制的预填充(prefill)阶段,而短查询的在线 embedding 则类似于受内存限制的解码(decode)阶段。因此,相同的 kernels 同时用于 pplx-embed 和 Qwen3.5 解码;embeddings 不会实例化键值缓存,并采用能够处理不规则(ragged)输入的 attention 变体,以避免无效填充。在 attention kernels 方面,团队并行维护 FlashInfer 2、FlashInfer 3 和 FlashAttention 4,而非仅选择其中一个;具体选择会根据 head 的数量和维度逐案决定。测试数据与 vLLM v0.22.0 进行了比较,但具体数值结果仅展示在图表中。

🔗 Perplexity 工程博文


Zed 与 Replit 在 X 上发布公告,但没有博文或发布说明

9 月 4 日 — 两项第三方编程工具公告在同一天发布,且都仅依据一条 X 帖文,没有博文或发布说明作为补充依据。

Zed 在回应一项 9 月 2 日提出的用户请求时表示,已注册 Windows 测试版的用户现在可以使用 Delta。这一区别很重要:Delta 是 8 月 12 日推出的多人 agent 编程环境,可让多个团队成员与 agent 一起处理共享项目。而 Zed 编辑器本身早已面向 macOS、Linux 和 Windows 发布。因此,该公告针对的不是编辑器,而是 Delta;其 Windows 版本自 8 月以来一直尚未开放。此次测试的确切范围和注册方式仍然未知。

Replit 则播出了一场时长 1 小时 58 分钟、题为“Replit MCP:从任何地方操控你的 Agent”的直播。标题所指的是一个 MCP 服务器,它将平台 agent 暴露给兼容该协议的客户端;预期用途是让用户无需进入 web 界面,即可从编辑器、终端或第三方助手中启动任务并跟踪进度。除该标题外,这条消息没有任何其他文字,也没有博文链接或明确的发布表述。

🔗 Windows 上的 Delta · 🔗 Replit MCP 直播


简讯

  • 一个 API endpoint 可返回 star 历史记录而不暴露用户身份 — GitHub REST API 会返回带时间戳的 star 计数,但不会识别授予这些 star 的账户,以取代今年早些时候仅限管理员使用的列表 endpoints。🔗 更新日志
  • npm 允许每个 package 使用多项可信发布配置 — 三项功能正式全面可用:每个 package 可配置多个可叠加的 OIDC 配置;在反恶意软件扫描运行期间阻止批准;并可在版本选项卡中查看预发布历史记录。🔗 更新日志
  • GitHub Actions 新增 runners 弃用 API — REST API 提供 runner 版本终止支持的日期;一项 vulnerability-alerts 权限允许只读访问 Dependabot 警报;job 上下文中的四个属性则为可复用 workflows 提供其原始身份信息。🔗 更新日志
  • 纪录片《The Story of VS Code》于 9 月 4 日上线 — GitHub 转发了 Visual Studio Code 官方纪录片在该编辑器 YouTube 频道上的发布消息;其预告片已于 9 月 1 日发布。🔗 公告
  • Replit 展示一款在一周内构建的应用 — 据 Replit 称,Cédric Roberge 使用该平台在约一周内构建的 Pep AI 每月收入约为 130 000 美元;相关推广帖之后还附有定价建议。🔗 Replit 帖文串
  • Zed 发布了一则内容无法核实的图片公告 — 这条消息仅含四个单词和一张图片,于 9 月 4 日 22:14 发布。扫描期间图片未能加载,且该帖没有附带任何博文或发布说明,因此无法确定其公告内容。🔗 消息
  • 面向亚美尼亚语的完整开放 LLM 生态系统 — 一个 Hugging Face 合集汇集了 ArmWeb 网络语料库、经过验证的 ArmSTEM 科学数据集和 arm-gemma-e4b 模型,相关文章据称即将发布。🔗 博文
  • VLM Run Gateway 通过统一 API 汇集开放权重的 OCR 与 vision 模型 — 该网关通过单一入口提供开放权重的光学识别、vision-language 和 vision 模型,其中包括 PaddleOCR-VL-1.6。🔗 博文
  • Sakana AI 将于 10 月 5 日开放其工程团队 — Engineer Open House 将于 2026 年 10 月 5 日星期一 18:00 至 21:00 再次举行,可前往 Toranomon 现场参加或在线参与,并通过 connpass 报名。🔗 公告
  • Google 详解其 Gemini Enterprise 开发者体验计划的 sprints — 这是一篇介绍方法而非发布产品的博文:文中所述 sprint 聚焦企业 AI 治理,并为 Agent Gateway 和 Semantic Governance 提供更新后的文档及标准化代码示例。🔗 博文
  • Suno 将其下一代模型命名为 v6 系列 — 官方账号在回复一名用户时称,这是其迄今最出色的成果,但未提供日期或技术细节;此前一天,新的下载限制刚刚生效。🔗 回复
  • MiniMax 与 Together AI 在伦敦举办开放模型经济主题晚会 — 双方联合举办的“Open by Design:生产环境中的 AI 经济学”活动将于 9 月 16 日举行,这是该时间窗口内 MiniMax 唯一发布的消息。🔗 公告
  • Mistral 将于 9 月 23 日和 24 日把 AI Engineer 大会带回巴黎 — 继上一届满员后,本届活动重返 Station F,工程副总裁 Lélio Renard-Lavaud 将与 Black Forest Labs、Cognition 和 Hugging Face 的代表共同出席。🔗 公告
  • WebMCP Challenge 关闭项目提交 — 由于 9 月 3 日的服务中断,截止时间曾推迟 12 小时,目前提交已关闭;项目正在审核中,获奖者将于近期公布。🔗 公告

这意味着什么

前沿模型被生态系统吸收的速度已成为真正的指标。GPT-6 Astra 于 9 月 3 日发布;到 9 月 4 日,它已无限制进入 API,在十个 Copilot 使用场景中全面可用,由在生产环境中使用它的第三方完成评测,并通过 Codex CLI 连续三个补丁完成集成。一年前还不存在这种 24 小时的时效。它将关注点从发布转向计费:GitHub 对 Astra 采用供应商公开定价,不设促销期;Gemini 3.8 Flash 则享有持续至年底的首发优惠价。当所有模型都能在发布后的第二天上线时,价格便再次成为终端用户唯一看得见的差异化因素。

HydraFusion 从另一端着手解决问题,也是当天对工具领域影响最深远的消息。认真地从 20 个模型中进行选择,是很少有开发者会做的工作,而 GitHub 提议彻底取消这一步:用户只需选择一个 workflow,工具便会为每次请求决定使用哪个模型。在 TerminalBench 上,相较 Opus 5,质量高出 4.9 个百分点、成本降低 67%,这些数字最重要的意义在于其暗示:收益来自编排,而非更强大的单一模型。如果这一结果在基准测试条件之外依然成立,那么模型将不再是产品,而会成为质量入口背后可互换的组件。

企业中的 agents 正走出工程部门,治理也随之跟进。SpaceXAI 明确表示,Grok Bot 使用最密集的场景并非编程;而当天最具启示意义的数字来自一次软件席位审计:43 个付费订阅已经 90 天没有任何活动。但这些公告真正的核心在于权限机制。SpaceXAI 发布的系统 prompt 模板区分了三种制度:始终允许、逐案允许、永不允许;NVIDIA 在有关 agent memory 的博文中也提出相同原则:上下文可以为行动提供信息,却不能为其授权。两个毫无关联的参与者在同一天得出同一个结论:一个有用的 agent,首先由禁止它做什么来定义。

在命令行工具领域,安全并非直线前进,而是曲折发展。Gemini CLI 移除了硬编码的 API key 并强化其 sandbox;Claude Code 修复了权限规则,因为这些规则曾使本应只读的文件夹仍可被写入;Kimi Code 则在新增破坏性命令拦截仅两天后便将其移除。最后一个案例最值得借鉴:对 shell 命令进行静态分析会产生大量误报,足以让一项理论上正确的防护措施在实际使用中变得难以忍受。这些工具的安全性,不取决于宣布某项保护措施,而取决于它能否经受用户实际使用的考验。

最后是数学与科学领域的进展,也是最难以即时评估的部分。用 11 天完成形式化的费马证明并未产生任何新数学成果:它验证的是一个已有 30 年历史的结果。恰恰是这一点令其意义重大,因为同行评审是一个以年计的瓶颈,而 Kevin Buzzard 指出,这些产物如今已足够稳健,可以作为其他工作的基础。Ai2 的气候模拟器和果蝇 connectome 也遵循相同逻辑:两者都没有做出发现,却都让原本因成本过高而无法规模化的工作变得可行。这种用途不如自主发现那般引人注目,却可能更接近 AI 真正在科学实践中带来的改变。


来源