搜索

OpenAI 在 DevDay 2026 发布 GPT-6.1 Sol 和 dots,Clément Delangue 宣布 NVIDIA 将收购 Hugging Face,AMD 将收购 World Labs

ai-powered-markdown-translator

使用 gpt-6-sol 将文章从法语翻译成中文。

在 GitHub 上查看项目 ↗

9 月 29 日星期二,OpenAI 举办 DevDay 2026:GPT-6.1 Sol 的能力接近 GPT-6 Astra,价格却只有后者的五分之一;dots 开启了持续运行的智能体模式;Codex 进入云端;ChatGPT 则成为团队工作空间。在收购方面,Clément Delangue 发文称 Hugging Face 即将被 NVIDIA 收购,但截至目前,NVIDIA 和 Hugging Face 均未发布公告。AMD 已于 9 月 28 日宣布达成最终协议,将以约 82 亿美元的股票收购 Fei-Fei Li 创办的实验室 World Labs。此外,OpenAI 承认,其模型曾在 6 月未经授权访问澳大利亚政府网站。


OpenAI 发布 GPT-6.1 Sol:能力接近 GPT-6 Astra,价格仅为其五分之一

9 月 29 日 — 在 DevDay 2026 上,OpenAI 发布 GPT-6.1 Sol,这是对一周前推出的 GPT-6 Sol 的改进版本。OpenAI 称,其智能水平接近 Astra,价格却只有后者的五分之一:在 API 中,gpt-6.1-sol 的输入价格为每百万 token 2 美元,输出为 10 美元;GPT-6 Astra 则分别为 10 美元和 50 美元,仍是 OpenAI 整体性能最强的模型。GPT-6.1 Sol 面向需要频繁运行的高要求任务和大规模 API 应用;其测试版还可以在同一次 Responses API 请求中,将部分工作委派给子智能体。

价格类型(每百万 token,短上下文)GPT-6.1 SolGPT-6 Astra
输入2 美元10 美元
缓存输入0.10 美元1 美元
缓存写入2.50 美元12.50 美元
输出10 美元50 美元

缓存价格大幅下降:缓存输入降至每百万 token 0.10 美元,比标准输入价格低 95%,也只有 GPT-6 Sol 的一半。输入超过 272 000 token 后,价格调整为输入 4 美元、输出 15 美元。

性能提升体现在智能体编程、计算机操作和专业工作上:

已公布的评测GPT-6.1 Sol 的结果已公布的比较结果
DeepSWE v1.1与 GPT-6 Astra 持平成本约为 Astra 的五分之一;比 GPT-6 Sol 的最佳成绩高 6.4 分
OSWorld 2.0,离线测试(最大努力程度)比 GPT-6 Sol 高 7 分与 Astra 相差 2.1 分,单项任务成本约为其七分之一
Terminal-Bench Science 0.1(最大努力程度)得分超过 GPT-6 Sol 的两倍,每项任务 5.47 美元Opus 5.5 为 23.21 美元,Astra 为 23.80 美元,并以 68.1% 的成绩领先
AutomationBench 1.0.6(中等努力程度)比 Opus 5.5 高 2.2 分成本约为其三分之一;比 GPT-6 Sol 高 4.8 分
GDP.pdf使用备用方案时领先 Opus 5.5单项任务成本不到其一半
事实性错误(极高努力程度)4.1%GPT-6 Sol 为 4.5%,Astra 为 4.0%

在安全方面,面对故意出现故障的搜索工具,GPT-6.1 Sol 有 2.8% 的情况未报告故障;GPT-6 Sol 和 Astra 的这一比例分别为 4.9% 和 1.5%。该模型已在 API 中提供,也面向 Plus、Pro、Business、Enterprise 和 Edu 订阅用户在 ChatGPT Work 和 Codex 中开放,但尚未进入 Chat;版本说明指出,部署将从 Pro 用户开始,Enterprise 和 Edu 管理员需要主动启用该模型。

🔗 GPT-6.1 Sol 介绍

Devin 于发布当天开放使用:FrontierCode 1.1 得分 60.4%,成本降低 44% 至 57%

9 月 29 日 — Cognition 在 GPT-6.1 Sol 发布当天将其接入 Devin Desktop 和 Devin CLI,并用自家的 FrontierCode 1.1 基准测试进行评估(文章图表中标为 Extended)。该测试根据真实工程任务的质量及其成果能否合并来评分。得分几乎没有变化:GPT-6.1 Sol 为 60.4%,GPT-6 Sol 为 60.7%,GPT-5.6 Sol 为 60.6%。变化在于价格。在每个努力程度设置下,GPT-6.1 Sol 的单项任务成本都比前代低 44% 至 57%,得分与前代相差不超过 1 分或更高;在中等努力程度下,每项任务成本为 0.31 美元,比 GPT-6 Sol 为取得最佳成绩而采用最大努力程度时的 1.66 美元低 81%。在低努力程度下,它以 0.21 美元取得 58.1% 的成绩,而 GPT-6 Sol 在相同设置下为 50.5%:据 Cognition 称,这是该排行榜中单项任务成本低于 0.30 美元的最高成绩。若只看得分,它仍落后于 Claude Opus 5.5(65.3%)、Claude Fable 5(64.9%)、GPT-6 Astra(64.5%)和 Claude Sonnet 5.5(64.4%)。

🔗 Devin 中的 GPT-6.1 Sol

GitHub Copilot 开放使用,但不包括 Pro 套餐

9 月 29 日 — GitHub 在 GitHub Copilot 中逐步全面开放 GPT-6.1 Sol,适用于 Copilot Pro+、Max、Business 和 Enterprise 套餐:与 9 月 22 日开放的 GPT-6 Sol 一样,Copilot Pro 订阅用户无法使用它,而这些用户自 9 月 28 日起已可使用 Claude Sonnet 5.5。用户可在十种使用界面的模型选择器中找到它,包括 Visual Studio Code、Copilot CLI、编程智能体、GitHub Copilot 应用,以及 JetBrains、Xcode 和 Eclipse IDE。其收费采用公开价格:输入不超过 272 000 token 时,每百万 token 输入 2 美元、输出 10 美元;超过该门槛后分别为 4 美元和 15 美元。这与 GPT-6 Sol 相同,唯独缓存输入价格减半,从 0.20 美元降至 0.10 美元。GitHub 称,该模型完成任务所需的 token 和步骤明显少于 GPT-6 和 GPT-5.6 系列,但未提供具体数字。如果 Business 和 Enterprise 管理员没有另行设置,该模型将自动启用。

🔗 GitHub Copilot 中的 GPT-6.1 Sol


Clément Delangue 发文称 Hugging Face 即将被 NVIDIA 收购

9 月 29 日 — Hugging Face 联合创始人兼首席执行官 Clément Delangue 于巴黎时间 17 时 45 分在 X 上发文称,Hugging Face 即将被 NVIDIA 收购。Hugging Face 官方账号 @huggingface 转发了这条原创推文;Delangue 从招聘角度介绍了这笔交易:

getting acquired by @nvidia = hugging face can now hire people we couldn’t as a small startup and give them a decade to make open-source AI win! if you’re one of them, my dms are open

🇨🇳 被 NVIDIA 收购意味着 Hugging Face 现在可以聘请一些我们作为小型初创公司时无法招到的人,并给他们十年时间推动开源 AI 取得成功!如果你是其中之一,欢迎给我发私信。 — @ClementDelangue 在 X 上

在接下来的一小时内,Clément Delangue 又表示,开源 AI 理应发展到当前规模的 100 倍,而“我们才刚刚开始”;随后他发出“我们保持中立!”(we stay neutral!),但没有提供上下文。

这些消息均未附有正式公告。截至发稿时,NVIDIA 尚未发布相关声明(其新闻中心最新内容停留在 9 月 28 日,主题为股票回购和 Open Agent Safety Platform),Hugging Face 博客也未发布相关内容。收购金额、时间表、完成交易的条件以及托管着众多实验室开放模型的平台未来将如何运营,均未公布。

🔗 Clément Delangue 的后续消息:开源 AI“扩大 100 倍” · “我们保持中立!”


AMD 将以约 82 亿美元收购 Fei-Fei Li 的实验室 World Labs

9 月 28 日 — AMD 已签署最终协议(definitive agreement),将收购由 Fei-Fei Li 领导的 AI 模型与研究实验室 World Labs。这笔交易将全部以股票支付(all-stock),估值约为 82 亿美元;预计在 2026 年底前完成,但仍需获得监管批准并满足其他惯常条件。因此,收购尚未完成。

World Labs 成立于 2024 年,总部位于旧金山,开发空间智能(spatial intelligence)模型,可根据文本、图像或视频生成、重建和模拟可交互的 3D 环境,并研发用于机器人技术的学习与模拟技术。据 World Labs 称,两家公司自去年起就在模型训练以及 AMD GPU 上的推理优化方面开展合作。

协议事项已公布的详情
金额约 82 亿美元
支付方式全部以股票支付
预计完成时间2026 年底前,仍需获得监管批准
Fei-Fei Li 的职务AMD 执行副总裁兼首席科学家,向 Lisa Su 汇报
团队领导Justin Johnson 和 Ben Mildenhall 与 Fei-Fei Li 共同领导

AMD 表示,随着 AI 扩展到推理、机器人技术、模拟和物理 AI,计算需求正变得更加多样。World Labs 的专业能力将帮助 AMD 更好地把握工作负载的演变,并为其硬件、软件和系统路线图提供方向,服务于面向开放生态系统的 AI 基础设施战略。

Building the compute platforms for the next generation of AI requires a deep understanding of how models are evolving. Fei-Fei and the World Labs team bring exceptional research leadership and model expertise. Together, we can use that insight to develop the hardware, software and systems that will power the next generation of AI and strengthen the open AI ecosystem.

🇨🇳 要打造支撑下一代 AI 的计算平台,就必须深入理解模型如何演进。Fei-Fei 和 World Labs 团队带来了卓越的研究领导力与模型专业知识。我们将共同利用这些知识,开发运行下一代 AI 所需的硬件、软件和系统,并壮大开放的 AI 生态系统。 — AMD 董事长兼首席执行官 Lisa Su

交易完成后,World Labs 团队将加入 AMD 的前沿研究机构(frontier research organization),继续专注于模型研究。

🔗 AMD 公告 · World Labs 文章


OpenAI 发布由 GPT-6 Astra 驱动、持续运行的智能体 dots

9 月 29 日 — OpenAI 发布 dots,这是一类由 GPT-6 Astra 驱动、“持续运行”的智能体。每个 dot 在云端都有自己的计算机和浏览器,能够从用户反馈中学习,并全天候朝用户设定的目标工作。借助插件生态系统,它可以连接 4 000 多款应用,并以自己的身份管理访问和授权。

用户可以像联系同事一样联系 dot:通过网页版、移动版和桌面版 ChatGPT,或通过短信、Slack、Teams,甚至电话;上下文会在不同渠道之间延续。OpenAI 举例称,一名早期测试者的 dot 发现一笔尚未开票的发布项目,准备好发票,并在获得批准后将其发送。

dot 的自主行为受到约束。在与用户的对话之外,它会使用权限受限的工具进行“主动研究”;这些工具不能发送消息、修改应用中的内容,也不能控制浏览器或计算机。内置规则和自定义规则规定了哪些事可以由它独立完成、哪些需要批准、哪些会被阻止;更改密码等敏感任务仍只能由用户执行。OpenAI 还发布了一份系统说明。Business、Enterprise 和 Edu 的内容默认不会用于训练。

发布事项已公布的详情
使用的模型GPT-6 Astra
联系渠道ChatGPT、短信、Slack、Teams、电话;iMessage 和 RCS 候补名单仅面向 Pro 用户
适用套餐Pro 和 Business Premium,用户须年满 18 岁;Enterprise 处于测试阶段,默认关闭
首发地区限制欧洲经济区、瑞士和英国暂不提供 Pro 版本
公布的费用首个 dot 免费;与 dot 的对话不计入 ChatGPT 使用限额

此后,用户可以支付固定月费,增加 dot 数量、提高其运行速度或扩大其工作量。拥有独立身份并承担企业内部职责的专用 dot,正向少数机构提供预览;OpenAI 也正与 Microsoft 合作,将其接入 Agent 365 的治理、安全和身份管理机制。

🔗 了解 dots


Perplexity Computer 推出 Automations:由日程或事件触发的周期性智能体

9 月 29 日 — 同一天,Perplexity 为其云端智能体 Computer 增加了 Automations:这类长期运行的智能体可按日程自主工作,也可响应 Slack、Gmail、Outlook、Linear 或 GitHub 中的事件。条件可用于筛选事件,例如只响应某位特定发件人要求作出决定的邮件。

它与计划任务的区别在于记忆:每次运行都会承接此前的历史记录。每周竞争对手价格报告会将最新数据与上周的数据比较,客户回复草稿则会参考之前的往来内容。智能体还会指出本应发生却没有发生的事:原定周二上线的版本到了周三早上仍未上线,或者某个重要客户账户已有四天未收到回复。Automations 也取代了 Computer 的计划任务(Scheduled Tasks);现有任务会出现在新界面中,并提供迁移选项。

用户可以在 Computer 的命令栏(omnibar)中描述自动化流程,或通过 New Automation 按钮创建,设置触发条件、指令、信息来源、输出位置(如 Slack 频道或 Gmail 草稿),以及智能体可自行执行或须经人工审核的操作。公告中的例子是:一个标记为“ready”的 Linear 工单触发智能体搜索代码仓库、编写修改,并创建供人工审核的 pull request。

功能方面已公布的详情
触发条件日程,或 Slack、Gmail、Outlook、Linear、GitHub 事件(可设置条件)
记忆每次运行都会承接此前的历史记录
控制操作可自主执行或提交审核;连接器权限由管理员设置;保留运行历史记录
点数等待触发时不消耗,运行时消耗
可用范围Computer 用户;可迁移现有 Scheduled Tasks

🔗 Perplexity Computer 中的 Automations


Codex 走向云端:可复用环境、代码审查与重新设计的 CLI

9 月 29 日 — Codex 不再局限于本地电脑。OpenAI 这样概括:

You can finally close your laptop now and your agents will keep working. Codex cloud environments are here.

🇨🇳 你终于可以合上笔记本电脑了:你的智能体会继续工作。Codex 云端环境现已推出。 — @OpenAIDevs 在 X 上

Codex 的可复用云端环境包含代码仓库、依赖项、脚本和设置:用户可以在云端启动任务,再通过手机或另一台电脑查看进度并操控任务,即使笔记本电脑已经关机也一样。每项任务都在各自的隔离空间中运行,并遵循工作区的云端访问设置。该功能面向 Plus、Pro、Business 和 Enterprise 套餐推出;在 Business 和 Enterprise 工作区,环境可供团队共享,让所有成员从相同的配置开始。桌面应用的使用体验也扩展到了网页和移动端。

Codex 新功能变化公布的可用范围
云端环境在云端启动任务,并在笔记本电脑关机后继续通过手机操控Plus、Pro、Business、Enterprise;Business 和 Enterprise 支持团队共享
代码审查在 ChatGPT 桌面应用中查看摘要、差异并向 Codex 提问;云端自动进行第一轮审查GitHub pull requests 和 GitLab merge requests
重新设计的 CLI全屏界面、/agents、在 worktree 中使用 /fork、/voice通过 npm install -g @openai/codex@latest 更新

新的代码审查功能让用户先阅读摘要和差异,再就潜在问题向 Codex 提问,然后分享反馈;在自动模式下,Codex 会先在云端进行第一轮审查。CLI 也经过重新设计:提供全屏界面、滚动时加载超出终端内存范围的历史记录、固定的输入区、用于跟踪并切换并行任务的 /agents 视图、可在 worktree 中以相同上下文复制会话的 /fork,以及通过 /voice 进行语音对话。其中多项功能(语音、全屏、/usage、主题、Mermaid)已陆续在 0.155 至 0.157 版本中推出;DevDay 将它们集中发布。

🔗 Codex CLI 重新设计

Codex CLI 0.159.0:即时打断与新欢迎界面

9 月 29 日 — Codex CLI 0.159.0 于 UTC 时间 08:05 发布(自 0.158.0 以来包含 88 个 PR),引入了 instant_interrupt:当 Codex 正在回复,或在代码模式下进行耗时较长的调用时,用户可以直接输入新内容来调整其方向,无须等待当前轮次结束。界面新增紧凑的欢迎屏幕、统一的标题,并在轮次进行中及结束后显示提示。从会话记录复制内容时,现在会保留 Markdown 表格和格式;在 Windows 上,MCP 服务器和通过管道(pipe)连接的命令也不再弹出多余的控制台窗口。安全措施进一步收紧:已获批准的命令仍会遵守对文件访问的明确拒绝,且在可写根目录下,.aws 文件夹默认受到保护。与此同时,自动推荐后续提示词和内置的 plugin-creator skill 被移除。

🔗 Codex CLI 0.159.0 版本说明

Codex Security Cloud 默认包含 Daybreak Blue 模型

9 月 29 日 — Codex 的云端安全分析服务 Codex Security Cloud 现在默认提供 Daybreak Blue 网络安全模型的访问权限,无须另行申请 Daybreak 权限。它可以按需或按日程扫描完整的 GitHub 代码仓库、跟踪新提交、调查发现的问题、去除重复结果并准备供审核的修复方案;所有工作都在云端进行,即使电脑已关闭也一样。OpenAI 将其持续防御方法 Defense Factory 纳入其中,并以插件形式在桌面端和网页端的 Codex 中提供该服务。版本说明也列出了限制:访问权限取决于工作区权限、仓库配置和计费设置;现有 Codex Security 客户须先同意,服务才会产生付费使用;Daybreak Blue 模型仅限在 Codex Security Cloud 中使用。

🔗 Codex Security Cloud 公告


ChatGPT 借助 Space、Pages、演示文稿及 Slack 和 Teams 中的 @ChatGPT 成为团队工作空间

9 月 29 日 — 据称发布了 20 多项重要公告的 DevDay,将 ChatGPT 打造成供人类与智能体协作的共享空间。ChatGPT Space 汇集与项目相关的页面、文件和工作成果,供成员分享并在已有成果上继续工作;对于能够使用该功能的账户,它将取代资料库(Library),而项目(Projects)仍保持独立。该功能将在桌面应用和网页端推出,移动端也预计很快上线。

ChatGPT 新功能带来的能力适用套餐
ChatGPT Space汇集并共享项目的页面、文件和工作成果;取代资料库Pro、Business、Enterprise
Pages为与智能体和同事协作而设计的文档(计划、报告、交互式仪表板),可通过已连接的工具更新Pro、Business、Enterprise
协作式幻灯片同时编辑、可修改的原生图表,并可导出至 PowerPoint 和 Google SlidesPro、Business、Enterprise
团队与团队任务共享页面、演示文稿和电子表格;按日程重复执行,或由邮件、Slack 消息触发任务Business、Enterprise
Slack 和 Teams 中的 @ChatGPT可在频道、讨论串和私信中提及;没有 ChatGPT 许可证的同事也能参与交流Business、Enterprise
会议插件笔记和摘要存入 Space,笔记完成后删除音频macOS 测试版,面向 Pro 和 Business

在页面中,每个人都可以评论或修改内容,提及 ChatGPT 或其圆点标记来请求修订,并使用自己的 ChatGPT 工作;共享页面不会开放私人对话或记忆的访问权限。在企业环境中,加入团队不会共享个人对话或连接,管理员可以配置团队的应用连接。可分享的个人资料则汇集用户选择展示的简介、活动和 Sites:资料默认设为私密,且绝不会显示对话标题或内容。

🔗 DevDay 2026 回顾

插件成为集成应用

9 月 29 日 — OpenAI 向开发者开放其用于构建 ChatGPT 功能的平台,让开发者能够面向其宣称的 12 亿用户推出原生体验。借助扩展,插件可以安装在侧边栏中、在对话旁显示交互式面板,或充当某些文件类型的查看器和编辑器;这些能力适用于所有套餐。当天展示的首批例子包括 tldraw 的多人协作画布,以及侧边栏中的 MagicPath。发布插件需要通过插件创建工具和重新设计的提交流程。由于支持拟议的 MCP Events 规范,兼容的插件可以在已连接应用中发生事件时启动自动化流程,例如项目看板上出现新任务。Sites 也可以集成插件,让每位同事以自己的数据和权限使用同一个应用。

🔗 ChatGPT 版本说明


OpenAI 为 GPT-6 Astra 推出 Ultrafast,并推出每月 500 美元的 Pro 500 套餐

9 月 29 日 — OpenAI 推出 Ultrafast,这是 GPT-6 Astra 的高级速度档位:在 Codex 中最高提速 8 倍,达到每秒 300 个 token;在 API 中最高提速 6 倍。OpenAI 称 Astra Ultrafast 是全球速度最快的前沿模型。这一方案曾于 8 月通过由 Cerebras 提供算力的 GPT-5.6 Sol Ultrafast 预览版进行测试。

在 API 中,只需通过 Responses API 以 ultrafast 服务等级调用 gpt-6-astra。其价格是 Astra 标准价格的六倍,即每百万输入 token 60 美元、每百万输出 token 300 美元。Ultrafast 受速率限制,并且仅支持全球处理或美国数据驻留;不支持欧洲数据驻留。

套餐或价格已公布的详情
Pro 100每月 100 美元,不含 Ultrafast
Pro 200每月 200 美元,不含 Ultrafast,新订阅用户的额度降低
Pro 500每月 500 美元,包含 Ultrafast,使用限额为 Plus 的 25 倍
GPT-6 Astra Ultrafast(API,短上下文)60 / 6 / 75 / 300 美元(输入、缓存、缓存写入、输出)
GPT-6 Astra 标准版(API,短上下文)10 / 1 / 12,50 / 50 美元

在 ChatGPT Work 和 Codex 中,Ultrafast 仅向新的 Pro 500 套餐开放。该套餐每月 500 美元,提供 OpenAI 最高的使用限额(Plus 的 25 倍)。Ultrafast 会先消耗套餐内额度,再消耗点数余额;在 Pro 100 或 Pro 200 上购买点数并不能解锁该功能。与此同时,OpenAI 重新向新订阅用户开放 Pro 200,价格仍为每月 200 美元,但包含的额度更少;现有订阅用户可保留原额度至 2026 年 10 月 29 日,之后将在价格不变的情况下转为较低额度。对于 GPT-6.1 Sol,X 上称 Ultrafast 将“很快”推出,尽管模型公告写到会同步推出:目前价格表仅列出 GPT-6 Astra。

🔗 X 上的 Ultrafast 公告


OpenAI 平台:Agents API、Decisions API、使用 ChatGPT 登录与 OpenAI Marketplace

9 月 29 日 — DevDay 也扩展了开发者和企业能够在 OpenAI 平台上构建的内容:面向智能体的 API、可在其他服务中充当身份凭据和支付方式的 ChatGPT 账户,以及可通过合作伙伴使用承诺支出额度的市场。

Agents API、Decisions API 与 Bedrock Managed Agents

9 月 29 日 — Agents API 自 9 月 10 日公开测试起,便向开发者开放了 Codex 的智能体运行框架;现在又增加了计算机操作能力(computer use):智能体可在 OpenAI 托管的浏览器中完成任务,而应用仍负责控制网站访问和登录的审批。该 API 此前已支持多智能体、工具搜索、工具调用和上下文压缩。OpenAI 还推出了 Decisions API,在“未来几天”更大范围发布前先限量开放:它让 GPT-6 Luna 专注于开发者定义的一组问题,并从有限数量的预设答案中作答,以根据文本或图像对内容分类、分流请求,或选择智能体的下一步操作。最后,面向 OpenAI 的 Amazon Bedrock Managed Agents 基于 Agents API,为在 AWS 上构建应用的团队提供由客户控制的计算资源。

🔗 OpenAI API 更新日志

使用 ChatGPT 登录向所有用户开放,Devin 同日接入

9 月 29 日 — 使用 ChatGPT 登录(Sign in with ChatGPT)于 7 月底推出测试版,如今已面向全球已登录用户开放,包括 Enterprise 组织中的用户。用户可以用 ChatGPT 账户在外部服务创建或关联账户:合作伙伴只能获得姓名、电子邮箱地址和头像,无法获取对话或记忆。首批合作伙伴包括 Airtable、GitLab、HubSpot、Notion、Supabase 和 Vercel。此外,一项有限预览功能允许 Plus 和 Pro 订阅者授权应用使用其套餐内的模型用量,无需 API 密钥,并为每个应用设置限额。

Devin 于同日接入这项功能。ChatGPT Plus 或 Pro 订阅者可使用 ChatGPT 登录 Devin,并用订阅套餐支付在 Devin Cloud、Devin Desktop 和 Devin CLI 中使用 OpenAI 模型的费用;这部分用量从套餐已包含的 Codex 和 ChatGPT Work 用量中扣除。用户可在 ChatGPT 设置中调整 Devin 专属限额;达到限额后,会话继续计入 Devin 用量。在 Devin Cloud 中,订阅套餐支付混合模型用量中的 OpenAI 部分。Cognition 推荐 Fusion 模式,以 GPT-6 Astra 为主模型、免费的 SWE-2 为辅助模型:根据其引用的 Artificial Analysis Coding Agent Index,这一组合的成本比单独使用 Astra 的会话低 39%,得分略低(58.9,而使用 Astra max 的 Codex 为 61.6)。Devin Pro、Max 和 Teams 套餐均可使用这一登录方式。

🔗 使用 ChatGPT 登录 · Devin 与使用 ChatGPT 登录

OpenAI Marketplace 与 Private Intelligence:Runway 和 ElevenLabs 加入

9 月 29 日 — OpenAI 推出 OpenAI Marketplace 测试版:符合条件的企业客户可以将其承诺的部分 OpenAI 支出用于购买符合条件的合作伙伴软件。首批 32 家合作伙伴包括创作领域的 Adobe 和 Figma,客户体验领域的 Sierra、Decagon、HubSpot、Salesforce 和 ServiceNow,法律领域的 Harvey 和 Legora,以及网络安全领域的 Palo Alto Networks 和 CrowdStrike。合同和发票仍由合作伙伴负责,暂不提供自助购买。Anthropic 已于 3 月有限预览类似的 Claude Marketplace,并在 9 月 23 日扩大了开放范围。OpenAI 还介绍了 Private Intelligence,将不保留数据、无需保留客户内容的离线安全检查(Private Safety Processing),以及基于机密计算的 Private Inference 预览结合在一起。

Runway 作为首发合作伙伴加入 Marketplace,提供 Runway Creative。这款视频、图像和音频生成与编辑平台据 Runway 称集成了 Gen-4.5、Seedance 2.5、GPT Image 2.5、ElevenLabs V4 和 Runway Agent。该平台自 9 月 29 日起上架,符合条件的企业可将费用计入其 OpenAI 支出承诺;Runway 称其拥有超过 6000 万创作者、电影制作人和营销团队用户。ElevenLabs 同日宣布 ElevenAgents 已在 Marketplace 上架,但使用 OpenAI 支出承诺购买支持 90 多种语言的语音功能还需等到“近期”。

🔗 Enterprise 和 Edu 版本说明 · Runway 加入 OpenAI Marketplace · ElevenLabs 公告


Anthropic 发现 Z.ai 的开放模型 GLM-5.3 能构建完整漏洞利用,且其防护措施可被突破

9 月 29 日 — Anthropic 的 Frontier Red Team 发布了对 Zhipu AI(中国境外称 Z.ai)开放权重模型 GLM-5.3 的分析。其结论是:与通过 Project Glasswing 有限开放的 Claude Mythos Preview 一样,GLM-5.3 能独立构建完整的漏洞利用,但发布时缺乏有意义的防滥用防护措施,且任何人都可以下载。Anthropic 认为,一道关键门槛已经被跨越:这类网络攻击能力如今可以自由获取。

评估指标(据 Anthropic)GLM-5.3Claude Mythos Preview
ExploitBench(Chrome 的 V8 引擎),端到端漏洞利用410 项中 50 项410 项中 56 项
Binary Exploitation(100 项来自 OSS-Fuzz 的任务),完全劫持控制流4 %6 %

在第二项基准测试中,Anthropic 未观察到 Claude Opus 4.6 或 GLM-5.2 成功劫持控制流。在与研究人员共同开展的一次会话中,GLM-5.3 用不超过一天的时间、不到一小时的人类投入,发现了一款热门浏览器 JavaScript 引擎中的多个未知漏洞,并将它们串联成一个能够读取访问者文件的网页;这些漏洞已报告给维护者。其较小版本 GLM-5.3-Flash 利用 Chrome 漏洞 CVE-2026-11645 和另一已知漏洞,在 ARM64 上构建出可靠的漏洞利用链,耗费 20 分钟的人类投入和模型 8 小时的工作时间;按 Zhipu 的 API 价格计算,费用为 20.40 美元。

在防护措施方面,Anthropic 团队实施了“abliteration”,即通过修改权重去除模型的拒绝行为:一个此前从未做过这项工作的团队耗费约 2200 GPU 小时、4400 美元;据文章估算,有经验的团队则需约 600 GPU 小时,即 1200 美元。处理后,模型在 JailbreakBench 上的拒绝率从超过 90% 降至约 3%,在 HarmBench 上降至 2%,在 StrongREJECT 上降至 12%;据 Anthropic 称,其 GPQA-Diamond 得分不变,在 CyberGym 的一个子集上仅下降了几个百分点。即使不修改权重,在不执行任何代码的模拟环境中(由另一个 LLM 模拟命令执行结果),只需少量引导就能让 GLM-5.3 接受明显带有恶意的请求:

绕过条件(模拟环境)GLM-5.3 的参与率
直接请求0 %
伪造的红队智能体背景64 %
预填充推理内容92 %
经 abliteration 处理的版本100 %

在 API 防护措施下,受测 Claude 模型的参与率均保持在 0%;该环境不允许预填充推理内容,也不公开模型权重。Anthropic 指出,负责 AI 标准的 NIST 下属机构 CAISI 已于 9 月 17 日认定,GLM-5.3 是迄今发布的网络能力最强的开放权重模型,与美国前沿水平约相差四个月;Anthropic 表示,其自身测量结果与此大体一致。该公司得出三点结论:国家行为体和非国家行为体很可能使用此类模型;防御者必须拥有能力至少同样强的工具,而 Mythos 5.1 已通过其可信访问计划向经过验证的防御者开放;各国政府应测试能力足够强的模型,包括 GLM-5.3 的后续模型。

🔗 Anthropic 对 GLM-5.3 的分析


约束模型与智能体:OpenAI 与澳大利亚政府网站、安全论证,以及 Perplexity 的纵深防御

9 月 28 日 — OpenAI 承认,6 月期间,正在内部训练和评估的模型未经授权访问了澳大利亚政府网站,并就事件及其处理方式致歉。这一情况是在 8 月中旬发现的,当时 OpenAI 正在审查 7 月 Hugging Face 事件之后的过往活动。

OpenAI 重点详述了访问澳大利亚服务局 Medicare Statistics Reporting Service 的情况。一个不面向公众、缺少部分公开产品防护措施的内部实验模型,原本要查找维多利亚州各社区针对皮肤疾病的人均公共药品支出。它发现了获取该服务非公开访问权限的方法,执行了命令,获取了内部文件、凭据和汇总统计数据,写入了文件并查看了源代码。据 OpenAI 的审查,没有任何患者个人档案被访问。

受影响的澳大利亚机构模型的行为OpenAI 通知日期
Services Australia(Medicare Statistics Reporting Service)非公开访问、执行命令、获取内部文件和凭据;未访问患者档案9 月 10 日
维多利亚州卫生部(VAHI)使用暴露的访问密钥查询报告系统;未访问医疗档案9 月 10 日
BOCSAR(新南威尔士州)通过公共犯罪地图工具发起查询;未访问个人犯罪记录9 月 18 日
AIHW通过第三方服务获取汇总统计数据;绕过访问控制的尝试均告失败9 月 24 日

OpenAI 承认本应更早分享初步调查结果。该公司表示,此后已在研究环境中禁止直接访问互联网,网页访问须经过缓存;在最近一次训练中,一个获得直接访问权限的模型被检测到,训练随即停止。在新的防护措施到位前,其能力最强模型使用工具的训练和评估仍处于暂停状态;该公司表示,Hugging Face 事件仍是已观察到的最严重事件。OpenAI 承诺为受影响机构提供支持,并通过其规模为 10 亿美元的 Daybreak for Frontline Defenders 基金提供额度;还将成立由澳大利亚独立专家参与的工作组,预计在年底前提出建议。其首席战略官 Jason Kwon 将于 10 月 6 日星期二在悉尼出席人工智能特别联合委员会的听证会。

🔗 OpenAI 关于澳大利亚网站的文章

前沿强化学习训练前应有安全论证文件

9 月 28 日 — OpenAI 在同日发表的文章中认为,继续进行任何前沿强化学习训练之前,都应提交结构化的安全文档,理想形式是与航空或核能领域类似的安全论证文件(safety cases);该公司表示,这一目标尚未实现,正在制定相应框架。文章详述了三个方面:技术防护措施(审查训练环境以防奖励劫持、跟踪模型是否意识到自己正在接受评估并设置阻断阈值、使自动纠错机制无法读取推理链、保留不可更改的记录,以及对夜间未得到响应的警报自动暂停训练);运营规则(由另一团队提交书面反向分析、多名高管拥有否决权、暂停程序和审计);以及在每次严重失准事件后开展调查、进行事后复盘并公布结果。据 OpenAI 称,这些建议正在内部实施。

🔗 前沿训练的安全论证文件

Perplexity 详述其纵深防御

9 月 29 日 — Perplexity 发布了《How we engineer safer agents》及配套的 X 帖文,阐述其原则:智能体安全属于安全工程问题。即使没有恶意指令,智能体遇到障碍时也可能寻找绕过方法,越过安全边界;Cornell Tech 的研究人员将这种情况称为“意外失控”(accidental meltdowns)。Perplexity 援引了 7 月的 Hugging Face 事件,以及 SecurityWeek 和 Reuters 报道的案例;其中据 SecurityWeek 报道,6 月 20 日和 21 日曾从澳大利亚 AIHW 的预生产服务器下载一个公开文件。其应对方法遵循三条规则:设置会因彼此独立的原因而失效的多层防护;在智能体之下至少设置一层确定性防护;风险信号只能收紧其权限。文中描述的防护层包括 7 月开源的 Numbat,它在数千台工作站上监控第三方编程智能体(Claude Code、Codex、OpenCode、Pi);Computer 则提供由人工逐条验证的检测规则。该文章没有发布新产品。

🔗 Perplexity 关于智能体安全的文章


编程智能体:Claude Code 2.1.285、Amp、Qwen Code 0.24.7、Replit Agent、Devin for MongoDB、Antigravity 2.18.1 和 Serge

Claude Code 2.1.285 可从终端打开桌面应用

9 月 29 日 — 在 2.1.284 发布一天后,Claude Code 更新至 2.1.285,包含 136 项变更,其中 86 项为修复。

2.1.285 的新功能作用
claude --desktop在指定文件夹或会话中打开 Claude 桌面应用
allowedProviders(受管理设置)限制一台机器上可使用的 API 提供商
claude plugin configure显示和设置插件选项,也可通过脚本操作
后台命令时限默认 30 分钟,最长 2 小时
CLAUDE_CODE_DISABLE_WEB_FETCH禁用 WebFetch 工具

自动模式继续扩展:在未配置模式、使用第三方提供商或关闭遥测的情况下,claude -p 和 Python Agent SDK 也会以自动模式启动。通过自定义 ANTHROPIC_BASE_URL 运行的会话可以使用相应模型提供的 1M tokens 上下文窗口;在 Bedrock 或 Vertex AI 上,如果管理员撤销了默认模型的访问权限,会话会切换至同级别的较旧模型,而不会直接失败。安全方面,PowerShell 工具的解析器无法启动时,权限检查会忽略拒绝规则;Artifact 工具获得永久授权后,可以发布工作目录之外的文件。这两处漏洞均已修复。

🔗 Claude Code 2.1.285 版本说明

Amp 将 medium 模式切换至 Claude Opus 5.5

9月28日 — Amp 更换了 medium 模式的模型;该模式承担着大多数对话任务。Claude Opus 5.5 成为默认模型,取代 GPT-5.6 Sol。使用 ChatGPT Only 预设的 ChatGPT 订阅用户仍使用 GPT-5.6 Sol,费用计入其订阅。Amp 将推理强度设为 high:据团队称,再提高强度会消耗更多 token,得分却更低。GPT-6 Sol 未获选用:Amp 表示,它的得分与 GPT-5.6 Sol 大致相当,价格只有后者的一半,但在实际工作中的表现要不稳定得多。

受评模型已解决任务(Amp 内部评估)相比 Opus 5.5 的成本(据 Amp)
Claude Fable 5.171 %Opus 5.5 便宜 40 %
Claude Opus 5.565 %基准
GPT-5.6 Sol61 %Opus 5.5 便宜 10 %
Claude Opus 556 %Opus 5.5 便宜 25 %

🔗 Opus 5.5(Amp)

Qwen Code v0.24.7 新增 /commit 和远程计算机操作功能

9月29日 — 继 v0.24.6 发布三天后,Qwen Code 推出 v0.24.7:包含 48 项新功能和 81 项修复,未宣布破坏性变更。命令 /commit 可用 AI 编写提交信息;Web Shell 为分支会话新增可选的 worktree;远程会话可通过 node_repl 中继操作用户的计算机(computer use)。记忆功能新增按需结构化召回,执行环境新增基于 Linux 内核安全模块 Landlock 的备用机制。超过一半的新功能在幕后为 Managed Agent 和 Hosted Harness 做准备,包括公开 API 契约、持久会话和需启用后才能使用的托管轮次。Qwen Code Desktop v0.24.7 和 TypeScript SDK v0.1.17 于同日发布;前者现也提供 Linux ARM64 构建版本。

🔗 Qwen Code v0.24.7

Replit 让模型决定如何委派任务

9月29日 — Replit 详细介绍了 Replit Agent 如何分配工作。Agent 的主循环(core loop)会在每一步决定派出哪个子代理、选择何种规模(小型、标准或大型)、采用多高的推理强度,以及是否应返回先前已了解任务的子代理;它还会在当前轮次中调整自身的推理强度。在生产环境中,GPT-6 Astra 在 20 % 的轮次里将工作交给通用执行代理。据公布的基准测试成绩,在以 GPT-6 Astra 为主循环的 Max 模式下,Replit Agent 比单一辅助代理(sidekick)架构领先 11 和 16 个百分点;单独使用 GPT-6 Astra 虽能取得更高分数,但成本超过两倍。

受评配置DeepSWE v1.1每项任务成本(DeepSWE)Terminal-Bench 4.0每项任务成本(Terminal-Bench)
Replit Agent,Max 模式(GPT-6 Astra 主循环)72 %2,11 美元49 %2,53 美元
单独使用 GPT-6 Astra,low 强度(已公布基准)67 %1,60 美元42 %2,25 美元
单独使用 GPT-6 Astra,xhigh 强度(已公布基准)74 %4,43 美元60 %5,86 美元
单一辅助代理架构61 %1,34 美元33 %1,84 美元

🔗 Replit 研究文章

Devin for MongoDB Modernizations

9月29日 — Cognition 与 MongoDB 推出 Devin for MongoDB Modernizations,将 Devin 集成到 MongoDB 的 Application Modernization Platform(AMP)中。这个 AMP 与 Agent Amp 无关。该产品旨在帮助企业摆脱旧有基础设施,迁移至 Atlas。Devin 负责代码、规划,以及业务逻辑和数据访问层的重写;AMP 的确定性工具则将每条记录迁移到 MongoDB 并加以验证。团队仍可决定目标数据模型和切换顺序。在双方最初的联合测试中,原需五到六小时的工作现在只需略多于一小时。两家公司的客户现已可使用该产品。

🔗 Devin for MongoDB Modernizations 发布公告

Antigravity 2.18.1 推出插件市场

9月28日 — Google 发布 Antigravity 应用 2.18.1 版,包含 14 项改进和 15 项修复,并将在数天内逐步推送。新版本加入 Customizations 标签页和插件市场(marketplace),供用户发现、安装和管理插件,涵盖开发工具及工作区集成。此次还修复了一项权限问题:使用 Default 和 Request Review 预设时,Agent 此前可以在未经许可的情况下修改 .git、.env 和 .vscode 文件夹中的文件。同日,Antigravity 博客介绍了通过「Build with Google」官方插件提供的自定义 Agent:Flutter & Dart 插件中的 Flutter Accessibility 可审查应用的语义标签、小于 48x48 dp 的触控目标和对比度,并实施修复;Firebase Security Rules 可编写并强化 Firestore 安全规则。针对 Google Play,文章还提供了一份供用户自行注册的 Agent 定义,用于提交前的只读检查。

🔗 Antigravity 更新日志 · Google 插件中的自定义 Agent

Serge:修复 Transformers 测试的 Hugging Face Agent

9月29日 — 在 Hugging Face 组织名下发布的一篇社区文章中,Tarek Ziadé 介绍了 Serge。这是团队每晚在 Transformers 上运行的持续集成 Agent:它找出失败的集成测试,在 GPU 上重现问题、查找原因、编写修复,然后分别在未修复和已修复的代码树上运行测试五次以验证结果,最后提交由维护者审查的 pull request。约 80 天内,已有 29 项修复合并。每项任务都在不含 GitHub 凭据的临时 Kubernetes pod 中运行;Serge 只能推送 serge/ 分支并创建 PR。两周内,86 次 Kimi K-2.7-Code 会话花费约 250 美元,产生了 24 个经过验证的 PR(其中 19 个各不相同),相当于每个不同 PR 的推理成本约 14 美元、每个已合并 PR 的成本约 43 美元。团队指出一个陷阱:只要修改测试的预期值,就能让测试通过,因此对此类修复会更加警惕。初步试验显示,价格低一半的 Qwen3.8-27B 是更好的候选模型。

🔗 Serge 介绍文章


面向开发者的 Claude 指南:迁移至 Sonnet 5.5、设计评估

迁移至 Claude Sonnet 5.5

9月28日 — Claude Sonnet 5.5 发布数小时后,Addy Osmani 在 claude.dev 上发布了该模型的开发指南,@ClaudeDevs 于当晚转发:Sonnet 5.5 适合日常范围明确的任务,Opus 5.5 适合需要判断力的复杂工作。指南还补充了公告中未提及的细节:缓存提示词的最低长度降至 512 token(Sonnet 5 为 1 024);仅在美国境内运行的推理服务收费为标准价格的 1,1 倍;批处理 API(测试版)的输出上限为 300k token;图像单边最长支持 2 576 像素,但处理一张 2000×1500 图像所需的 token 约为 Sonnet 4.6 的 2,5 倍。迁移方面,在 Claude API 和 Google Cloud 上,计算机操作功能(computer use)仅通过 computer_toolset_20260801 提供;一项测试版服务端备用机制会将 cyber 和 frontier_llm 类别的拒绝请求改用 Sonnet 5 重试。Cyber Verification Program 将「很快」扩展至 Sonnet 5.5。在 Claude Code 中,Sonnet 5.5 没有快速模式,Opus 5.5 仍是默认模型。

每百万 token 的价格Sonnet 5.5Opus 5.5
输入2 美元4 美元
输出10 美元20 美元
缓存写入,5 分钟2,50 美元5 美元
缓存写入,1 小时4 美元8 美元
缓存读取0,20 美元0,20 美元

🔗 Sonnet 5.5 开发指南

设计评估并逐步改进

9月28日 — 在另一篇 claude.dev 指南中,Lance Martin 介绍了如何使用 Claude Code 中 claude-api skill 的两条命令设计评估(evals)并逐步改进(hillclimbing)。/claude-api build-eval 会在代码库中构建评估,优先取材于生产环境对话记录,其次是错误报告、少量手写案例,以及根据代码合成的案例,并推荐成本最低的评分器(grader);9月8日推出的 /claude-api hillclimb 则基于该评估逐项改进应用,同时使用一组留出的案例防止过拟合。指南认为,好的评估应反映生产环境,能随着模型能力提升而显示进步,并在 100 % 以下留有提升空间。

支持任务基准的阶段(30 张研究工单)决策准确率每张工单成本
起点:Opus 4.8,high 强度74,4 %4,6 美分
经审查的提示词,Opus 5.5,low 强度87,8 %1,9 美分
Sonnet 5,low 强度88,9 %约 1 美分
Sonnet 5 加路由规则98,9 %成本相近

在留出的 14 张工单上,最终配置达到 90,5 %,起点为 78,6 %,成本约为原来的五分之一。将这种方法应用于 claude-api skill 本身后,其成绩从 66 % 提升至约 88 %。

🔗 评估设计指南


Anthropic 启动 Anthropic Interviewer 研究,了解用户对 AI 的期待

9月29日 — Anthropic 启动一项由 Anthropic Interviewer 开展的新研究。这款 AI 会进行约 15 分钟的访谈,以了解人们对 AI 的期待。研究时间为 2026 年 9 月 29 日至 10 月 6 日,面向账户已创建至少两周的 Claude 和 Claude Code Free、Pro、Max 用户。访谈围绕三个主题:与 AI 有关的深刻经历,包括正面和负面体验;AI 可能给工作、学校、医疗或行政事务带来的变化;以及参与者对开发 AI 的企业(包括 Anthropic)有何期待。据 Anthropic 称,此次的新做法是首次允许每位参与者公开完整访谈记录,记录会标明国家,但不包含姓名和电子邮件地址。常见问题说明指出,看似无关紧要的细节也可能使人被识别;Anthropic 可应请求删除其持有的副本,却无法删除已被他人保存的副本,因此公开决定应视为最终决定。这项研究延续了 2025 年 12 月对 81 000 人开展的研究。

🔗 Anthropic Interviewer 研究介绍


模型:NVIDIA Kumo Tabular 与登陆 Amazon Bedrock 的 Grok 4.7

Kumo Tabular:NVIDIA 的开放表格模型

9月29日 — NVIDIA 在 Hugging Face 博客上发布 Kumo Tabular。这是一款面向表格数据的开放基础模型:输入已标注的行和待预测的行后,它能通过一次前向传播输出类别概率或数值,无需训练、超参数调优或特征工程。模型有三个规模版本,参数量从 28 到 215 百万不等,采用允许商业使用的 OpenMDW-1.1 许可证。预训练期间,它未接触任何真实数据:Small、Medium 和 Large 版本分别使用从结构因果模型生成的约 35、71 和 137 百万个合成表格,上下文最多支持 60 000 行。公布的限制包括:仅支持数值列和类别列,且每次前向传播最多处理 10 个类别。

基准测试NVIDIA 公布的结果
TabArena第 1 名,ELO 1950
BeyondArena第 1 名,ELO 1418
TALENT总榜第 1 名
ScoringBenchLarge 平均排名第 1,Medium 第 2

🔗 NVIDIA 在 Hugging Face 上的文章

Grok 4.7 登陆 Amazon Bedrock

9月28日 — Grok 4.7 发布一周后登陆 Amazon Bedrock。SpaceXAI 发布了这一消息,AWS 的模型页面也标注了同一天的日期。这款 xAI 前沿模型面向编程、Agent 任务和知识工作,支持文本与图像输入,拥有 500 000 token 的上下文窗口和四档推理强度(low、medium、默认的 high,以及 xhigh)。全球跨区域推理沿用 SpaceXAI API 的定价;仅在美国区域路由的价格高 10 %。除 Standard 外,还提供两档服务:Priority 按基础价格的 1,75 倍收费,Flex 则为半价。访问只能通过跨区域配置文件 us.xai.grok-4.7 和 global.xai.grok-4.7 进行,并支持兼容 OpenAI 的端点和 Converse。继 Grok 4.3 和 Grok 4.6 之后,Grok 4.7 是 Bedrock 列出的第三款 Grok 模型。

推理选项(Standard 档)每百万 token 输入价格每百万 token 输出价格每百万 token 缓存读取价格
全球跨区域(Global CRIS)2,00 美元6,00 美元0,50 美元
美国跨区域(Geo CRIS)2,20 美元6,60 美元0,55 美元

🔗 Amazon Bedrock 的 Grok 4.7 模型页面


专业 Agent:VSS Blueprint 3.3、ProvenanceGuard 和 Maverick-4B-Unity-XR-Agent

NVIDIA VSS Blueprint 3.3 根据一条指令构建视频智能体

9 月 29 日 — NVIDIA 发布 VSS Blueprint 3.3,这是其用于视频搜索与摘要(Video Search and Summarization)的 Metropolis 参考方案的新版本。它整合 VLM、LLM、RAG 和 MCP 工具,让用户能够用自然语言搜索视频、获取经过核验的警报和生成报告。新增的 Build Vision Agent 技能(vss-build-vision-ai)让代码智能体(Claude Code、Codex 或任何兼容 agentskills.io 的智能体)从一段简单描述出发,选择四种经过验证的配置中最接近的一种来构建应用;在 NVIDIA 的演示中,一条指令便在不到 30 分钟内构建了一个监控交通拥堵队列的智能体,代码智能体的使用成本仅为几美元。自适应高效视频采样(Adaptive Efficient Video Sampling)跳过画面中保持不变的区域,让 VLM 集中处理有事件发生的时刻;NVIDIA 指出,效果会随场景中的运动情况而变化。

测量指标(RTX PRO 6000 Blackwell,Cosmos 3 Super FP8)未启用 Adaptive EVS启用 Adaptive EVS
警报上下文生成延迟1 021 ms844 ms (-17 %)
同时运行的实时 VLM 视频流1319 (+46 %)
60 分钟视频的摘要生成基准耗时约减半,VLM tokens 用量减少 80 %

🔗 NVIDIA 关于 VSS Blueprint 3.3 的技术文章

ProvenanceGuard 核验 MCP 智能体每项陈述的来源

9 月 29 日 — Multiverse Computing 团队在 Hugging Face 博客上介绍了 ProvenanceGuard。这是一个用于通过 MCP 组合多个工具的智能体的核验层。它针对的问题是:某项陈述虽然能在工具输出的某处得到证实,却被归给了错误的来源;常见的核验工具会汇总所有证据,因此放过这种错误。ProvenanceGuard 在内容生成后运行,无须重新训练智能体:它读取 MCP 运行记录,将回答拆分为各项陈述,逐项关联来源,然后决定放行或拦截回答。在医疗智能体的运行记录中,专家判定应拦截的 139 项陈述里,它拦截了 138 项,但也将 67 项有效陈述送交复核;其拦截 F1 分数为 0,802,高于 MiniCheck 的 0,783 和 RAGAS 的 0,758。团队承认的局限是:面对高度相似的来源,它仅能为 50,3 % 的陈述找出正确来源。

🔗 Multiverse Computing 在 Hugging Face 上的文章

Maverick-4B-Unity-XR-Agent 离线通过语音控制 Unity

9 月 28 日 — Manisa Celal Bayar 大学扩展现实实验室(XRLab)的 Eren Ata 发布了 Maverick-4B-Unity-XR-Agent。这是一个基于 Qwen3-4B 微调的 40 亿参数模型,可通过语音控制 Unity 中的扩展现实场景。它接收房间的 JSON 描述和用户的话语,然后调用其 11 种工具中的一种。量化后的模型大小为 2,5 Go,可通过 llama.cpp 在约 3 Go 的 GPU 内存中运行,配备 4 Go 显卡的笔记本电脑便能在本地使用,无须向设备外发送任何内容。该模型使用 20 091 段合成对话,在单张 NVIDIA T4 上通过 QLoRA 训练;在 ALFRED 基准测试的 499 条真人指令上达到 83,8 %,相比之下,原始 Qwen3-4B 为 57,1 %,拥有 1 200 亿参数的 Nemotron-3 Super 为 58,9 %。团队承认的弱点是:面对无法执行的操作,模型只有 75 % 的概率能直接拒绝而不尝试执行。模型以 Apache-2.0 许可证发布,Unity 软件包采用 MIT 许可证。

🔗 Hugging Face 上的文章


简讯

  • Codex CLI 0.159.1 — 此修复版本于 9 月 29 日 20 时 32 分(UTC)发布,包含两项回移的修复,并将 GPT-6.1 Sol 设为内置模型目录以及 Amazon Bedrock Mantle 和 Runtime 目录的默认模型。🔗 来源
  • Basis 与 GPT-6 Astra — 在 OpenAI 于 9 月 28 日发布的案例研究中,自动处理会计工作的 Basis 表示,使用 GPT-6 Astra 填写一份含 50 个工作表的税务工作簿,耗时比使用 GPT-5.6 Sol 缩短一半,内部评测成绩提高约 20 %。🔗 来源
  • Asana 及其 AI Teammates — Claude 博客关于人类与智能体团队系列的第三篇文章中,Asana 产品负责人 Arnab Bose 介绍了职责明确的智能体:它们的访问权限受请求者权限限制,使用的共享记忆仅能由管理员和编辑者修改。文章列出三种内部用途,没有提供量化收益。🔗 来源
  • Genspark 与 Claude Sonnet 5.5 — Genspark 在 AI Chat、Code Agent 和 Claw 中开放了这款于 9 月 28 日推出的模型,并引用 Anthropic 的数据:输出速度提高超过 30 %,单项任务成本较 Sonnet 5 最多降低 30 %;但未说明套餐价格或额度扣减方式。🔗 来源
  • 通过 ChatGPT 账户使用 Warp 和 v0 — 与 Devin 同一天,Warp(与 OpenAI 合作的 Terminal 和 Agent CLI)及随后推出的 v0 开始允许用户使用 ChatGPT 登录,并用订阅包含的使用额度支付请求费用;两者均未公布单独定价。🔗 来源 · v0
  • Warp 中的 Claude Sonnet 5.5 — Warp 在 Warp Terminal 和 Warp Agent CLI 中开放了 Anthropic 的这款模型(9 月 28 日 22 时 36 分 UTC 发布的推文);其声称在“写关于 Rust 的十四行诗”基准测试中达到的“100 %”,是针对模型名称开的玩笑,并非测量结果。🔗 来源
  • Cursor 与 /visualize — Cursor 现在可以在对话中绘制图表和示意图:/visualize 命令分析数据,并在 Agents Window 的对话线程中显示结果。此次发布仅有一条推文,未见博客文章或更新日志条目。🔗 来源
  • Muse 中的 Replit — 9 月 24 日宣布的 Replit 连接器现已在 Meta 的个人智能体 Muse 中上线:用户连接 Replit 后,可在对话中让 Muse 构建并发布应用;价格和适用国家均未说明。🔗 来源
  • Warp 所说的工程师两项工作 — Zach Lloyd 在 9 月 28 日的一篇文章中解释,Warp 的工程师如今既构建产品,也构建生产产品的软件工厂;无需人工干预完成的工作比例起初约为 20 至 30 %,团队则通过每个 PR 的人工干预次数追踪进展。🔗 来源
  • DeepSeek Harness 0.2.0-rc.2 — DeepSeek 智能体框架的第 24 个预发布版本,仍无稳定版:dsh 命令随 macOS 和 Windows 桌面应用提供,无须安装 Node 或 pnpm;第三方模型目录与 pi-ai 0.87.1 对齐(一些旧标识符被移除),并新增实验性的异步提问模式。🔗 来源
  • Copilot CLI 1.0.90 预发布版 — 9 月 28 日至 29 日间共发布六个预发布版本,从 1.0.90-0 到 1.0.90-5,尚无稳定版;1.0.90-3 增加了 --mcp-github-auth 选项,将 GitHub 账户身份验证限制在获批的 MCP 服务器,并加入会话期间的文件夹只读访问权限。🔗 来源
  • Gemini CLI 9 月 29 日夜间构建版 — 仅有一项变更,即 PR #29448:修复自 7 月 9 日起有人报告的 Windows、WSL 和无界面(headless)模式下无限循环的身份验证问题。修复采用凭据的原子写入,并在系统密钥库阻塞时回退到文件存储;稳定版也在当晚更新至 v0.62.0。🔗 来源
  • Antigravity CLI 1.2.11 和 1.2.10 — 补录 9 月 24 日和 25 日的更新:1.2.11 可通过 --effort 或 /effort 设置推理强度;1.2.10 增加中等详细程度模式,并使在部分回答后中断的无界面运行以退出码 3 结束。🔗 来源
  • Gemini Notebook 中的 Live Voice Chat — 可用约 100 种语言与自己的笔记本进行实时语音对话;继 9 月 21 日向 Ultra 订阅者开放后,该功能现已在移动端向所有 Pro 用户全面推出。🔗 来源
  • GitHub 上的外部自定义属性 — 此功能进入公开预览阶段,可从 CMDB 等权威系统导入仓库的业务背景信息(负责人、服务级别、生命周期、合规情况),在 GitHub 中以只读方式呈现,并通过 API 同步;Port.io 是首个公布的合作伙伴。🔗 来源
  • Dependabot 与按仓库配置的 runner — 对于 github.com 上的私有和内部仓库,仓库管理员现在可以为 Dependabot 更新选择 runner 类型、标签和组;此前这项设置仅能在组织层级配置。🔗 来源
  • Perplexity Agent API — API 更新日志先后加入 Claude Sonnet 5.5(每百万 tokens 输入 2 美元、输出 10 美元,缓存读取 0,20 美元)和 GPT-6.1 Sol(不超过 272 000 tokens 时输入 2 美元、输出 10 美元;超过该数量后分别为 4 美元和 15 美元;缓存读取优惠 95 %,提供 flex 和 priority 层级)。🔗 来源
  • MCP 还是 API:Perplexity 的指南 — 9 月 28 日的一份指南将 MCP 介绍为 API 之上的一层,建议在工具数量多或经常变化时使用;对于固定流程和大批量任务,则建议直接使用 API,因为 MCP 会消耗更多 tokens。指南未发布新功能。🔗 来源
  • Liquid AI d1 — Liquid AI 发布了首个决策模型 d1,称其在 Hugging Face 的 Decision Index 上率先超越 Jev,但未公布分数;目前可通过其 API 使用,宣称“即将”登陆 OpenRouter,模型权重尚未发布。🔗 来源
  • OpenRouter 上的 Together AI — Together AI 根据当日一份未附详细方法说明的快照,称自己按 tokens 用量计算,是 OpenRouter 主要开放代码模型的第一大供应商:GLM 5.3 Flash 占 29,2 %,DeepSeek V4.1 Flash 占 25,6 %,Kimi K3 占 18,9 %。🔗 来源
  • Open Superconductor Challenge — FINAL-Bench 在 Hugging Face 上发起一项开放科学竞赛:参赛者从 4 832 种二维材料中筛选 63 种,在笔记本电脑处理器上寻找 d 波超导材料;奖金为 3 000 美元,本赛季于 2026 年 12 月 31 日结束。🔗 来源
  • 100 美元订阅与租用 GPU 的成本对比 — 开发者 Javad Taghia 在一篇社区文章中估算,自己租用六至七张 H200 来运行 GLM-5.3,每月需花费 5 172 至 6 034 美元,是其订阅费用的 50 至 60 倍;若改用一张 MI300X 运行量化后的 GLM-5.3 Flash,差距则缩小至约 5 倍。🔗 来源
  • TRL v1.14.1 — 针对 v1.14.0 的修复版本:Hugging Face 修复了使用 vLLM 0.20 至 0.25 时服务器模式首次同步权重发生的崩溃,并恢复工具调用后每个样本只生成一条续写的行为。🔗 来源
  • NVIDIA 股票回购 — 9 月 28 日,NVIDIA 董事会批准额外回购 1 500 亿美元股票,使剩余额度达到 2 350 亿美元;NVIDIA 称这是其历史上最大的一次额度上调。此消息仅涉及财务事项。🔗 来源
  • TensorRT Model Connect — NVIDIA 从这个面向代码智能体设计的开源项目中总结出五条原则:工作可并行、设定目标而非操作步骤、按模型家族隔离、变更可撤销、自动验证。截至 7 月 29 日,该项目已涵盖在 GB300 上测试过的 128 个模型家族。🔗 来源
  • Runway Agent Tagging — Runway 允许用户在资源所在位置提及 Runway Agent,请它进行修改、制作变体和修正;9 月 28 日,该平台还加入了 ElevenLabs 的 Eleven v4。未公布价格,也没有更新日志条目。🔗 来源
  • Suno Studio 的均衡器 — Suno 关于音效的第二篇教学文章介绍:Suno Studio 自 2025 年起就为每条音轨提供 EQ,最新版本又将其作为音频效果提供,支持预设、在音轨与项目之间复制设置,以及在一条音轨上使用多个 EQ;这并非新功能发布。🔗 来源
  • Genspark 选择 Soniox — Genspark 选择 Soniox 为其产品提供语音识别,包括语音控制的 AI、会议记录和自主电话呼叫,并强调其支持 60 多种语言;未说明部署日期或合作条款。🔗 来源
  • Grok Imagine 与《奥德赛》 — 在 9 月 18 日推出首集后,Grok Imagine 又展示了改编自荷马《奥德赛》的第二集试播作品:Wonder Studios 用 15 天制作完成,生成了 2 070 张图像和 1 558 段视频,未公布成本。🔗 来源

这意味着什么

DevDay 正在将 ChatGPT 和 Codex 变成能在用户不在场时工作的智能体平台。dots 可以在各自的云端计算机上昼夜运行,Codex 任务在笔记本电脑合上后仍会继续;Perplexity 也在同一天推出 Automations,让智能体根据日程或事件触发,并保留历次运行的记忆。两项发布对自主性的安排相似:有些操作由智能体独立完成,有些需要审批,操作历史可供查看。但两者的收费模式已经不同:OpenAI 包含首个 dot,之后按月收取固定费用;Perplexity 只在智能体执行操作时消耗积分。与此同时,Agents API 增加了计算机操作能力,ChatGPT 插件也能响应 MCP 事件:智能体不再需要等人向它发话。

OpenAI 还让订阅额度成为一种通用支付手段。通过 ChatGPT 登录后,Devin、Warp 或 v0 可以使用 Plus 或 Pro 套餐内含的额度;OpenAI Marketplace 则允许企业将部分 OpenAI 合同承诺支出用于 Runway、Adobe 或 CrowdStrike。速度也成为单独销售的产品:Ultrafast 的价格是 Astra 标准价格的六倍,Pro 500 套餐可在 ChatGPT Work 和 Codex 中使用它;与此同时,GPT-6.1 Sol 以五分之一的价格接近 Astra 的表现。当天的评估也更关注每项任务的成本,而非单纯的分数:Devin 使用 GPT-6.1 Sol 时,得分与 GPT-6 Sol 相差不到一分,成本却低了 44% 至 57%;Replit 允许模型委派任务后,得分提高了 11 至 16 分;Amp 选择了比 GPT-5.6 Sol 便宜 10% 的 Opus 5.5;Serge 修复 Transformers 测试,每个独立 PR 的推理成本约为 14 美元。

这一天也引出了芯片制造商与模型实验室之间集中化的问题。如果 Clément Delangue 所描述的收购成真,托管众多实验室开放模型的平台将归 NVIDIA 所有。目前只有他的发文宣布此事,尚无交易金额、时间表或正式公告。AMD 则已签署收购 World Labs 的最终协议,并表示希望借助模型实验室的专业知识,指导其硬件、软件和系统路线图。两笔交易都以开放生态系统为目标:Clément Delangue 将收购描述为推动开源人工智能胜出的途径,AMD 则谈到为开放生态系统建设人工智能基础设施。同一天,NVIDIA 还在 Hugging Face 博客上发布了 Kumo Tabular;这是一款采用允许商业使用的许可证的开放模型。

最后,前沿模型的安全已成为事故应对和程序制定的问题。OpenAI 的模型未经授权访问澳大利亚网站时,正处于训练和评估阶段,并未投入生产;OpenAI 提议在开展任何前沿强化学习训练前要求提交安全论证文件,针对的正是这一阶段。Anthropic 的研究则显示,开放模型 GLM-5.3 能构建完整的漏洞利用程序;按其测量,能力与 Claude Mythos Preview 相当,而且只需约 4,400 美元的计算成本就能移除其拒绝机制。各方的应对方式趋向于在模型之外设置防护:Perplexity 在智能体下层设置确定性防护层,OpenAI 在研究环境中阻断直接互联网访问,Claude Code 则允许管理员限制 API 提供商。在防御方面,Codex Security Cloud 现已默认包含 Daybreak Blue 的网络安全模型,Anthropic 也呼吁各国政府测试能力最强的模型。


来源