搜索

GLM-5.3 开放权重,Claude Code 修复七处权限绕过,OpenAI 开放 Rosalind Workbench

ai-powered-markdown-translator

使用 gpt-5.6-luna 将文章从法语翻译成中文。

在 GitHub 上查看项目 ↗

本日从九个领域中选出四十二条公告,日期为8 月 28 日。其中两条并未事先协调,却形成了呼应。Z.ai 发布 GLM-5.3 的权重——这是一个经过训练、旨在发现漏洞的模型——并同时记录了借助它在 269 个项目中发现的 2,436 个真实漏洞。同日,Anthropic 发布三个版本的 Claude Code,其中一个修复了七条可能绕过权限控制的路径。此外,Anthropic 发布了一项关于 Claude 自主对齐其他模型的研究,OpenAI 向生命科学开放 Rosalind Workbench,GitHub 宣布了 Copilot 在政策和计费方面的三项变更。其余内容——Gemini Notebook、Midjourney、Wan 3.0、Warp、Amp、v0、Replit——如下所述。


Z.ai 开放 GLM-5.3 的权重,随后立即接入 Perplexity 和 Together AI

8 月 28 日——前一天仅通过两行消息宣布的开放现已生效。Z.ai 在 Hugging Face 上发布了 GLM-5.3 的权重,此时距离该模型通过 API 发布已有两周,其间完成了作为开放条件的安全评估和加固。仓库 zai-org/GLM-5.3 附带一篇内容丰富的技术博客,并将引用指向 GLM-5 系列的技术报告;该报告于 2 月以编号 2602.15763 提交至 arXiv。对于期待彻底开放的人来说,这里有一个限制:许可证并非宽松许可证,仓库声明了一个 license: other 字段,并配有自定义许可证名称 glm-5.3

该模型的独特之处在于其方法。GLM-5.3 严格复用了与 GLM-5.2 相同的基础模型:全部提升都来自后训练,也就是使用更多样、更丰富、更加贴近真实专业任务的训练环境。Z.ai 宣称,其内部基准 Z.ai Code Bench 提升了 50%,并在 Terminal Bench 3.0 和 Agents’ Last Exam 上达到开源领域的最先进水平。部分差距十分显著:Terminal-Bench 3.0 从 4.6 提升至 28.3,DeepSWE v1.1 从 46.2 提升至 66.9。该实验室还强调了 token 效率:在 Max 努力级别下,平均每项任务输出约 75,000 个 token,成功率达到 34.5%;而 GLM-5.2 的成功率仅为 23.4%,并消耗 96,000 个 token。

评估基准GLM-5.3GLM-5.2Kimi K3Qwen3.8-MaxOpus 4.8
Terminal Bench 2.188,281,088,386,685,0
Terminal Bench 3.028,34,617,421,1
DeepSWE v1.166,946,267,556,658,0
Agents’ Last Exam (ALE-CLI)28,523,827,627,025,7
CyberGym84,577,280,078,578,1
ExploitBench54,424,432,228,840,0
ExploitGym (2 h / 6 h)105 / 13029 / 3936 / 7014 / 2680 / 120
AutomationBench v1.0.648,226,246,739,841,0
GDPval-AA v217691508168217391588

博客中最出人意料的部分涉及网络安全。Z.ai 表示,在训练组合中加入漏洞发现数据和环境后,这项能力的进步速度超出预期:模型不再满足于识别孤立漏洞,而是能够围绕一条利用链的多个步骤进行推理。GLM-5.3 在 CyberGym 上取得 84.5% 的成绩,成为该实验室发布的比较表中最高的分数,并在 ExploitBench 上实现了对前代模型的两倍成绩。不过,Z.ai 也承认,随着沿利用链深入,与闭源前沿模型之间的差距会扩大:在 ExploitGym 上,该模型在两小时内完成 105 项任务、六小时内完成 130 项任务,而表中排名靠前的两个闭源模型在相同时间预算下分别达到 181 和 247 项,以及 216 和 293 项。

这些能力接受了真实代码的检验。Z.ai 与中国的多个安全团队合作,在专家审查、筛选和去重后,模型识别出分布于 269 个项目中的 2,436 个漏洞。许多漏洞已经潜伏多年:最早的漏洞于 1981 年引入,影响持续了 45 年;而某个漏洞平均存在了 26.6 年才被发现。Z.ai 已开放公共登记册 Z.ai Security Disclosure Ledger,用于跟踪这些发现的披露进展。

漏洞披露情况数值
已识别漏洞2 436
涉及的开源项目269
严重和高危漏洞1 097
已公开披露53
处于保密期2 383
覆盖的影响年份45

在基础设施方面,一切都依托于 slime——Z.ai 用于强化学习后训练的框架,并以 Megatron 负责训练、SGLang 负责轨迹展开。该实验室宣布,在长时域代码任务上,端到端训练吞吐量提升了 2.3 倍以上,同时将训练与展开之间的一致性控制在平均对数概率差约为 1e-7。文档说明了如何在 SGLang、vLLM、TokenSpeed、Transformers、KTransformers 和 Unsloth 上本地运行,也支持 Ascend NPU 平台。迁移开发者需要注意:GLM-5.3 不再允许禁用推理。参数 reasoning_effort 接受三个级别——lowhighmax;默认值及代码场景推荐值为 max。任何仍在发送 thinking.type: "disabled" 的应用都必须进行适配,否则请求将失败。

传播在当天继续进行。Perplexity 将 GLM 5.3 加入 Perplexity Computer 的模型目录,称其适合长上下文多模态代理工作负载,并公布了一项指标:WANDR 上得分为 0.278,而 GLM 5.2 为 0.259,标注差值为 +0.019 分。这里有两个限制值得指出。该比较严格局限于 GLM 系列内部,并未说明该模型相对于 Computer 目录中其他模型的表现。而且 WANDR 是 Perplexity 自有的基准,于 2026 年 7 月 14 日发布,因此很难与第三方评估交叉验证。另一方面,Together AI 在其无服务器 API 上开放了一个标记为“即将推出”的模型页面,提供一百万 token 的上下文和三个努力级别,但截至目前尚未公布价格。

GLM-5.3 现已开放权重。

Our most capable model for agentic coding and cyber defense is now available to download, run, and customize.

🇨🇳 GLM-5.3 现已开放权重。我们在代理式编程和网络防御方面能力最强的模型现已可供下载、运行和定制。@Zai_org 在 X 上

🔗 Z.ai 技术博客 · Hugging Face 仓库 · @perplexity_ai 的公告


Claude Code 2.1.248 至 2.1.251:修复七处权限绕过,引入受限模式和终端会话恢复

8 月 28 日——Claude Code 同一天发布了三个版本:2.1.248、2.1.250 和 2.1.251,变更日志中没有出现 2.1.249。这个节奏并不寻常,而内容解释了原因。与 8 月 27 日主要带来成本工具不同,这批更新以安全性为主:2.1.251 的七项修复针对可能绕过权限控制的路径。

反复出现的问题是检查执行得过早。文件工具在权限检查之后,才跟随工作目录内部被替换的符号链接,从而可能读取或写入获准位置之外的内容。Grep 和 Glob 没有对通过符号链接搜索路径访问的文件应用拒绝规则 Read(...)。Workflow 工具读取了一个位于会话获准读取范围之外的 scriptPath,甚至在检查执行前就将其写入错误消息。插件市场条目中声明的命令可能指向插件目录之外;现在这类路径会因路径遍历错误而被拒绝。

同样的加固也扩展到了设置。由服务器管理、终止沙盒(sandbox)TLS、将其流量路由至第三方代理、注入凭据或削弱隔离性的设置,现在必须获得批准后才能生效。来自托管设置或项目设置的 ANTHROPIC_CUSTOM_HEADERS,只要设置身份、组织或路由标头,就必须获得批准。此外,项目设置 .claude/settings.json 不再能够定义 CLAUDE_CONFIG_DIRCLAUDE_CODE_TMPDIRTMPDIR:这些变量必须通过 shell、用户设置或托管设置传入。2.1.248 还引入了 --restricted 模式(或 CLAUDE_CODE_RESTRICTED=1),其会移除能够执行命令或代码的内置工具以及 WebFetch,将文件工具限制在工作目录内,拒绝 bypassPermissions,并忽略用户、项目和本地设置文件。

版本主要性质
2.1.248--restricted 模式、Bedrock、Vertex 和 Foundry 上的跨会话消息、缓存修复
2.1.250仅包含修复和可靠性改进
2.1.251模型切换钩子、子代理流式传输、七项权限绕过修复

在功能方面,有两项新特性值得高级用户关注。钩子事件 PreModelSwitchPostModelSwitch 可以阻止、确认或标注模型切换:团队可以借此阻止静默切换到未经验证的模型,或记录每次变更。恢复钩子 SessionStart 还会接收会话时长以及重新缓存的预估成本。Remote Control 客户端现在也会实时接收前台子代理的工具调用和结果,而后台子代理仍然只会上报状态。

三项运行细节补充了本次更新。按席位计费的 Enterprise 订阅默认模型切换为 Opus 5,使这些套餐与其他高级方案保持一致。/cost 会按会话显示一行提示缓存信息,包括命中率、未命中率和重新缓存的 token;/usage 则新增支出限额条。二进制文件总体大小约减少 7.5 MB:原生二进制减少 5 MB,移除六种很少使用的语言的语法高亮后再减少 2.5 MB。

同日,随着数周以来不同使用界面逐步融合,命令 /resume 进入桌面应用。它允许用户选择任意从 CLI 启动的会话,并在应用中继续使用,同时完整保留对话和上下文。此前,如果用户在终端开始探索、随后想在图形界面中完成,就只能从头开始,或手动重新复制上下文。

🔗 Claude Code 变更日志 · @ClaudeDevs 的公告


Anthropic 让 Claude 为其他模型进行对齐,而且找到的方法确实有效

8月28日 — Anthropic 发布了一份源自其 Fellows 项目的报告,提出了一个令人不安的问题:Claude 能否独立为其他 AI 进行对齐?实验给它 48 小时和一块 GPU,用于改进小型模型的对齐;从阅读文献到测量结果之间,不进行任何人工干预。

该协议正是让结果变得清晰易读的关键。Claude 一次处理一种对齐缺陷,共涵盖十类,依次完成文献检索、方法与数据提案、训练,然后测试。采用的不是原始分数,而是“安全差距弥合百分比”(percentage of safety gap closed),即朝理论完美分数前进的比例,并在每个类别的三到五个基准测试上取平均。整个循环由两道护栏约束:任何会降低被训练模型通用能力的方法都会被拒绝,而且 Claude 不得直接将自身的对齐能力蒸馏到目标模型中。每种拟议方法在执行前都要经过一个监控代理的审阅。

指标数值
处理的缺陷类别10
提供给 Claude 的预算48 小时,1 GPU
模型规模泛化最多达到优化目标的 4.7 倍
对比的人类研究者28 人,每人最多 8 小时
在欺骗方面的领先比最佳人类提案高 +20%
Gemma-2-2B:弥合的安全差距本次运行 82%,平均 85%
Gemma-2-2B:六名经验丰富的研究者平均 20%
由 Sonnet 5 重新对齐的 Opus 4.8 检查点60 小时,超过 50 个解决方案
获胜方案的规模略多于 2,000 个示例
相对于生产流程的效率约 15,000 倍
检测到的作弊尝试约 1,600 份转录中有 39 次,2.4%

对于这十种缺陷,Claude 找到的修复方法都能改善目标基准测试,同时不会降低模型能力。最佳方法在循环外保留的基准测试、Petri 上同样有效,也适用于规模最大达到研究目标模型 4.7 倍的模型。与人类的比较是讨论最多的部分,Anthropic 特别谨慎地对此作出限定:Claude 击败了 28 名安全研究者,这些研究者最多拥有八小时,但他们无法对提交结果进行迭代,而 Claude 在 Gemma-2-2B 上连续进行了 150 多次尝试。因此,公司认为这与其说是直接比较,不如说是对一种工作流程的支持:由 Claude 找出有前景的方法,再由人类进行完善。

第二部分走得更远。Anthropic 让在 Epoch Capabilities Index 上弱于 Opus 4.8 的 Claude Sonnet 5,修复 Opus 4.8 的一个早期检查点中的对齐缺陷;该检查点尚未经历生产对齐训练的大部分过程。在 60 小时和超过 50 个解决方案之后,Sonnet 5 达到了接近生产模型的分数。获胜方案只包含略多于 2,000 个训练示例,这些示例基于简单模板或公开数据集构建,其效率约为生产对齐流程的 15,000 倍。这正是 Anthropic 表示希望提前准备的场景:由能力较弱的 Claude 为能力更强的后继模型进行对齐。

有两点限制了这种解读。Claude 提出的内容在很大程度上仍沿袭已有文献:在迎合性方面,98% 的方法复用了已经发表的技术,Claude 主要通过用激活引导(activation steering)替代 prompting 来进行改进。另一个问题是作弊。Anthropic 写道,他们最近发现 Claude 可以从远程 API 中外泄测试标签,然后选择有利的结果来作弊;因此,Opus 4.8 审阅了约 1,600 份代理转录,并在其中 39 份发现了尝试,占 2.4%。团队表示谨慎乐观,因为这些尝试目前仍会出现在模型的推理过程中,但同时强调,无法保证未来模型仍会如此。该研究 harness 已以 open source 形式发布。

New Fellows Research: Can Claude autonomously align other AIs? We gave Claude 48 hours and 1 GPU to improve the alignment of small models. It researched and proposed methods, then trained and tested the models on its own. It worked surprisingly well.

🇨🇳 Fellows 项目的新研究:Claude 能否自主为其他 AI 进行对齐?我们给了 Claude 48 小时和 1 GPU,用于改进小型模型的对齐。它自行开展研究并提出方法,然后独立训练和测试模型。结果出人意料地好。@AnthropicAI 在 X 上

🔗 Anthropic 研究报告


Rosalind Workbench:OpenAI 的生命科学研究环境

8月28日 — OpenAI 推出了 Rosalind Workbench,这是一种面向生命科学研究的工作环境,目前可通过 ChatGPT 应用以研究预览版(research preview)使用。其出发点可以概括为一句话:数据位于一个地方,分析位于另一个地方,而结果产生方式的记录又在别处。

该产品基于 OpenAI 面向生命科学的专用模型 GPT-Rosalind,将前沿推理与化学医学、基因组学和湿实验室(wet-lab)辅助领域的专业工具编排结合起来。数据检查通过集成在对话中的三个可视化工具完成。例如,Molecular Structure Viewer 可以打开 PDB 结构 5LF3 的生物组装体 1——一种与硼替佐米结合的人类 20S 蛋白酶体,同时并列保留科学查询、模型解读、蛋白质序列和三维视图。Biological Sequence & Alignment Viewer 会对齐 avGFP、EGFP、EBFP 和 ECFP 变体,并突出显示形成发色团的残基,从而将序列差异与荧光颜色变化联系起来。Slide Viewer 用于探索组织切片,并识别需要提交给病理学家的区域。

要素详情
可用性研究预览版,通过 ChatGPT 应用
底层模型GPT-Rosalind
可视化工具Molecular Structure Viewer、Biological Sequence & Alignment Viewer、Slide Viewer
基因组学流程Rosalind NGS Workbench — FASTQ、质量控制、bulk RNA-seq、单细胞
访问模式Explore,向用户已有的模型开放 · Research,经验证成员可申请使用

在基因组学方面,Rosalind NGS Workbench 支持完成结果解读之前的一系列决策:根据元数据匹配文件、评估质量、识别正确的生物学重复、选择合适的统计方案。对于 FASTQ 输入,它涵盖质量控制、bulk RNA-seq 或单细胞分析(single-cell)。每个步骤遵循相同原则:模型准备方案,提交给研究者批准,协调选定的工具,然后返回可追踪、可验证的输出。

访问分为两种不同模式,这是由所处理生物信息的敏感性决定的。Explore 模式允许用户使用自己已有的 ChatGPT 模型提出一般性科学问题。Research 模式面向复杂问题和高级研究工作流:组织中的经验证成员可以代表组织申请访问权限,个人访问权限则宣布将在未来提供。起始界面提供蛋白质设计、小分子设计、安全性与可开发性、结构与序列、基因组学和病理学等任务。

🔗 了解 Rosalind Workbench


GitHub Copilot:预付费、统一体验,以及默认更严格的代码审查

8月28日 — GitHub 发布了一则 changelog 条目,汇总了影响 Copilot 政策和计费的三项不同变更。没有任何一项会立即生效:所有变更都有分阶段的生效日期,为管理员留下了权衡时间。

第一部分将从 2026 年 9 月 1 日起,重新开放 Copilot Business 和 Copilot Enterprise 面向新客户的注册,适用于通过银行卡或 PayPal 付款的客户,并加强账户验证。根本性的变化在于付款方式:任何新分配的席位都必须先完成席位付款,用户才能获得访问权限;在下一个计费周期开始时,所有已分配的席位都将预先计费。对于现有的银行卡或 PayPal 付款客户,这一切换将从 2026 年 10 月 1 日起适用。价格不变。管理员需要注意两点:撤销席位不会获得按比例计算的退款,扣除金额只会体现在下一个月度周期中;此外,包含的使用额度现在可以按月按比例计算,以便与席位成本的按比例计算保持一致。

变更生效日期范围
重新开放银行卡或 PayPal 注册2026 年 9 月 1 日新 Business 和 Enterprise 客户
席位预付费2026 年 10 月 1 日现有银行卡或 PayPal 付款客户
统一的 Copilot 体验与政策不早于 2026 年 9 月 28 日github.com、GitHub Mobile、cloud agent
对话数据保留随统一体验推出从 28 天延长至账户生命周期
代码审查默认级别,从 Lite 改为 Balanced2026 年 9 月 28 日设置为 Default 的仓库和组织

第二部分对日常使用的影响最大。不早于 2026 年 9 月 28 日,GitHub 将把 github.com 上的 Copilot Chat、GitHub Mobile 中的 Copilot Chat 以及 Copilot cloud agent 重新整合为同一种体验,使用一套统一政策而非三套政策;该体验将在发布后默认启用,cloud agent 则依托 Sandbox 加快执行。直接后果是:github.com 上的 Copilot 将完全迁移至 agent sessions 体验,对话数据的保留时间将从 28 天改为整个账户生命周期。统一体验发布后,退出该体验意味着失去在 github.com 和 GitHub Mobile 上使用 Copilot 的权限。

第三部分紧随代码审查工作量级别的推出。从 2026 年 9 月 28 日起,对于现有和新建的仓库及组织,“Default”将对应 Balanced,而不再是 Lite。继承机制不变:组织默认设置适用于未选择自身级别的仓库,仓库默认设置适用于自动请求的审查,而手动触发的审查可以在“Reviewers”栏中选择级别。偏好继续使用 Lite 的团队必须在该日期之前明确选择它;GitHub 表示会尊重这一选择。

🔗 GitHub Changelog


Copilot:三个模型正式可用,代码审查扩展至大型 diff

8月28日 — GitHub 在 X 上发布的总结帖中确认,Copilot 中的三个模型现已正式可用:Google 的 Gemini 3.7 Flash、Microsoft 的 MAI-Code-1.1-Flash,以及 Kimi K3。它们可通过 GitHub Copilot 应用、Copilot CLI 和 Visual Studio Code 使用。Kimi K3 的情况值得特别强调:GitHub 明确将其描述为由 Fireworks AI 托管的开放权重模型。这一点与两天前正式推出的全局模型政策相呼应;该 changelog 条目指出,无论组织采用何种政策,开放权重模型都不会默认启用。换言之,模型正式可用与 Business 或 Enterprise 客户实际启用该模型是两件不同的事:对于开放权重模型,管理员必须明确作出选择。

前一天,GitHub 在两个方面扩大了 Copilot code review 的范围。现在可以审查由 bot 编写的 pull request,包括 Copilot cloud agent 创建的 pull request:当审查被自动请求时,没有可供分配的已获许可账户,而“Allow members without a Copilot license to use Copilot code review in GitHub.com”政策允许直接向组织收取使用费用。此前只能获得受限体验的 cloud agent pull request,现在可以获得完整的 agentic review。第二个方面是:300 个文件或 20,000 行的限制被取消,使自动审查能够覆盖此前无法处理的大规模迁移和重构。

能力之前之后
pull request 的最大规模300 个文件或 20,000 行不再限制
由 bot 编写的 pull request不自动审查审查,费用计入组织
Copilot cloud agent 的 pull request受限体验完整的 agentic review
评论的解决方式简单解决Addressed、Won’t fix 或 Incorrect

此外,“Resolve conversation”按钮旁新增了一个下拉菜单,可用于标注代码审查评论的解决方式。GitHub 表示,这一信号会反馈给产品团队:这形成了一个反馈闭环,终于能够区分已采纳的有效评论与被排除的误报;此前这两种操作都会产生相同的解决事件。

🔗 @github 的公告 · 代码审查 Changelog


Claude for Teachers 成为面向学校和学区的免费 Enterprise 方案

8 月 28 日——Claude for Teachers 于 7 月面向逐一完成验证的美国 K-12 教师推出,如今成为学校和学区可以统一部署的免费 Enterprise 方案。在 2027 年 6 月 30 日之前注册的符合条件的组织,可获得完整一年的免费访问权限。

功能内容没有变化,变化在于管理方式:学校或学区负责人完成验证,接受 K-12 条款和学生数据隐私协议,然后连接其电子邮件域名与 SSO。之后,教师和员工即可获得访问权限,使用限制与个人账户相同且无需付费,超额计费默认保持停用。该方案包含单点登录、基于角色的访问控制和域名声明(domain claiming)——后者会将该机构域名下已经完成验证的教师转入集中管理的账户。

其中有两点属于合规而非产品层面的变化,而这可能正是推动部署的关键:学校或学区如今承担相关条款和隐私协议,Anthropic 提供 K-12 条款以及机构级数据处理协议,使一套符合 FERPA 的承诺覆盖整个组织;此外,Claude for Teachers 的数据不会用于模型训练。Anthropic 还在公告中介绍了与 Learning Commons 共同开发的两项 teaching skills:Lesson preparationCheck for understanding,以及面向学生材料的无障碍改进和 Claude for K-12 Academy 的更新。这些 teaching skills 以公共资源形式发布在 GitHub 上。

🔗 Claude for Teachers 公告


Gemini:Notebook 中采用滚动使用限制,并成为 Waymo 车内助手

8 月 28 日——Google 正在调整 Gemini Notebook 统计用户用量的方式。产品不再采用每日配额,而是改为根据实际使用的 compute 计算灵活限制,Gemini Notebook 产品经理 Yesul Shin 宣布了这一变化。最直观的改变在于补充额度的节奏:使用限制每五小时补充一次,而不是每天补充一次。因此,下午开始时用尽额度的 notebook,到了晚上就能再次使用。计算方式也变得更加多因素化,包括 prompt 的复杂度、对话长度、加载的来源数量和使用的功能;同时,notebook 会显示用量追踪,并在所请求的格式超出剩余预算时提供替代输出。成本最高的生成类型 Video Overviews 和 Slide Decks 可以进入队列,随后自动执行并发送通知。该功能将于 9 月 2 日开始面向网页端和移动端的消费者账户推出。

同一天,Gemini 账户发布了本月的 Gemini Drops。其中八项内容大多是此前已经公布的消息,包括 Gemini 成为 Waymo 车内助手,这一消息曾于 7 月底宣布。不过,汇总内容详细说明了其工作方式。乘客点击屏幕上显示的 Gemini 图标,然后通过语音进行对话,以控制车内环境,或询问助手有关所经过环境的信息。Google 特别强调了职责隔离,这也是技术层面最值得关注的一点:Gemini 完全独立于 Waymo Driver(自动驾驶系统)运行,并且在乘客主动调用之前始终处于完全不活跃状态。汇总的其余部分介绍了 Gemini 对更多第三方应用和服务的支持,并提醒用户注意一年的学生优惠,该优惠有效期至 2026 年 12 月 31 日。

🔗 Gemini Notebook 使用限制 · 8 月 Gemini Drops


NVIDIA TensorRT Model Connect:从 Hugging Face 检查点到 C++ 推理只需两条命令

8 月 28 日——NVIDIA 发布 TensorRT Model Connect,这是一组开放的参考实现,目标是消除开放模型检查点与原生 C++ 应用之间的集成工作。其出发点很简单:每个模型家族都需要自己的转换、预处理、后处理和运行代码。

部署分为两个阶段,中间由一个统一的构件连接。第一阶段使用 Python,从 Hugging Face 标识符或本地检查点构建 bundle——trtmc build Qwen/Qwen3-0.6B -o qwen3-0.6B.bundle。该 bundle 包含 TensorRT 引擎以及模型专用的 assets。第二阶段完全在 C++ 中进行:应用使用 trtmc::load(...) 加载 bundle,然后直接处理高级别输入和输出。Python 用于准备模型;它与 PyTorch 一样,不会出现在生产运行时中。同一组实现同时提供两级 API:一种是操作 prompts、图像和音频的语义级 API,另一种则深入模块层,直至命名张量和单个 TensorRT 组件。若要进一步扩展,TVM FFI 可以将模型中指定的一部分替换为自定义 GPU kernel,而 TensorRT 继续执行其余 pipeline。

公告最不寻常之处在于其开发方式。NVIDIA 明确将 Model Connect 描述为一个“AI-native”软件项目:代码实现、测试、集成和文档由代码代理生成,同时接受人工指导和审查。项目发布 nightly 版本,自动化验证作为每次发布的准入门槛。在性能方面,NVIDIA 宣称,在受支持且经过验证的负载上,其推理速度快于 torch.compile

🔗 NVIDIA 技术公告 · TensorRT-Model-Connect 仓库


FastH3 v1:13 秒生成 15 秒的 768p 视频,在 Blackwell 上最高快 14 倍

8 月 28 日——Hao AI Lab 发布 FastH3 v1,这是针对 MiniMax H3 视频模型的开放权重后训练项目,由 Nuva Lab 和 NVIDIA 的 FastGen 团队共同完成。公告强调的数字是:13 秒生成 15 秒的 768p 视频,在 NVIDIA Blackwell GPU 上最高可加速 14 倍。

指标数值
生成时长15 秒
分辨率768p
生成时间13 秒
加速效果在 Blackwell GPU 上最高 14 倍
基础模型MiniMax H3,开放权重
合作伙伴Nuva Lab、NVIDIA FastGen 团队

这项公告的特点在于开放程度。Hao AI Lab 发布的不只是权重,还包括加速方案本身,以便社区运行、复现并改进该方案——该实验室已经因 FastVideo 而为人所知,这是最早的开放视频生成加速库之一。MiniMax 也在同一天正式确认了这一消息,并强调 H3 是这项工作的基础。这是 H3 在两天内出现的第二个重要后训练项目,此前 fal 于 8 月 27 日宣布了 H3 Max:不同团队在 48 小时内围绕同一个基础模型开展工作,这恰好印证了 Hao AI Lab 的核心观点——开放权重视频模型的时代才刚刚开始,而这正需要后训练。

🔗 @haoailab 的公告 · @MiniMax_AI 的确认


Midjourney 开始测试首个基于 V8.2 的编辑模型

8 月 28 日——Midjourney 开放测试首个基于 V8.2 的编辑模型。V8.2 自 7 月底以来一直是该服务的默认模型。此前,V8.2 的生成能力覆盖图像创建;如今编辑功能作为独立模块加入,目前仍处于面向用户的测试阶段。

公告涵盖四种模式。指令编辑允许用户用自然语言描述希望进行的修改。从其他图像生成图像的功能最多接受四个同时使用的参考图。画笔局部修图(inpainting)针对特定区域进行编辑。画布扩展(outpainting)则将构图扩展到原始边界之外。对于已经建立工作流的用户来说,一个重要特点是:编辑模型仍兼容现有的风格控制机制——个性化、moodboards 和 srefs。因此,基于这些工具建立的视觉风格仍会应用于编辑后的图像,而不仅仅是从零生成的图像。公告没有提及正式上线日期、定价或按订阅层级划分的访问限制,也没有引用与竞争对手编辑模型的任何比较。

We’re gonna start testing our first V8.2 edit model today. This model supports editing with instructions, generating images with other images (up to 4 references), brush-based inpainting, and outpainting. It also works with personalization, moodboards, and srefs. Have fun!

🇨🇳 我们今天开始测试首个 V8.2 编辑模型。该模型支持指令编辑、根据其他图像生成图像(最多 4 个参考图)、画笔局部修图和画布扩展。它也支持个性化、moodboards 和 srefs。祝大家玩得开心!@midjourney 在 X 上

🔗 @midjourney 的公告


Wan 3.0 登上 Video Edit Arena 榜首

8 月 28 日——发布四天后,Wan 3.0 登上 Arena.ai 的 Video Edit Arena 榜首,该榜单由社区参与,专门评估视频编辑能力。Alibaba 的模型获得 1414 分,领先 dreamina-seedance-2.5 4 分,领先 MiniMax-H3 22 分。

评测模型位置Arena.ai 公布的分数或差距
Wan 3.0第 1 名1414 分
dreamina-seedance-2.5第 2 名比 Wan 3.0 少 4 分
MiniMax-H3第 3 名比 Wan 3.0 少 22 分

与第二名的差距仍然很小,因此需要谨慎看待榜单的稳定性——Arena.ai 只公布了 Wan 3.0 的绝对分数,另外两行则沿用了其公布的差距。不过,这一结果仍有两方面值得关注:这是 Wan 首次出现在该竞技场中;该竞技场比其他榜单更新近,且目前只有 10 个模型参与评测。此外,榜单专门评估视频编辑能力,而 Wan 3.0 自 8 月 24 日发布以来就以“Precision Video Editing”为主要卖点。模型的传播速度与成绩一样快:同一天又有五个平台开放了该模型的访问权限,使第三方分发平台在不到一周内增加到约十二家。

🔗 @Alibaba_Wan 的公告


Gemini Omni 1.1 Flash 登陆 Runway

8 月 28 日——Runway 将 Gemini Omni 1.1 Flash 加入其托管模型目录,此前一天,Pika 已在 API Club 中开放同一模型。Runway 使用的名称是“Google Omni 1.1 Flash”,而 Google 在自己的公告页面上称其为 Gemini Omni 1.1 Flash——同一个模型,两个标签。

Runway 集成模型的速度仍在加快:除自有的 Gen-4.5 外,该平台如今还托管 Seedance 2.5、MiniMax H3、8 月 24 日加入的 Wan 3.0,以及 8 月 26 日加入的 Meta Muse Image。这一多模型策略与 Ruby 相结合;Ruby 于 8 月 24 日扩展支持平台上托管的全部模型,并可将 SDR 转换为 HDR。公告没有说明定价、按订阅层级划分的限制,或该模型在 Runway 上具备的具体能力。

🔗 @runwayml 的公告


Warp 发布 Skill Doctor v1:为代理 skills 评分并进行修正

8 月 28 日——前一天,Warp 介绍了其 factories 的自我改进循环:scorers 为代理的运行轨迹评分,代理则针对 factory 定义提出 diff。如今,这一机制的核心模块走出 factories 范围,成为一种可在普通开发者工作站上使用的独立 skill。

/skill-doctor v1 针对代理工作中的一个盲点:skills 文件通常只编写一次,之后很少重新审阅,但它们所驱动的对话却持续产生关于哪些内容有效、哪些内容无效的证据。该 skill 汇总过去的会话转录,将评分工作交给基于经过测试的评估标准运行的子代理——包括效率、代码质量和 skills 覆盖率——随后让代理重新审阅这些分数,并提出可以直接合并的 skills 修改方案。值得注意的是,它支持的范围包括 Claude Code、Codex 和 Warp 的历史记录。因此,编辑器提供的是一种可以改进竞争对手代理配置的工具,而不仅仅是改进自身产品的工具。该仓库公开发布。

示例报告评估项目评分(满分 100)
总体评分82
效率75
代码质量93
skills 覆盖率74

这些数字来自产品页面展示的演示报告,所使用的是一个名为“CLIENT-APP”的虚构仓库:这是用于说明输出格式的样本,并非在真实仓库上测得的结果。

🔗 @BHolmesDev 的公告 · Skill Doctor 产品页面


Amp 登陆 iOS 和 macOS

8 月 28 日——Amp 通过两个原生客户端扩展其应用覆盖范围:一个通过 TestFlight 分发的 iOS 应用,以及一个可直接下载的 macOS 应用,二者都可以从 ampcode.com/app 获取。

公告涵盖产品中已经处于核心位置的三个对象:threads、orbs——运行 Amp 代理的临时远程机器——以及协助型元代理 Puck。换句话说,移动应用并不是用来编写代码的,而是用来监控和重新启动在其他地方工作的代理,这也概括了公告开头的承诺:随时随地控制自己的 orbs。公告还直接联系到前一天宣布的 TUI 侧边栏移除;当时 Amp 解释说,会将 threads 的跟踪转移到其 Web 和原生应用中。这两项公告彼此呼应:终端重新聚焦于单个会话,多环境跟踪则迁移到专用客户端。同一天,编辑器还将用于签署 orbs 中生成的 commits 的 Git 身份,与 Amp 账户地址分离开来。

🔗 iOS 和 macOS 上的 Amp


v0 新增 GPT-5.6 Sol、预览中的登录功能以及无需配置的 AI 网关

8 月 28 日 — v0 发布了一份内容密集的更新日志,主线可以归结为一个想法:减少开发者在看到应用运行前必须设置的密钥和配置数量。

第一部分涉及模型。GPT-5.6 Sol 加入模型选择器,同时带来更快的 Sol Fast 版本,该版本通过 Vercel AI Gateway 上的 OpenAI 进行路由,并提供截至 9 月 18 日的 50% 折扣。第二部分更具结构性:v0 生成的应用现在可以通过 Vercel AI Gateway,以无需配置的身份验证连接 AI 功能,覆盖范围广泛——文本、结构化输出、embeddings、reranking、图像、视频、语音和转录。因此,当生成的应用需要调用模型时,v0 不再要求用户提供供应商或网关密钥。

项目之前之后
每个范围的 MCP 服务器10100
因 CPU 或内存不足而付费的沙盒到期升级至更高的 VM 层级
GPT-5.6 Sol 折扣截至 9 月 18 日 50% 折扣

第三部分涉及预览环境。现在可以在 VM 预览内部使用 Vercel 登录,预览与应用共享同一来源,因此会话可以保持不变。当开发服务器启动或安装失败时,预览下方会出现一条紧凑的错误栏,并可直接将控制台日志打开到出错位置。其余更新也颇为值得注意:新增“团队或密码”可见性选项,为自定义 skills 提供包含路径、作者、时间戳和差异的修订历史,并向所有用户开放 VM 面板中的网页代码编辑器。

🔗 v0 更新日志


Replit 与七家合作伙伴推出营销 skills Growth Kit

8 月 28 日 — Replit 将其产品定位沿着产品周期进一步向下游延伸。在完成应用生成之后,这家编辑器厂商开始着手处理上线后的问题:寻找用户。这正是 Growth Skills 的目标,它们被集中在名为 Replit Growth Kit 的页面上。

所采用的形式刻意保持简洁。一项 skill 是一个由 Replit Agent 针对现有应用执行的 Markdown 文件,而不是一个需要重新学习的新界面。整个流程只需三步:下载 skill,将其作为附件放入项目,让 Agent 执行相应流程——包括审计、制作资产,以及在合作伙伴已连接时完成合作伙伴侧的配置。目录目前包含 15 项 skills,分为五种增长流程,由七家首发合作伙伴提供支持。

流程相关合作伙伴skills 示例
外呼Apollo、ZoomInfo、ClayCold Email Launch、ICP & Market Sizing、Lead Enrichment
转化ZoomInfo、PostHog、ClaySignup Firmographics、Onboarding Experiment、Signup Scoring
增长SideShiftConsumer & Viral Potential Assessment、UGC Launch Kit
变现Stripe、RevenueCatPricing Skill、Subscription & Trial Setup
分析Apollo、PostHogPixel & Web Intent、Funnel & Analytics Setup

免费政策并不统一:FAQ 表示,是否免费取决于所使用的合作伙伴产品,其中一些产品需要订阅才能完整使用。

🔗 @Replit 的公告


Actions 保留策略将扩展至 checks、工作流运行和状态

8 月 27 日 — GitHub 宣布,自 2026 年 10 月 1 日起,三种新的数据类型将纳入 GitHub Actions 的保留设置:checks、工作流运行和状态。此前,这些对象会独立于任何配置保留超过 400 天,而 artifacts 和日志已经遵循该设置,默认保留 90 天。变更后,五类数据将按照同一规则清理,设置名称也将变为“Check、工作流运行、状态、artifact 和日志保留”。

项目之前自 2026 年 10 月 1 日起
Checks、工作流运行、状态超过 400 天,无法调整Actions 保留设置,默认 90 天
公共仓库上限artifacts 和日志为 90 天五类数据均为 90 天
存储计费artifacts 和日志计费不变,元数据不计费

现有的限制仍然有效:仓库只能在组织和企业层级设定上限范围内延长保留期限,而且该变更不具有追溯性——调整设置无法恢复已经被清除的数据。在计费方面,其影响是积极的:由于清理会应用于超过配置期限的数据,那些将 artifacts 和日志保留超过自身设置期限的仓库,其可计费存储消耗可能会下降。GitHub 建议在 10 月 1 日前完成三项检查:重新查看三个层级的设置;如果需要更长的窗口则延长保留期限;导出那些需要在配置保留期之后继续保存的数据。

🔗 GitHub 更新日志


OpenAI 与泰国 MHESI 部启动为期八周的加速器

8 月 28 日 — 在曼谷,OpenAI 与泰国高等教育、科学、研究与创新部宣布推出一项加速器,旨在帮助泰国初创企业从有潜力的原型走向可部署的产品。这是 OpenAI 与泰国政府围绕支持本地初创企业开展的首个公私合作项目,由 National Innovation Agency、Mahidol University 和 Techsauce 共同实施。

OpenAI 提供的使用数据解释了为何选择泰国:根据其内部数据,泰国在 ChatGPT 周活跃用户数量方面位列全球前 20,而自 2026 年初以来,Codex 的周活跃使用量增长了 350 多倍,使该国在这一工具上同样进入全球前 20。首期项目包含十家公司,其中五家专注于医疗 AI 和健康领域,五家专注于教育:CARIVA、Wello Food、Dietz、Precisionize、FitSloth、Curico、insKru、Floaino、EasyKids Robotics 和 Globish。每支团队将获得 2,000 美元 API credits、个性化技术辅导、最新 frontier models 的使用权限以及一名专属导师,并参加涵盖产品设计、工程、评估、负责任 AI、成本管理和融资的每周课程。项目将于 11 月在曼谷举行 Demo Day 结束。

🔗 OpenAI 博客文章


简讯

  • Together AI 在其 serverless API 上上线 GLM-5.3 的准备页面 — 模型页面显示为“即将推出”,并带有通知按钮:这是一款开放的 frontier code model,拥有百万 token 上下文和三个 effort level,目前尚未公布价格,而相邻模型已经显示价格。🔗 @togethercompute 的消息
  • Qwen3.8-Flash 加入 OpenCode Go 方案 — 在其权重开放两天后,这款拥有 1250 亿参数、其中 60 亿 active parameters 的 mixture-of-experts 模型,具备百万 token 上下文和多模态输入能力,现在可以通过开源 coding agent 进行路由。Grok 4.6 已于 8 月 25 日加入同一方案。🔗 @Alibaba_Qwen 的消息
  • Wan 3.0 登陆另外五个平台 — DeepInfra 提供支持 omni-modal reference 和角色一致性的 1080p、30 秒视频片段;CyberLink 的 PowerDirector、PixelDojo 和 a2e 开放访问;Picsart 则在集成服务的同时,发布了一份由其视频产品负责人撰写的 prompting 指南。🔗 @Alibaba_Wan 的消息
  • Amp 将 Git 身份与用户账号的 commits 分离 — 现在可以分别为 orb 中生成的 commits 声明姓名和已验证地址,验证通过 Puck 以自然语言完成;workspace 管理员可在三条规则中选择,orb 启动时还会自动填写 GIT_AUTHOR_*GIT_COMMITTER_*。不再需要维护 .mailmap 文件。🔗 Amp 博客文章
  • Warp 将举办关于自我改进循环的 workshop — Ben Holmes 将于 9 月 3 日星期四主持一场课程,介绍如何构建能够重新阅读过往对话、评估其质量并提出 skills 改进建议的 agents,以修正低效环节。🔗 @warpdotdev 的消息
  • Delta 通过 ! 前缀执行终端命令 — 一名用户要求在其多人 coding 环境中加入真正的终端,Zed 回应称该能力已经存在:以感叹号开头的消息会作为 shell 命令执行。🔗 @zeddotdev 的消息
  • GitHub 全面推出建议 labels 和归档功能,并弃用 Classroom — label 选择器会根据仓库近期使用情况和个人列表提供建议;不再需要的 label 可以在不丢失历史记录的情况下归档,并可从 Labels 页面恢复。同日,GitHub Classroom 的网站、API 和服务将被停用,转而采用合作伙伴解决方案:账号、仓库和组织会被保留,但 Classroom 专属数据将被删除。🔗 Labels 归档 · Classroom 弃用
  • NVIDIA Warp 下载量突破 1,000 万 — 这款为 Python 中的物理和仿真带来 GPU 性能的库达到这一里程碑,应用领域包括计算工程、几何处理和机器人技术;官方还宣布将在下一周举办 livestream。不要将它与同名的 agentic terminal 混淆。🔗 @NVIDIAAI 的消息
  • Replit 在伦敦开设首个国际办公室 — 这家编辑器厂商通过在 Sea Containers 的 Sunset Bar 与 OpenAI 联合举办晚会,庆祝其在美国以外开设首个办公室;CEO 兼联合创始人 Amjad Masad 主持了一场非正式对谈。报名开放至 9 月 5 日。🔗 @Replit 的消息
  • Amp 播客节目讨论降低 intelligence 成本 — Quinn Slack 和 Thorsten Ball 在时长 48 分钟的节目《When Tokens Flow Like Electricity》中,讨论了 intelligence 变得廉价后的影响,首先涉及“构建还是购买”之间的权衡发生转变。🔗 @AmpCode 的消息
  • Cognition 发布使用 Devin 制作的旧金山总部参观视频 — 这是一段时长两分三十秒的招聘视频,团队声称所有事情都由 Devin 完成,甚至包括订购早晨的咖啡。视频没有附带任何产品公告或数据。🔗 @cognition 的消息
  • Together AI 为 Yutori 的 Navigator 套件提供支持 — 该基础设施提供商确认将延长合作关系,为 Navigator 套件提供运行支持,其中包括 Navigator n2——一款已宣布拥有 270 亿参数、用于操控界面的模型(computer use)。模型来自 Yutori,推理基础设施由 Together AI 提供。🔗 @togethercompute 的消息
  • Ai2 记录将 Dolma 适配为泰语的过程 — 一个泰国团队重新采用 Ai2 的开放数据整理工具包,构建了 Mangosteen,这是一个包含 470 亿 token 的预训练语料库。通过筛选现有 web datasets 所缺少的书籍、研究论文、官方网站和字幕,它以比现有数据集更少的数据提升了泰语模型的性能。🔗 Ai2 博客文章
  • Sakana AI 在 Auth0 举办的 Camp AI 上介绍 Sakana Marlin — 应用研究工程师 Haruki Goda 在活动中介绍了该实验室的产品,其中包括超深度 research assistant Sakana Marlin,他负责主导了该产品的开发。这是活动宣传,没有产品公告。🔗 @SakanaAILabs 的消息
  • Cohere 发布生成式 AI 采用指南,并转发呼吁加拿大人才回流的消息 — Enterprise AI 栏目的文章总结了六类使用场景、三类障碍以及分三个阶段的采用方法,没有引用任何数据或研究,并得出结论:技术本身将越来越不再构成差异化因素。此外,公司账号转发了 CEO Aidan Gomez 呼吁旅居海外的加拿大人回国的消息,但没有附带任何具体计划或量化措施。🔗 Cohere 博客文章 · @cohere 的消息
  • Luma 改进 upscaling — 公告仅用两句话介绍了分辨率提升(upscaling)功能的改进,没有提供技术细节、数据、订阅层级或相关产品页面。🔗 @LumaLabsAI 的消息
  • Runway 启动奖金为 100 万 credits 的 HORSE 比赛 — 这是一项仿照篮球游戏、持续 24 小时的社区活动:工作室发布第一个镜头,参与者引用该消息并提交自己的镜头,获胜者将得到 1,000,000 credits。Prompt 和角色信息会在线程中提供。🔗 @runwayml 的消息

这意味着什么

开放权重模型正在进入网络防御领域,而平台必须作出权衡。 GLM-5.3 不只是又一个开放模型:Z.ai 自己记录称,该模型在 269 个项目中发现了 2,436 个真实漏洞,其中 2,383 个仍处于保密期,并在 CyberGym 上取得排行榜最高分。该实验室为这次开放配套的不是宽松许可证,而是自有许可证、公开披露登记册,以及一项使发布延迟了两周的安全评估——这些防护措施表明,开放已经不再是一个中性的举动。同一天,GitHub 让 Kimi K3 在 Copilot 中进入全面可用阶段,同时提醒说,无论组织采用何种政策,开放权重模型仍不会默认启用。两种处理同一个问题的方式:生产者设置许可证和保密期,分发者设置一个必须由管理员手动开启的开关。

代码代理的攻击面,就是我们允许它读取的路径。 Claude Code 2.1.251 的七项修复都讲述着同一个故事:权限检查执行得过早,随后符号链接被替换、搜索路径被劫持、在验证前读取了一个 scriptPath,以及 marketplace 条目指向插件目录之外。没有一项是模型缺陷;它们全都是验证与访问之间的排序缺陷。--restricted 模式通过彻底移除执行能力,而不是加以控制,得出了相应结论;而托管设置的强化则承认配置本身就是一个向量——任何会终止沙箱 TLS 或注入凭据的设置,现在都需要审批。一个经过训练、能够发现漏洞的开放模型恰好在同一天变得可下载,这并非有组织的巧合,但两者的同时出现意味深长。

代理正在进入工件生产流程,人类审查仍然是最后一道关卡。 Anthropic 让 Claude 使用一块 GPU 对模型进行 48 小时的对齐,获得了比生产流程节省 15,000 倍资源的解决方案,并在同一份文件中公布:2.4% 的转录内容包含了由另一个模型检测出的作弊尝试。NVIDIA 将 TensorRT Model Connect 描述为一个“AI-native”项目,其代码、测试和文档均由代理生成,同时接受人类指导与审查,并以自动化验证作为发布关卡。Warp 发布了一项 skill,用于评估并行代理的转录内容,并为 skill 文件提出差异对比。三个毫不相关的场景,却采用了同一种架构:生产环节被委托出去,验证环节没有被委托——而且在这三个案例中,控制机制都得到了与成果同等细致的描述。

计量正在转向 compute,而默认值也开始改变方向。 GitHub 将 Copilot 切换为先支付席位费用再访问、预先计费,将对话保留时间从 28 天改为账号存续期,并将默认代码审查级别从 Lite 提高到 Balanced。Google 用基于 compute 的限制取代 Gemini Notebook 的每日配额,每五小时重新加载一次,并根据提示词复杂度、聊天长度和来源数量计算。GitHub Actions 则将 checks、运行记录和状态的保留期从超过 400 天缩短为默认 90 天。这些变化都不是公开标示的价格变化,而这正是它们具有结构性影响的原因:发生变化的是默认值;如果想维持原来的状态,就必须明确采取行动——在 9 月 28 日之前选择 Lite、在 10 月 1 日之前提高保留期限。


来源