ai-powered-markdown-translator文章由 gpt-5.6-luna 从法语翻译成中文。
8 个领域共 22 条公告,涵盖 8 月 29 日:这是一个平静的周六,信息量只有前一天的一半。当天的主导消息偏向合同而非技术。OpenAI 已通知 SpaceX,打算停止向 Cursor 提供其模型,拟定的终止日期为 11 月 12 日,并明确提及 Elon Musk 旗下企业过去的行为。Anthropic 则宣布 Claude Code 的每周限额永久提高 25%,但按其自己的说法,这相对于今天的水平意味着下降 17%。GitHub 让 Copilot CLI 转向原生 Rust 运行时,Together AI 在 GLM-5.3 可用当天将其上线,而一个推理网关公布了生产环境数据,终于让人看清开放权重模型的实际位置。
OpenAI 因 SpaceX 收购 Cursor 而终止合同
8 月 28 日 — OpenAI 已通知 SpaceX,打算终止一份让 Cursor 直接访问其模型的合同。拟定的终止日期为 2026 年 11 月 12 日:该公司表示,选择了合同允许的最长通知期,以便开发者尽可能长时间地继续访问这些模型。
原因在于 SpaceX 对 Cursor 的收购。OpenAI 解释说,它通过定制合同与大型合作伙伴合作,以确保遵守使用条款,并保障大规模集成的安全性;该公司表示,无法相信 SpaceX 会在这一框架下使用其技术。声明明确列举了两个先例:Elon Musk 收购 Twitter 后,后者如今已归于 SpaceX 旗下,两家公司之间原有的合同条款被解除;而在今年早些时候的宣誓证词中,Musk 承认同样已并入 SpaceX 的 xAI 违反了 OpenAI 的使用条款。与 Cursor 签署的协议规定,在控制权发生变化后存在一个有时限的终止窗口,这解释了这一时间安排。
此外还有第二个更不寻常的论据:OpenAI 表示,随着能力不断提升,它正在承担更高层级的责任,并提到了即将推出的 Astra 模型——OpenAI 曾于 8 月 7 日宣布,根据其准备框架,无法再排除该模型达到“关键”级网络能力的可能性。实际结果是:合同会持续到允许的最晚日期,但未来不会再向 Cursor 提供任何模型。
| 案件要素 | 数值 |
|---|---|
| 通知 SpaceX 的日期 | 2026 年 8 月 28 日 |
| 拟定终止日期 | 2026 年 11 月 12 日 |
| OpenAI-Cursor 合作期限 | 近 4 年 |
| 向 Cursor 提供的未来模型 | 无 |
We’re ending our partnership with Cursor following its acquisition by SpaceX. Under our proposal, Cursor’s direct access to our models would end on November 12.
We know that the people most affected by this decision are the developers who rely on OpenAI models in Cursor. We care about their experience in this transition and we’re ready to go above and beyond to support them.
🇨🇳 我们将因 Cursor 被 SpaceX 收购而终止与 Cursor 的合作。根据我们的提议,Cursor 直接访问我们模型的权限将于 11 月 12 日终止。
我们知道,受这一决定影响最大的是那些在 Cursor 中依赖 OpenAI 模型的开发者。在过渡期间,他们的使用体验对我们十分重要,我们愿意超越自身义务来帮助他们完成过渡。 — @OpenAI 在 X 上
Claude Code 每周限额将于 9 月 14 日下调 17%,CLI 启动速度更快
8 月 29 日 — Anthropic 宣布,自 9 月 14 日起,Claude Code 面向 Pro、Max、Team 和按席位计费的 Enterprise 计划的标准每周限额将永久提高 25%。在此之前,目前的 50% 临时增幅仍将继续生效。
这一表述需要进一步说明,Anthropic 随后在其线程的下一条消息中亲自作出解释:与今天的情况相比,这项调整意味着每周限额减少 17%。计算很简单——当前生效的 50% 增幅是临时的,取而代之的 25% 增幅是永久的,而从前者转向后者会机械性地降低实际上限。这一临时增幅并非近期才出现:2026 年 7 月 18 日,同一账号曾宣布该增幅将“持续至 8 月 19 日”,但期限已过,期间没有新的沟通。因此,8 月 29 日的公告确定了最终状态:永久上限高于最初的标准方案,但低于过去几周的特殊方案。用户反响仍然褒贬不一,以至于主消息在扫描时约有 160 万次浏览,同时还附带了一份由 X 用户撰写的背景说明,重申了限额下降的数字。
| 时段 | Claude Code 每周限额 |
|---|---|
| 截至 9 月 13 日 | +50%(临时增幅,仍然有效) |
| 自 9 月 14 日起 | 永久 +25% |
| Anthropic 宣布的净影响 | 相比今天为 -17% |
Compared to today, this works out to a 17% reduction in weekly limits on Claude Code. We’re working on exciting changes that will make it feel like you’re getting more from Claude, while having more visibility and control of your usage. Can’t wait to share them.
🇨🇳 与今天相比,这意味着 Claude Code 的每周限额减少 17%。我们正在推进令人期待的改进,让用户感觉自己获得了更多 Claude,并能更清楚地了解和控制自己的用量。我们迫不及待地想与大家分享这些改进。 — @ClaudeDevs 在 X 上
当天早些时候,同一账号发布了 Claude Code 每周交付总结。这条由六条消息组成的线程,大部分内容都是此处已经随版本详细介绍过的新功能——2.1.246 中 /permissions 的“Auto mode”选项卡,/cost 中的提示词缓存行,以及 2.1.251 中前台子代理的实时跟踪;2.1.243 中 /usage 的 /loop 任务细分。另一方面,有一个方向此前从未量化:性能。CLI 不再等待沙盒(sandbox)或 MCP 服务器启动后才允许输入第一条指令,而 claude 命令会跳过自身不需要的初始化步骤。在分发方面,Linux x64 下载包缩小了 4.5 倍,约为 75 MB;原生构建每次会话的内存消耗减少 40 至 70 MB。
| 已宣布的性能指标 | 数值 |
|---|---|
| Linux x64 下载包 | 缩小 4.5 倍,约 75 MB |
| 原生构建的内存 | 每次会话减少 40 至 70 MB |
Copilot CLI 转向原生 Rust 引擎,Visual Studio 获得组织自定义代理
8 月 28 日 — GitHub 在当天晚些时候发布了 Copilot 每周总结。其标题标注的日期为 8 月 24 日——这是总结所涵盖的一周——但文章直到 28 日 20:13 UTC 才上线,因此错过了上一次扫描。文中的两个部分复述了这里已经报道过的公告:Copilot 在 Slack 和 Microsoft Teams 中的功能,以及 Customize 选项卡的正式可用;其余内容则是新信息。
最具结构性意义的变化涉及 CLI:Copilot CLI 现在运行在原生 Rust 运行时(native Rust runtime)上,而终端界面仍使用 TypeScript 编写。GitHub 宣称性能“显著提升”,但没有公布任何测量数据,因此读者只能自行判断。两个设置项 defaultMode 和 defaultPermissionMode 分别确定每个新会话所使用的运行模式和权限模式;/plugin、/mcp 和 /skills 命令获得了专用管理界面;CLI 还能够恢复未正常结束的会话,包括在一轮操作进行到一半时被中断的会话。
| 涉及界面 | 已宣布的新功能 |
|---|---|
| Copilot CLI | 原生 Rust 引擎、defaultMode 和 defaultPermissionMode、/plugin /mcp /skills 管理界面、会话恢复 |
| Copilot 应用 | 将 Azure DevOps 的 Issues 和 pull requests 转换为会话、实验性 WSL、可拆分选项卡、预览至外部浏览器 |
| JetBrains 扩展 | 针对插件、MCP 服务器、遥测和代理权限模式的企业控制 |
| VS Code 1.135 | 恢复在其他位置启动的 Copilot 或 Claude 代理会话、来自辅助模型的第二意见、统一 Agents 窗格、按模型和按轮次统计用量 |
| Visual Studio 2026 | 组织自定义代理、Low、Medium 和 High 推理力度、Manage models 视图、Git 代理审查 |
同日发布的一篇专门 changelog 文章详细介绍了 Copilot 在 Visual Studio 2026 中的 8 月更新,所有计划均可使用——Free、Student、Pro、Pro+、Max、Business 和 Enterprise。主要变化是增加了组织级自定义代理:GitHub 组织或企业的所有者可以发布供其全部仓库使用的代理,Visual Studio 会自动检测这些代理,并在选择器中显示其描述和所属组织。使用该功能必须拥有 GitHub 组织,因此个人账号无法使用。推理力度设置转由用户控制,共有三个等级;GitHub 明确将其描述为推理深度与 token 消耗之间的权衡。Manage models 视图汇总了能力、上下文窗口大小、成本信息和控制选项;Git 代理则会在打开 pull request 前审查未提交的修改或提交,适用于 GitHub 和 Azure DevOps 仓库。
🔗 Copilot 每周总结 · Visual Studio 中的 Copilot,8 月更新
GLM-5.3 入驻 Together AI,后者立即衡量其蒸馏版本的成本
8 月 29 日 —— GLM-5.3 连续第三天成为焦点。8 月 27 日,Z.ai 用两行文字宣布将公开权重;28 日,开放已经生效,Together AI 创建了一个标记为“即将推出”但尚未标价的模型页面。自 8 月 29 日 1:57 UTC 起,该页面正式上线,托管方称其为“Day 0”可用。端点 zai-org/GLM-5.3 同时支持无服务器部署和专用基础设施,Together AI 还宣布其兼容 Claude Code、OpenCode 以及其他代码代理平台。根据托管方的说法,该模型在各项基准测试中都接近 Fable 5,但每项任务的成本只有后者的一小部分。
| 服务特性 | 数值 |
|---|---|
| 输入价格 / 缓存输入价格 | $1,40 / 每百万 tokens $0,26 |
| 输出价格 | 每百万 tokens $4,40 |
| 上下文窗口 | 1 M tokens(IndexShare 架构) |
| 努力级别 | low、high、max(默认 max) |
| 声明的 SLA | 99,9 % |
同一天,Together AI 发布了 DeepSWE 系列的第六次比较,而且首次对比了同一模型家族中的两个模型:GLM-5.3 及其蒸馏版本 GLM-5.3 Flash。测试方案没有变化——DeepSWE v1.1 的 113 项任务、每种配置进行四次尝试、两个模型都使用 max 努力级别——总计完成 900 次运行(rollouts),其中完整模型 452 次,Flash 448 次。第一次尝试时,差距看起来很明显:pass@1 为 69,0%,对比 63,4%。但在 pass@4 中差距缩小到 2,6 个百分点,而价格只有十七分之一。因此,蒸馏并没有移除能力,而是降低了稳定性:完整模型四次全部成功的 48 项任务中,没有一项对 Flash 变得无法解决;Flash 仍保留了至少成功一次的 99 项任务中的 93 项。其机制在后文得到确认,这也是最有意思的结果:在不稳定任务上,对 GLM-5.3 而言,耗时最长的尝试有 61% 的概率是获胜尝试,但对 Flash 只有 46%——低于抛硬币的概率。蒸馏模型已经无法将额外的努力转化为解决方案。
| 测量指标 | GLM-5.3(max 努力级别) | GLM-5.3 Flash(max 努力级别) |
|---|---|---|
| pass@1 | 69,0 % | 63,4 % |
| pass@4 | 87,6 % | 85,0 % |
| 每次运行成本 | $3,99 | $0,24 |
| 每 $100 解决的任务数 | 17 | 264 |
| 端到端耗时 | 35 分钟 | 26 分钟 |
| 已通过的基准测试被破坏的比例 | 4,4 % | 6,9 % |
| 不稳定任务中额外努力有效的比例 | 61 % | 46 % |
唯一明显的退步体现在谨慎性上:Flash 在 6,9% 的运行中破坏了原本已经通过的基准测试,而完整模型为 4,4%。因此,Together AI 明确建议,在不经审查就接受 Flash 生成的 diff 之前,先运行完整的回归测试套件。实际操作上的结论是采用同一家族内的级联方案:先运行 Flash,只有在验证器拒绝答案时,才升级到完整模型。这种组合以每项任务 1,70 美元的成本达到 80,9% 的成功率,比单独使用 GLM-5.3 高出 12 个百分点(69,0%,每项任务 3,99 美元),价格还不到一半。有一个差异值得向读者说明:模型页面显示的 DeepSWE 分数(66,9)不同于 Together AI 在自身测试中测得的 69,0%,托管方对此予以承认,并明确表示这些数字来自其自己的运行。
🔗 Together AI 上线 GLM-5.3 · DeepSWE 上的 GLM-5.3 与 GLM-5.3 Flash 对比
开放权重模型占据了一半流量,但仅占 13% 的支出
8 月 29 日 —— 推理网关 Requesty 的负责人 Thibault Jaigu 在 Hugging Face 博客上发布了 2026 年从其自身生产流量中收集的测量数据,不包括客户自带的密钥和内部账户。核心数字是:开放权重模型所占 token 比例从 1 月的不足 5% 上升到 8 月 3 日当周全部流量的一半,但只占约 13% 的支出;计入缓存后,一个前沿闭源模型 token 的成本约为开放模型 token 的 6,4 倍。
两组数据展示了这个市场的具体面貌。kimi-k3 发布后,其原始实验室只用了 11 天就失去了该模型所提供 token 的多数份额,另外四家托管商在 72 小时内便启用了相同权重上的推理服务。而在 glm-5.2 上,六家托管商实际支付的价格相差 5,7 倍——这并非秘密折扣造成的,而是因为最便宜的服务商会缓存 94% 的输入 token,最贵的服务商则完全不缓存。这些数字来自一家描述自身产品的供应商,作者以 Requesty 负责人的身份署名,对此并不避讳。
| 网关测量指标 | 数值 |
|---|---|
| 开放权重在 token 中的占比(2026 年 1 月) | 不足 5 % |
| 开放权重在 token 中的占比(8 月 3 日当周) | 50 % |
| 开放权重在支出中的占比 | 约 13 % |
| 支出分布(Anthropic / OpenAI / Google) | 51 % / 21 % / 15 % |
| 缓存读取 / 新鲜输入 / 可见输出 | 78 % / 19 % / 不足 2 % |
| 输入与输出的比例(1 月随后 8 月) | 15x 随后 36x |
| 每次请求的平均上下文(1 月随后 8 月) | 9,6 k 随后 28 k tokens |
Perplexity Search API 占据 Artificial Analysis Search Index 的前三名
8 月 29 日 —— Perplexity 转发了 Artificial Analysis 前一天发布的排名:其 Search API 的三种上下文设置首次登上该榜单,便占据 Artificial Analysis Search Index 的前三名。medium 设置获得 80 分,比此前的领先者 Parallel(advanced)和 Brave Search(LLM context)高出 5 分,后两者均为 75 分;high 和 low 变体则分别为 79 分和 77 分。
测试方案有意将搜索组件单独分离出来:Artificial Analysis 在其开源代理框架(harness)Stirrup 中,使用同一个模型——medium 推理级别的 GPT-5.6 Luna——配合搜索和网页内容获取工具运行测试。不同测试之间,唯一变化的是搜索工具背后的供应商。Perplexity 的领先优势集中在 BrowseComp 上,而 AA-Omniscience 和 DeepSearchQA 的分数仍与其他头部供应商相近。第二个优势在于经济性:更紧凑的有效载荷让模型读取的内容更少,因此每项任务的推理成本根据变体不同为 0,028 至 0,034 美元,而下一家最便宜的供应商为 0,036 美元——这是 Artificial Analysis 迄今测得的最低价格。
| 搜索供应商(变体) | AA Search Index 分数 | 每项任务总成本 |
|---|---|---|
| Perplexity Search(medium) | 80 | 约 0,091 $ |
| Perplexity Search(high) | 79 | 约 0,091 $ |
| Perplexity Search(low) | 77 | 未公布 |
| Parallel(advanced) | 75 | 0,084 $ |
| Brave Search(LLM context) | 75 | 0,13 $ |
有两点使用上的保留意见:排名来自 Artificial Analysis,而不是 Perplexity,后者只是将其突出展示;此外,没有任何博客文章对此消息进行补充,因为该公司博客自 8 月 25 日以来没有发布新内容。
🔗 @perplexity_ai 的消息 · @ArtificialAnlys 的数据详情
Codex CLI 0.151.0:扩展可拦截 MCP 结果,远程沙盒进一步强化
8 月 29 日 —— Codex CLI 升级至 0.151.0,于 GMT+2 11:55 在 GitHub 上发布,并于当天被 ChatGPT 和 Codex 的官方更新日志收录。最具结构性的新功能涉及扩展:现在,扩展可以在 MCP 工具结果抵达模型之前检查或替换这些结果。因此,MCP 服务器与上下文之间新增了一个拦截点,可以在不触碰服务器的情况下过滤、重写或截断工具输出。此外,还加入了可配置的宽限时间,用于发现可选 MCP 服务器所暴露的工具;插件目录也可以合并每个仓库自身的配置,同时标记无效的项目 marketplace,而不会隐藏有效插件。
该版本其余内容主要集中于强化沙盒(sandbox)。命令 /cd 不再能够削弱限制——此前存在更改目录便会隐式放松防护措施的情况;过时的 Guardian 分类也不再能在权限状态改变后授权某项操作。远程沙盒的应用还与执行机器的实际情况保持一致:执行器的主目录、操作系统和路径约定都会传入上下文,包括读取拒绝规则。最后,对于让代理执行委派任务的团队,还应注意一点:嵌套子代理的 token 消耗终于会计入根目标的预算。
| 版本项目 | 数值 |
|---|---|
| 版本 | 0.151.0(稳定版) |
| GitHub 发布 | 2026 年 8 月 29 日,11:55 GMT+2 |
| 安装 | npm install -g @openai/codex@0.151.0 |
| 新功能 / 修复 / 基础工作 | 3 / 6 / 2 |
| 上一个稳定版本 | 0.150.1(8 月 27 日) |
Appshots:ChatGPT Work 和 Codex 读取所显示应用的上下文
8 月 28 日 —— OpenAI Developers 介绍了 appshots,这是一种面向 ChatGPT Work 和 Codex 的上下文捕获机制。其原理是:与其描述眼前所见,不如将当前显示中的整个应用上下文传递给助手,让它理解屏幕内容并在其上执行操作。触发方式刻意保持简单——连续按两次 Command 键(⌘ ⌘)。
该帖子详细列出了十种用途,展示出其目标范围远远超出代码:总结 Slack 线程、填写表单、利用屏幕上显示的 API 参考来添加功能、提炼 X 上一批回复的主题、找出需要回复的私信、将笔记转换为演示文稿、在 iMovie 中剪辑视频,或将打开的食谱转换为购物清单。截至扫描日期,这则公告只存在于 X 上:ChatGPT 和 Codex 的更新日志在 8 月 27 日至 29 日之间没有任何条目,唯一例外是 CLI 的 0.151.0 版本。因此,访问条件——涉及哪些套餐、支持哪些平台、是全面开放还是逐步开放——目前都没有文档说明。
Antigravity CLI 1.1.22:/model 命令接受参数,新增八项稳定性修复
8 月 27 日 —— 这是对一个此前从未扫描过的渠道进行补充。Google Antigravity 的更新日志分为四个标签页——Antigravity 2.0、Antigravity CLI、Antigravity SDK 和 Antigravity IDE——而此前的扫描只读取了第一个。CLI 标签页实际上每一至三天发布一个版本;最新的 1.1.22 带来了三项改进和八项修复。
在易用性方面,命令 /model 现在接受参数:无需打开选择器,只需输入模型的名称、slug 或标签即可直接切换到该模型;该操作还会在同一步骤中设置默认模型,并在输入时提供幽灵文本自动补全。用于设置推理努力级别的命令 /effort 也会补全已输入的文本,而不是显示一个固定示例。第三项新增功能对长时间会话很有帮助:当代理生成大量文件时,文件系统事件的突发通知会被合并为一次重新分析。
八项修复主要针对长期稳定性。其中最明显的一项修复了界面持续重绘的问题:当任务面板或子代理详情在没有进行中任务时仍保持打开,处理器会在空闲状态下持续升高。此前会直接终止运行的临时 HTTP 502 错误,现在会在逐步增加的等待时间(backoff)后自动重试。其余修复涉及 Windows、无界面 daemon(headless),以及使用 Gemini API 密钥进行身份验证时,Gemini 3.1 Pro 和 Gemini 3.5 Flash 的推理努力级别重新可选的问题。
| Antigravity 渠道 | 最新版本 | 日期 |
|---|---|---|
| Antigravity 2.0 | 2.11.0 | 2026 年 8 月 26 日 |
| Antigravity CLI | 1.1.22 | 2026 年 8 月 27 日 |
| Antigravity SDK | 0.1.15 | 2026 年 8 月 25 日 |
| Antigravity IDE | 2.5.5 | 2026 年 8 月 13 日 |
MiniMax 总结 H3 Max,并宣布视频生成速度已超越实时
8 月 29 日 — MiniMax 发布了一份异常详尽的声明,谈论 H3 Max——这是 fal Research 在对 MiniMax H3 的开放权重进行后训练后获得的视频模型。模型本身于 8 月 27 日公布;此次新内容在于,原始实验室首次明确表态,说明这项外部工作对自身意味着什么。
这则消息包含两个核心观点。第一是战略层面的:MiniMax 表示,H3 Max 让开放权重的价值以一种切实的方式呈现在自己的团队面前,并称愿意支持任何复现 fal 方法的团队。第二是技术层面的,而且走得更远:该实验室如今认为,超越实时速度的视频生成已经成为既定事实,并由此列出了一系列此前无法实现的用例——永不停歇的视频流、交互式世界、实时叙事。两小时前,MiniMax 转发了一项社区测试,很好地概括了这种转变:问题不再是一次生成需要多长时间,而是模型生成的速度能否超过 Twitch 视频流的播放速度。
They made the value of open weights feel real to our team in a way it hadn’t before. Advancing technology together has always been a core belief at MiniMax. H3 Max made that belief tangible. It showed that the frontier no longer belongs to a few, it belongs to everyone willing to build, experiment, and share what they discover.
🇨🇳 他们让开放权重的价值以一种前所未有的方式真实呈现在我们的团队面前。共同推动技术进步一直是 MiniMax 的核心信念。H3 Max 让这一信念变得切实可感。它表明,前沿不再属于少数人,而是属于任何愿意构建、实验并分享发现的人。 — @MiniMax_AI 在 X 上
简讯
- Grok 4.6 登陆 Grok.com 以及 iOS 和 Android 应用 — 在经历了以合作平台为中心的发布——GitHub Copilot、Amazon Bedrock、Gemini Enterprise Agent Platform,以及 8 月 26 日上线的 Microsoft Foundry——之后,xAI 又通过自有的大众产品界面完成了这一系列发布。推荐的三类用途:复杂问题、Agent 请求和应用创建。没有公布任何数字、基准测试或定价变化。🔗 @grok 的消息
- Midjourney 修复其 V8.2 编辑模型的图像质量 — 开放测试不到二十四小时后,该工作室发布了图像质量修复,并邀请遇到问题的用户重新进行生成。其他更新已宣布,但尚未给出时间表。🔗 @midjourney 的消息
- Gemini CLI 默认拒绝工作区信任 — 夜间版(nightly)
v0.59.0-nightly.20260829.g0bd1d4397搭载了一项唯一变更:无法建立信任的工作区将被视为不可信,已声明的 MCP 服务器会在受限模式下进行筛选。稳定频道仍为 v0.57.0,预览版为 v0.58.0-preview.0。8 月 27 日的 nightly 已经修复了 MCP 服务器 OAuth 元数据发现中的 SSRF 漏洞。🔗 版本说明 - NVIDIA 说明 Dynamo 与 SGLang、vLLM 和 TensorRT-LLM 的关系 — 这段五分钟的短视频回应了一个常见误解:Dynamo 并不取代推理引擎,而是部署在它们周围,用于将负载分配到多个 GPU 和多个节点。视频由 Vishakha Sadhwani 主讲。🔗 @NVIDIAAI 的消息
- QwenCloud 发布 Qwen Conference Hong Kong 2026 总结 — 回顾了 8 月 26 日举行的活动。活动面向 300 多家企业客户和开发者,主题演讲围绕三个入口组织平台——网站、Skills 和 CLI——并演示了一个依次完成账户创建、模型选择、推理、部署、支付和计费的 Agent。🔗 @qwen_cloud 的消息
- Luma 在旧金山举办创意之夜 — Creative Intelligent Machines Continuum 是一场计划于 9 月 1 日星期二在 tiat 举行的按需创作活动,由工作室的资深创作者进行分步演示,使用共同提示词,并提供现场指导。这项活动延续了 8 月 25 日启动的 Dream Lab Weekly 系列。🔗 @LumaLabsAI 的消息
- FAST:一种面向 Agent 漏洞上报的标准尝试 — Framework for Autonomous Severity and Triage 将自身定位为一组放入 Agent 上下文中的 Markdown 文件,无需 SDK 或 API。它区分未经证明的线索与具有可复现影响证明的漏洞,提供了一套根据漏洞赏金项目实际支付情况、而非 CVSS 计算得出的严重性决策树,并在提交前设置包含六项检查的关卡。许可证为 CC-BY 4.0。🔗 Hugging Face 上的文章
- 两个 AI 会话、同一个仓库,却对一个自修复 Agent 做出相反判断 — 这是一篇关于个人项目的工程笔记:一个被拒绝的自主自修复设计,几天后重新出现在仓库中,由使用另一款助手的另一个会话编写,且没有留下第一次决策的痕迹。该文件始终无法运行,但只是因为两个偶然的 bug;作者称之为意外带来的安全性,而非设计使然。🔗 Hugging Face 上的文章
- three.ws:一套为 Agent 提供身体、钱包和职业的开源技术栈 — 该项目由四个模块组成:在浏览器中配备工作室的 3D 生成与绑定系统、带有防护链和技能系统的 Agent 引擎、基于 x402 的 Agent 钱包(在 HTTP 之上按调用付费),以及通过一个可放置在任何网站或增强现实环境中的单一标签进行分发。🔗 Hugging Face 上的文章
这意味着什么
获取前沿模型变成了对价问题,而不再只是合同问题。 OpenAI 并不是因为欠款或技术条款而切断 Cursor 的访问,而是因为它表示无法信任新所有者会如何使用这些模型,并援引了两个被点名的先例——Twitter 和 xAI,它们都已转入 SpaceX 旗下。然而,后果最严重的论据是第二点:OpenAI 提到了即将推出的 Astra,并以此解释为何不会提供任何未来模型。OpenAI 曾于 8 月 7 日宣布,已无法排除 Astra 具备“严重级别”网络能力。换句话说,一个模型世代被认为越危险,能够访问它的名单就越短;筛选标准也不再是客户是否有偿付能力,而是其母公司的合规历史。对于那些将生产链建立在第三方供应商之上的团队来说,11 月 12 日是迁移期限。
改变价格的是上限,而不是资费。 Anthropic 没有修改任何公开资费:它将临时上调 50% 转为永久上调 25%,相较于当前价格实际下降 17%,并在下一条消息中亲自说明了这一点。另一方面,GitHub 将推理力度明确呈现为与 token 消耗之间的权衡,并开始在每轮对话中显示各模型的消耗量。Requesty 的数据解释了为什么这些上限才是真正的价格:缓存读取占全部处理 token 的 78%,可见输出不足 2%,输入与输出之比也从 1 月的 15x 上升到 8 月的 36x。一个 Agent 循环的成本不在于它写出了什么,而在于每一步都重新读取了什么——供应商开始限制的正是这一指标。
开放权重获得了规模,却失去了价值。 开放市场如今占据一半流量,却只占支出的 13%,而其中 86% 仍集中在三家供应商手中。它已经变成一个批发市场:同一个模型在不同托管商处的价格可能相差 5.7 倍,唯一原因是缓存策略不同;一个实验室甚至会在十一天内失去其自有模型所服务的大多数 token。GLM-5.3 正是当天的例子:权重于 28 日发布,29 日便由第三方托管商提供,输入价格为每百万 token 1.40 美元;紧接着,一项独立测量准确计算了其蒸馏版本的成本——pass@4 低 2.6 个百分点,但价格仅为十七分之一。当模型在各处都相同时,差异化就转移到了缓存、路由和测量上。这是基础设施的工作,而不是实验室的工作。
命令行客户端重新成为技术竞争的赛场。 Copilot CLI 在保留 TypeScript 界面的同时切换到 Rust 原生执行引擎;Claude Code 将 Linux 下载量缩减了 4.5 倍,并为每个会话节省 40 到 70 MB 内存;Antigravity CLI 移除了导致空闲时处理器占用升高的重绘;Codex CLI 防止 /cd 削弱其沙箱;Gemini CLI 则默认拒绝工作区信任。五家编辑器、同一周、同一批主题:启动时间、内存占用,以及 Agent 被允许触及的确切范围。在经历了一年模型能力比较之后,竞争也开始围绕运行这些模型的程序展开,而安全性如今在变更日志中所占的篇幅,已经不亚于功能本身。
来源
- OpenAI — 关于 SpaceX 收购 Cursor 后的决定
- Anthropic — Claude Code 每周限制
- Anthropic — Claude Code 每周总结
- GitHub — 8 月 24 日 Copilot 每周总结
- GitHub — Visual Studio 中的 Copilot,8 月更新
- Together AI — GLM-5.3 当日上线
- Together AI — DeepSWE 上的 GLM-5.3 与 GLM-5.3 Flash 对比
- Requesty — 开放权重的生产数据
- Perplexity — Search API 位居 Artificial Analysis Search Index 榜首
- OpenAI — Codex CLI 0.151.0 版本说明
- OpenAI Developers — appshots
- Google — Antigravity 更新日志
- MiniMax — 关于 H3 Max 的声明
- Google — Gemini CLI,8 月 29 日夜间版
- xAI — Grok 4.6 登陆 Grok.com、iOS 和 Android
- Midjourney — V8.2 编辑模型修复
- NVIDIA — Dynamo 与推理引擎的关系
- Luma — Creative Intelligent Machines Continuum 创意之夜
- QwenCloud — Qwen Conference Hong Kong 2026 总结