搜索

Jalapeño 交出首批实测数据,WebMCP Challenge 汇聚六个平台,Perplexity 将其代理迁移到本地

ai-powered-markdown-translator

由 gpt-5.4-mini 将文章从法语翻译成中文。

在 GitHub 上查看项目 ↗

四十八小时内共有五十一条公告,分布在九个领域:8月25日成为本周最繁忙的一天。四个动向尤为突出。OpenAI 发布了其自研推理芯片 Jalapeño 的首批实测结果,并随即联合 Chrome、Cloudflare、Shopify、Vercel、Render 和 Netlify 发起为期十天的 WebMCP 黑客松。Perplexity 将其 Computer Agent 的全部能力下放到用户本机。IBM 发布 Granite 4.2,这是其首个推理模型家族。Anthropic 则将 Claude 在聊天与 Cowork 之间的记忆统一起来,并使其可按文件逐一读取和修改。其余内容——已在 National Hurricane Center 投入使用的 WeatherNext Cyclones、Stability AI 的 B 轮融资,以及二十余项工具更新——见下文。


WebMCP:一项标准、其产品支持、内部使用以及一场启动竞赛

8月25日——OpenAI 启动 WebMCP Challenge,这是一个为期十天的黑客松,围绕一项仍处于实验阶段的开放标准展开,该标准改变了代理与 web 的交互方式。其目标问题十分具体:如今,代理若要在某个网站上完成任务,必须猜测如何在一个为人类眼睛和鼠标设计的界面里导航。WebMCP 反转了这一逻辑:网站自身暴露结构化工具,由代理直接调用。

这场竞赛并非公告中最重要的部分。更值得注意的是它所揭示的协同:Chrome(Google)、Cloudflare、Shopify、Vercel、Render 和 Netlify 都与 OpenAI 在同一标准上合作。评审团阵容也印证了这一点,包括 Sarah Drasner(Chrome 杰出工程师)、Andrew Galloni(Cloudflare 研究与创新副总裁)、Jude Gao(Vercel Next.js Core 团队)、Ilya Grigorik(Shopify 杰出工程师)、Sean Roberts(Netlify 应用 AI 副总裁)、Justin Rushing(OpenAI 浏览器代理负责人)以及 MCP-B 的创建者 Alex Nahas。

The WebMCP Challenge is here. We’ve teamed up with @ChromiumDev, @CloudflareDev, @ShopifyDevs, @vercel, @render, and @Netlify for a 10-day hackathon. Up for grabs: $35,000 in cash prizes, Codex Micros, ChatGPT Pro subscriptions, and more prizes from our supporters.

🇨🇳 WebMCP Challenge 已经启动。我们与 @ChromiumDev、@CloudflareDev、@ShopifyDevs、@vercel、@render 和 @Netlify 携手举办为期十天的黑客松。奖池包括:35,000 美元现金奖励、Codex Micro、ChatGPT Pro 订阅,以及合作伙伴提供的其他奖品。@OpenAIDevs 在 X 上

时间表很紧,评审标准也很明确:实用性、原创性、执行力、对 WebMCP 的深思熟虑的使用,以及人机体验质量。报名与提交通过 Devpost 进行。OpenAI 还发布了若干 agent-native 演示应用以启动项目——由代理驱动的 3D 建模、代理以自身身份发表评论的协作写作、个性化填字游戏生成器、将旅行笔记转化为行程的 Wandernote,以及在浏览器中通过 DuckDB-Wasm 进行数据探索。基于现有应用并为其加入 WebMCP 也是允许的。

竞赛条目公告详情
公告时长10 天
提交开放时间2026年8月25日,PT 时间 12:00
提交截止日期2026年9月3日,PT 时间 13:00
获奖者公布2026年9月23日(预计日期)
总奖金35,000 美元
每位获奖者奖品(前10名)3,000 美元、一年 ChatGPT Pro、一个 Codex Micro 键盘、周边礼品
提交平台Devpost

让这一标准能够在日常中使用的产品层组件也在同一天到来:ChatGPT 桌面应用内置浏览器以及 ChatGPT Sites 现在都能消费 WebMCP。当 ChatGPT 或 Codex 访问兼容网站时,代理会检测页面暴露的工具,并自动使用它们,而不是在界面里摸索——这要求将桌面应用更新到最新版本。闭环的另一半在生产侧:现在可以要求 Codex 创建一个兼容 WebMCP 的应用,然后直接部署到 Sites。需要注意的是,与 Chrome 的支持存在非对称性:WebMCP 在 Chrome 中仍位于实验性标志或 origin trial 之后,而 ChatGPT 浏览器则原生支持它。

第三部分也是最具启发性的部分:OpenAI 记录了自己的内部使用方式。一位公司工程师讲述了他如何不再为每项任务编写单独自动化,而是构建了 Runme——一个面向与 Codex 协作而设计的开源笔记本 Web 应用。他在其中写下一个简短目标并附上明确指令——查看之前的运行、撰写详细计划、开始前等待确认、记录执行的命令及其解释——而 Codex 则在工作过程中读取并更新该笔记本。这里有两个值得注意的架构选择。首先是持久化:笔记本保存到 Google Drive,同时 Runme 生成一个配套的 Markdown 索引 *.index.md,而 Drive 可以对其进行索引,这使代理能够将过去的执行作为运行时上下文检索。其次是能力暴露:Runme 是一个静态托管的客户端应用,如果为了暴露传统 MCP 接口而额外增加服务器,就会引入基础设施并把笔记本数据处理移出浏览器。WebMCP 允许应用直接从浏览器注册自己的工具。

🔗 WebMCP Challenge · ChatGPT 桌面版与 Sites 中的支持 · OpenAI 的 Codex、Runme 与 WebMCP


Jalapeño:OpenAI 发布其推理芯片的首批数据,并明确其 compute 战略

8月25日——OpenAI 公布了 Jalapeño 的首批实测结果,这是它亲自设计的第一款推理芯片。此次公告的意义不只在于原始性能提升,还在于它试图打破的权衡:现有推理系统通常必须在吞吐量与延迟之间取舍,而 Jalapeño 声称可以在单一架构中同时兼顾二者。

这些测量基于 InferenceX,这是 SemiAnalysis 的一个公开基准,用于模拟完整请求处理流程。测试了三个开放模型——GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T——并与商业系统对比。按瓦特而不是按芯片进行归一化的做法是明确的,也很方便:与被比较的系统相比,Jalapeño 的功耗只有一半。Jalapeño 标称功耗为 700 W,在测试负载下,实测持续功耗保持在 550 W 或以下,而 GB200 为 1,200 W,GB300 为 1,400 W。

评测模型(对比系统)每千瓦峰值吞吐量端到端延迟最低 TBT
GPT-OSS 120B(GB200,1,200 W)≈1.9x(85,448 vs 44,960)≈1.7x(1.03 s vs 1.80 s)≈2.7x(0.69 vs 1.87 ms)
DeepSeek R1 670B(GB300,1,400 W)≈1.7x(19,641 vs 11,781)≈3.6x(1.65 s vs 5.99 s)≈4.1x(1.43 vs 5.90 ms)
Kimi K2.5 1T(GB300,1,400 W)≈1.5x(18,195 vs 11,862)≈3.4x(1.56 s vs 5.31 s)≈3.8x(1.44 vs 5.48 ms)

在这三个模型的整体表现上,OpenAI 声称:与对比系统相比,在峰值吞吐下每瓦可完成 1.5 到 1.9 倍更多的 AI 工作,端到端延迟降低 1.7 到 3.6 倍,而在高度交互的负载上性能提升可达 2.1 到 4.1 倍。从技术上看,这些提升来自芯片、内存、网络、软件以及机架级系统的协同设计。推理会经历两个瓶颈不同的阶段:预填充(prefill)处理 prompt 并受计算能力限制,生成(decode)则逐个产生 token 并主要受内存带宽限制。Jalapeño 试图尽量减少数据搬移,模型状态——包括 KV cache——可以被显式放置并在本地保留,同时系统根据所处阶段激活最合适的计算、内存与网络组合。

对开发者而言,最有意思的部分是 AI 在芯片设计本身中的角色。OpenAI 表示,它将从初始设计推进到流片(tapeout)的时间压缩到九个月,通过缩短设计、测量与验证的迭代周期。该芯片被设计成既适合人类也适合 AI 进行可预测编程的目标:通过局部张量、显式通信、可预测同步来描述工作。借助 Codex 和 GPT-Astra,团队在两个月内将三种原本不在初始生产计划中的开源权重模型移植到位;在从 GPT-OSS 中选取的注意力与 mixture-of-experts 模块上,AI 生成的内核运行速度比人类专家编写的实现快 1.5 到 1.8 倍。需要保留的细微之处是:这些数字只针对所选模块,而非完整模型。时间表仍然谨慎——生产资格认证仍在进行,软件仍需成熟,OpenAI 基础设施中的部署计划在年底前完成,Gen 2 已进入深入开发阶段,而 Gen 3 也已初现轮廓。

同一天,Sarah Friar 发布了一篇文章,为这一切背后的经济逻辑作出解释。她在文中主张采用一个广泛的 compute 组合——以 Microsoft 和 NVIDIA 为基础,再加上 AWS、AMD、Broadcom、Cerebras、CoreWeave、Oracle、SB Energy 和 SoftBank——其论点兼具商业与技术两面:保留对供应商的可信选择,能够把每一类工作负载导向最优的性能/价格比,并维持价格纪律。文中还给出一个具体数字:在 Artificial Analysis Coding Agent Index 上,最高推理强度下的 GPT-5.6 Sol 创下新纪录,同时比另一个一线模型少消耗 54% 的输出 token。文章最后承认了杰文斯悖论:让智能更便宜,并不会减少其消耗,反而会扩大可盈利用途的范围。基础设施方面,Georgia 的 Project Camellia 被描述为采用封闭式水循环,并承诺接受每年一次的独立公共审计。OpenAI 还明确表示,将继续大规模部署 NVIDIA 及其他合作伙伴的加速器,既用于训练,也用于推理。

🔗 Jalapeño — 首批结果 · 充沛智能背后的完整技术栈


Perplexity 便携式计算机:一切都在本机执行,附带基准测试

8月25日 — Perplexity 推出 Portable Computer,这是其 Computer 代理的一个变体,完整运行在用户机器上。这次切换在架构层面远多于表面层面:不只是模型在本地运行,而是整条编排链路——编排器、规划器、工具路由器、调度器、持久任务队列以及本地搜索索引——都在本地运行。

今天我们在 @NVIDIA DGX Spark 上发布 Portable Computer。

Portable Computer is a fully local version of Perplexity Computer, where the entire runtime: orchestrator LLM, subagent LLM, agent harness all run on your local hardware. No cloud dependency.

🇨🇳 我们今天在 @NVIDIA DGX Spark 上发布 Portable Computer。Portable Computer 是 Perplexity Computer 的完全本地版本,其中整个运行环境——编排 LLM、子代理 LLM、代理执行框架——都运行在你的本地硬件上。没有任何云端依赖。@perplexity_ai 在 X 上

这项公告与 NVIDIA 联合发布,首批面向 DGX Spark——基于 Grace Blackwell GB10 平台、20 核 Arm CPU、NVIDIA GPU、128GB 统一内存——并宣布将扩展到配备 RTX GPU 的 PC。用户可在两个模型中任选其一,Qwen 3.8 27B 或 PPLX 27B,后者是 Perplexity 对 Qwen 模型后训练后的版本;同时,NVIDIA Nemotron 3.5 Lightning,一个开源的 30B 模型,也将加入选择器。本地处理的工作不会消耗任何积分。仍然可以升级到云端——获取最新信息、浏览器、连接的应用,或 15 个前沿模型中的一个或更多——但需要用户显式授权。Google Drive、Gmail、Slack 和 GitHub 连接器可直接从设备上工作,听写通过 NVIDIA Nemotron 3.5 ASR Model 在本地执行,音频不会离开机器,代码执行则在隔离的沙箱(sandbox)中进行。Portable Computer 仅面向拥有 DGX Spark 的 Pro 和 Max 订阅用户,首发支持 Linux,随后支持 Windows,并可通过应用一键安装。

同一天,工程团队发布了支撑这次发布的数据。其核心论点是模型与执行框架(harness)必须被一起设计:通用的执行框架假设模型具备前沿能力,能够吸收长上下文并在较长时间跨度上规划,而本地模型在这方面表现较弱。

测试基准Computer (Qwen 3.8 27B)PiHermesComputer + PPLX 27B
Local Knowledge Work Bench(53 项任务)82,6 %77,6 %74,0 %85,4 %
BrowseComp(1 266 项任务)66,7 %50,2 %43,9 %
ParseBench-100(多模态文档)65,1 %13,9 %34,6 %

在 BrowseComp 上,Computer 顺带比 Hermes 少消耗 61% 的时间和 16% 的 tokens,比 Pi 少消耗 51% 的时间和 70% 的 tokens。四项设计选择解释了这一差距:极简系统提示、按轨迹加载与卸载的模块化技能、将高频连接器(Gmail、GitHub、Outlook、Google Calendar)转为紧凑的命令行工具而不是暴露为会吞噬上下文的 MCP 服务器定义,以及始终开启且不可配置的沙箱——如果沙箱不可用,执行框架会在任何工具调用前直接停用,而不是退回到非隔离执行。Perplexity 还指出一个实用观察:Qwen 3.8 27B 宣称有 260K tokens 的窗口,但经验上在超过 100K 后就开始吃力。

Terminal Bench 2.1(89 项任务)得分每次执行的 API 成本
Qwen 3.8 27B,100% 本地59,6 %约 0
Qwen 3.8 27B + Claude Opus 5 顾问73,0 %0,415 USD
仅 Claude Opus 582,4 %0,65 USD

升级到顾问模型(advisor)的机制是这份报告中最有意思的部分:它以大约三分之二的成本,收回了接近五分之三的前沿模型差距,而最终裁决仍掌握在用户手中。每次调用前,执行框架会选择相关上下文,应用个人数据分类器,并向用户展示哪些内容会离开设备;顾问模型只返回文本,且无法直接访问文件或工具。最后,PPLX 27B 的后训练结合了拒绝式微调(rejection fine-tuning)和在 Docker 容器中执行的合成环境上的强化学习,完全不使用任何真实用户数据。技术报告以及评测基准的开源发布也已宣布。

🔗 本地执行框架基准 · Portable Computer — Perplexity 博文


Claude:聊天与 Cowork 之间共享一份记忆,且可逐文件查看

8月25日 — Anthropic 正在移除两套此前并存的记忆之间的边界。Claude 在聊天中记住的内容,如今与其在 Claude Cowork 中所拥有的记忆完全一致,反之亦然。具体来说,当 Cowork 在云端执行任务时,它会带着数月累积的上下文启动:本季度的优先事项、项目进展状态、某位协作对象的写作偏好。Anthropic 给出的例子刻意贴近日常——比如给自己的上级请求一份进度简报,而无需说明对方是谁,或者此人习惯如何接收信息。

第二项变化更为隐蔽,却改变了日常使用中的行为:记忆会在对话过程中持续更新,而不是在结束后再生成摘要。只要提到某个截止日期延期到 9 月,下一次对话就会自动考虑这一点。“记住这个”这句话仍可用于强制保存某个特定条目,记忆也可以随时暂停或重置。

在透明度方面,Anthropic 选择了可读的呈现方式,而不是黑箱:Claude 记住的一切都会以简短文件的形式显示,按主题分类,位于“设置”然后“记忆”中。每个文件都可以被阅读、修改或删除。实际好处立刻可见——只要在一个文件里改掉公司旧名称,后续所有对话就会使用正确的名称。

对敏感主题的处理,是这一产品选择中最值得注意的部分。默认情况下,Claude 不会记住与健康、来源、族裔、宗教信仰、政治观点或性别认同相关的内容。不过,Anthropic 也承认边界具有个人性,因此提供了一个可选设置来包含这些主题——这样在推荐食谱时,Claude 就能记住你对麸质的不耐受。这个设置不具有回溯效力,并且可以随时关闭。无论设置如何,有一类内容始终被排除:身份证号码、司法记录、移民身份,以及更广泛地说,任何违反可接受使用政策的内容。当 Claude 无法记录这类信息时,它会明确提示,这一设计选择强调可见的拒绝,而不是静默过滤。

记忆方面所描述的行为
范围聊天与 Claude Cowork 之间共享的单一记忆
更新时机在对话过程中更新,而不是像以前那样在结束后生成摘要
存储格式按主题分类的简短文件,可逐个读取和修改
敏感主题默认不记忆,可通过设置启用,且不具回溯效力
永久排除项身份证号码、司法记录、移民身份
Free、Pro 和 Max 方案网页端、桌面端和移动端默认启用记忆
Team 和 Enterprise 方案由管理员开启,默认对单个用户关闭,直到激活

🔗 Claude 的记忆无处不在 · @claudeai 公告


IBM 开源 Granite 4.2:其首个推理家族,以及两款 470M 的 ASR 模型

8月25日 — IBM 发布 Granite 4.2,被称为其首个明确为推理而设计的稠密、仅解码器语言模型家族。前几代主要强调效率和传统企业任务,而这一版本将推理置于核心,并使其可调:每个模型提供三种模式——thinkingnon-thinkinglow-effort——应用可根据自己愿意支付的延迟与 tokens 预算进行选择。三种尺寸(3B、8B、30B)共享相同架构与相同流水线,因此在集成侧进行切换几乎无痛。

架构仍然经典:40 头 GQA 注意力用于 8 个 KV 头,RoPE 配合 1000 万的 θ 以承载 131 072 tokens 的上下文,SwiGLU MLP,RMSNorm 归一化,在 CoreWeave 托管的 NVIDIA GB200 NVL72 集群上以 bfloat16 训练。预训练从零开始,使用约 15 万亿 token,分为五个阶段。Granite 4.2 真正的区别在于后训练:它采用一条由专门步骤组成的强化学习流水线,而非单次处理,在带有截断重要性采样的异步 GRPO 中运行,因此生成与训练这两个循环半边永远不会互相阻塞。课程依次包含三轮具备可验证奖励的 RLVR、面向指令遵循与代码的定向增强、两阶段 128K 上下文的软件工程训练、一阶段终端任务、一阶段搜索任务,然后是 RLHF 对齐。代理式强化模块仅应用于 8B 和 30B 模型,这也解释了 3B 与其大兄弟们在代理式编码方面的性能差距。

IBM 发布的基准3B Dense8B Dense30B Dense
SWE-Bench Verified47,6757,00
SWE-Bench Multilingual30,7841,89
Terminal-Bench 2.120,5629,24
τ³-bench45,7858,0662,00
AIME2578,3386,6789,17
GPQA54,8064,1466,41
LiveCodeBench v669,7173,2475,77
MMLU-Pro67,8474,0477,60
RULER 128K55,3071,4181,38

这次发布并不只限于 bfloat16 权重:随版本还提供了四种量化变体供 vLLM 使用——按通道动态 FP8、无需校准,以及通过在 2000 个 SFT 样本上校准的 GPTQ 得到的 NVFP4 和 MXFP4——此外还有供 llama.cpp 使用的十四种 GGUF 格式,从 Q2_K 到 Q8_0。支持十二种语言,包括法语,并且从第一天起就已文档化三种代理式编码执行框架:OpenCode、Pi 和 OpenHands。在数据质量方面,IBM 详细说明了一条流水线:由 GPT-OSS-120B 和 Gemma 4 作为评审,对 SFT 样本进行评分,之后再通过 SHA-256 哈希进行本地和全局去重。

同一天,IBM 还发布了 Granite Speech 5.0 Turbo CTC,这是一对英语语音识别模型,参数量为 4.7 亿,仅在训练数据和许可证上不同——标准版本采用 Apache 2.0,使用额外数据训练的版本采用 CC-BY-NC-SA-4.0。架构变化值得注意:之前的 Granite Speech 结合了声学编码器、投影层和 LLM,而这两个模型仅为编码器。该堆栈堆叠 16 个 Conformer 块,在第 8 个块输出后应用自条件机制,用分块(chunkwise)注意力替代点积注意力以避免平方级扩展,并直接优化 CTC 损失。真正的新意在于 token 速率:通过下采样操作,流程将从 log-Mel 频谱图输出的每秒 100 帧降到每秒 12.5 帧,这也解释了名称中的 “Turbo”。结果被报告在 OpenASR Leaderboard 和 FFASR Leaderboard 上,针对远场场景提供速度/准确率的 Pareto 图,而不是单一分数;同时还展示了一个通过 WebGPU 在浏览器中运行的连续识别演示,仅限 Chrome 和 Edge。

🔗 Granite 4.2 — 技术路线 · Granite Speech 5.0 Turbo CTC


WeatherNext Cyclones,首个被美国国家飓风中心实时采用的 AI 模型

8 月 25 日 — Google AI 详细介绍了 WeatherNext Cyclones,这是一个源自 Google DeepMind 和 Google Research 的热带气旋预测模型。这则公告的重要性,与其说在于原始性能,不如说在于它体现了天气 AI 从实验室走向运营实战的转变。

所攻克的问题具有结构性。到目前为止,追踪气旋一直意味着一种取舍:运行在超级计算机上的物理模型能够很好地捕捉席卷全球的大尺度大气结构,但要理解决定风暴强度的局地、强烈物理过程,就必须切换到完全不同的区域模型。WeatherNext Cyclones 通过一次性预测路径、强度和规模,消除了这种来回切换。

官方宣称的提升是比前一代系统多出整整一天的提前量。Google 用一个很直观的方式表述这种比较:如今 3 天预报的精度,已经达到过去 2 天预报的水平;历史上要实现这样的进步,通常需要十年的方法论演进。第二个贡献在于概率预测:模型速度足够快,每个风暴最多可生成 1000 次模拟,从而用一组情景取代单一路径“最可能”预测。这让“快速增强”更容易被识别,其定义是 24 小时内最大持续风速至少增加 30 节。今年,WeatherLab 向预报员提供了每个风暴 1000 份概率预测。

最重要的还是实际部署。在 2025 年飓风季期间,WeatherNext Cyclones 在美国国家飓风中心——这是该机构首次在实时运营中使用 AI 模型——接受了检验。气象学家借助它对飓风 Melissa 在牙买加以 5 级强度登陆做出预报,为当地当局争取了额外的准备时间。相关论文已发表于 Nature,Google 还宣布将模型代码和权重以开源形式发布到 GitHub。

模型方面WeatherNext Cyclones 的贡献
预测要素一次性预测路径、强度和规模
提前量提升提前 1 天;3 天预报 = 旧 2 天预报的精度
每个风暴的模拟次数最多 1,000
运营部署美国国家飓风中心,2025 年飓风季
已披露用例牙买加的飓风 Melissa 5 级登陆
增强阈值24 小时内最大持续风速增加超过 30 节
上线方式WeatherLab;代码和权重在 GitHub 上开源

🔗 @GoogleAI 公告 · Google DeepMind 博文


Stability AI 完成 7600 万美元 B 轮融资,EA、Sony Music、Universal 和 Warner 参投

8 月 25 日 — Stability AI 宣布完成 B 轮融资:新增 7600 万美元资金,自 Prem Akkaraju 于 2024 年 6 月接管公司以来,总融资额达到 2.32 亿美元,其中包括两轮股权融资和可转换债券。这个金额在行业尺度上并不算大,但这轮投资方的构成才是真正的重点。

四家娱乐业巨头进入股东行列:负责游戏业务的 Electronic Arts,以及音乐领域的 Sony Music Group、Universal Music Group 和 Warner Music Group。三大唱片公司如今成了同一家实验室的股东。另有 AMD Ventures 和 Pacific Alliance Ventures 加入。这些投资者并非凭空而来:EA、Universal 和 Warner 早在 2025 年秋季就已是 Stability AI 的战略合作伙伴。因此,这轮融资实际上把现有商业协议转化为了股权持有。

另一个信号体现在金融投资者的持续支持上。Coatue、Greycroft、Kadmos Capital、Sean Parker 和 Eric Schmidt 在新管理层下连续第二轮继续加码——考虑到 Stability AI 在 2023 和 2024 年经历的动荡,这本身就是一种确认。Coatue 联合创始人 Thomas Laffont 也加入了董事会,董事会中已有 James Cameron、Sean Parker、Dana Settle 和 Prem Akkaraju。

This unmatched group of investors is an affirmation of our vision where generative AI empowers every producer, musician, and storyteller. Stability is unique in the AI field because we are creative people making tools for creatives.

🇨🇳 这组独一无二的投资者证明了我们的愿景:一种赋能每一位制作人、音乐人和讲故事者的生成式 AI。Stability 在 AI 领域是独特的,因为我们是创造工具的创作者。 — Stability AI 首席执行官 Prem Akkaraju,8 月 25 日公告

公司明确采用的是一种小众实验室战略:不做通用基础模型,而是为创意专业人士打造工具,并且与权利方合作,而不是对立。Stable Audio 3.0 正是这一方向的体现——这是一个使用开放权重、在完全获得授权的数据上训练的模型家族,并于 8 月 18 日通过面向音频工作站的插件进行了扩展。此次融资将用于支持产品线、应用研究以及专业服务部门。

🔗 @StabilityAI 公告


ChatGPT 的企业侧:Admin 插件、多浏览器扩展,以及 100 美元的 Premium 席位

8 月 25 日 — OpenAI 的三项公告都指向同一个群体:那些在规模化部署 ChatGPT 和 Codex 的组织。

其中最重要的是面向 ChatGPT Work 和 Codex 的 Admin 插件。它把原本需要在分析面板、设置界面和报告之间来回切换的内容,整合进一次对话中。覆盖范围包括日常任务:理解采用情况和额度消耗、识别接近限制的成员或组别、管理加入和离开、检查实际权限并诊断访问问题、调整使用上限,以及把支出申请与实际消耗对照后进行裁定。最有意思的部分是无需编写代码即可实现自动化:待处理的使用申请可以路由到 Slack 或 Microsoft Teams,由验证者在他们已经在使用的工具里审批;当访问某项功能的申请满足预定义条件时,可以自动授予权限,例外情况则转交人工处理。安全方面的关键点是:该插件用户现有角色和权限内运行,不会扩大任何访问权限;每条指令都会映射为受支持的读写操作,并返回结构化结果。OpenAI 还举了自己的例子——Slack 中的一个 ChatGPT Work 代理正在处理内部 IT 申请,已部署的工作流解决了大约 45% 的工单量;在支持量几乎翻倍后,积压被清空。

第二项公告是 ChatGPT 浏览器扩展不再局限于 Chrome,而是支持 Microsoft Edge、Brave、Opera 和 Vivaldi。对于因为隐私偏好或企业限制而使用替代浏览器的人来说,这一变化很重要。公告强调了两种用途:在 ChatGPT Desktop 中通过 @ tab 把打开的标签页上下文带入某个任务,让 Codex 基于已经显示的文档或工单工作;以及让代理控制浏览器执行具体的网页任务,其中取消订阅是给出的示例之一。

第三项公告更简短:100 美元的 Premium 席位加入 ChatGPT Business,面向小型企业和初创公司,主打一个可根据团队规模灵活扩展的方案。该公告是在 X 上发布的,没有详细博客文章,席位的具体内容也未在消息中说明。

🔗 Admin 插件 · 多浏览器扩展 · ChatGPT Business Premium 席位


NVIDIA:Gamescom 上的 RTX Spark,以及将 MiniMax H3 的延迟缩短 27 倍的 SANA

8 月 25 日 — NVIDIA 借本周在科隆举行的 Gamescom 进一步扩充 RTX Spark 目录,这是其预计于今年秋季推出的 Windows PC 平台。Electronic Arts、Embark Studios 和 Ubisoft 加入了 KRAFTON、NetEase、Riot Games 和 XBOX 的阵营,后者早在 5 月 COMPUTEX 上就已表态。被点名的作品覆盖了不同技术需求:EA 方面有 EA SPORTS F1 25 和 Apex Legends,Ubisoft 方面有 Anno 117: Pax Romana,Embark Studios 方面有 ARC Raiders 和 THE FINALS。

最具体的进展与反作弊有关。能运行游戏并不等于能真正落地:大型在线游戏依赖必须针对每个平台移植的反作弊系统,否则多人模式就会无法游玩。NVIDIA 宣布正与 EA 合作,让 EA Javelin Anticheat 原生运行在 RTX Spark 上——这类基础设施细节往往决定一款新 PC 平台能否真正被采用。在渲染方面,DLSS 4.5 Ray Reconstruction 现已可用,配备第二代 transformer 模型,用经过超级计算机训练的网络取代传统降噪器。path tracing 将登陆 CONTROL Resonant 和 007 First Light,Gears of War: E-Day 集成 RTX Mega Geometry,而 NVIDIA ACE 技术则宣布将在 Aniimo 中于 2027 年初推出。

同一公司的另一面在 8 月 24 日 则更偏技术。MiniMax 转述了 NVIDIA SANA 团队在应用于其 H3 视频模型的 Sol Engine 上取得的结果:在单个 GB200 上生成 10 秒、768p 的视频,耗时从 414 秒降至 14.93 秒,加速比达到 27.7 倍。该方法并非依靠核函数优化,而是把生成拆成两个阶段——先由 H3 用 4 步生成低分辨率草稿,再由 LTX 通过 Sol-Attn 用 3 步在目标分辨率上进行精炼。总共 7 个步骤。第二个杠杆是用轻量化解码器 TAEH3 和 TAEHV 替换高成本的 VAE 解码,同时保持潜变量在精炼阶段稳定。

MiniMax H3 测量项测量值
测量负载10 秒、768p 视频,单个 GB200
之前延迟414 秒
之后延迟14.93 秒
加速倍数27.7x
生成步骤4(低分辨率 H3 草稿)+ 3(LTX)
替换的解码器用 TAEH3 和 TAEHV 替代 VAE 解码
预计节点吞吐量每月 378,000 条视频,GPU 裕量超过 97%

预计吞吐量是 MiniMax 的估算值,不是生产实测,因此应当这样理解。但方向很明确:当生成 10 秒视频只需约 15 秒时,高保真视频生成就从异步批处理渲染,走向了近乎交互式的基础设施。

🔗 NVIDIA 在 Gamescom · H3 上的 SANA 与 Sol Engine


中国开源模型成为研究基准,Qwen3.8-27B 跻身 Code Arena 前 10

8 月 25 日 — Qwen 同一天转述了两项结果,而第二项让第一项更有意义。

第一项是排名。Qwen3.8-27B 进入评估模型网页界面生成能力的 Code Arena: WebDev 排行榜,以 1595 分位列总榜第 9。它是前 10 中唯一属于该参数规模档位的模型,而且距离体量大得多的 Qwen3.8-Max 也只差 6 个名次。Arena 指出,它重新划定了排行榜的帕累托边界,并给出一个醒目的参照:体量相近但于 4 月发布的 Gemma 4-31B 排在第 80 位。

被评估模型Code Arena: WebDev 名次得分排名备注
GLM-5.3 (Max)总榜第 815978 月 20 日记录,开源模型中第 2
Qwen3.8-27B总榜第 91595前 10 中唯一同规模模型
Qwen3.8-Max比 27B 前 6 名n.c.同一系列中体量大得多的模型
Gemma 4-31B总榜第 80n.c.于 2026 年 4 月发布

第二项结果是一项使用情况测量。Ai2 的 Olmo 项目联合负责人 Nathan Lambert 让 Codex 梳理了自 ChatGPT 发布以来、发表于 AI 和机器学习领域的 50 万篇 arXiv 文章,以识别研究中实际使用的开源模型。变化体现在两个数字上:2024 年,约 30% 的文章提到美国开源模型,而中国模型只有 10%;如今,约 40% 的文章引用中国开源 LLM,而美国 LLM 只有 25% 到 30%。

模型家族引用 LLM 的文章占比
OpenAI(闭源模型)约 37%
Qwen约 33%
Gemini、Claude10% 到 15%
Gemma、Mistral5% 到 10%
Olmo约 1%

从细节看,在所有引用 LLM 的文章中,Qwen 占到了三分之一。Llama 的峰值出现在 2025 年 4 月左右,达到 30%,正好是 Llama 4 发布的时候,此后开始回落。Lambert 也明确指出了一个重要限制:论文发表会落后于模型发布,因为研究本身需要时间——这些数字描述的是正在进行中的工作状态,而不是当下偏好。与开源和闭源的对抗不同,另一个更宏观的趋势也很清楚:提及 LLM 的 AI 文章比例从 2023 年 1 月的 10.43% 上升到 2026 年的 50% 以上。

🔗 Qwen3.8-27B 在 Code Arena · Qwen 转述的 arXiv 分析 · @natolambert 分析


Claude Code 升级到 2.1.245,而 Claude 网页端渲染变得快 4 倍顺滑

窗口里发布了两个 Claude Code 版本,它们的内容明显面向组织级部署。CHANGELOG 本身没有日期,但 Git 历史给出了时间:2.1.243 出现在 8 月 24 日 23:40 UTC 的提交中,2.1.245 出现在 8 月 25 日 05:13 UTC 的提交中。

新增设置相关版本实际价值
modelPricing2.1.243/cost、状态栏和遥测中的合同价目表
modelPicker2.1.243/model 提供有序且带标签的模型列表
promptCacheTtl / subagentPromptCacheTtl2.1.243会话 1 小时提示缓存,子代理 5 分钟提示缓存
/usage 中的 Ventilation Loops2.1.243找出失控的 /loop 任务
通过 Console 无密钥登录2.1.243禁止 API 密钥的组织
glibc 2.44 修复2.1.245Arch Linux、CachyOS 和 Fedora Rawhide 上的启动崩溃

最关键的设置是 modelPricing:到现在为止,显示的成本都是按公开价计算的,如今组织可以按模型注入自己的合同价和折扣系数,这让这些数字可以直接用于内部转付账单。promptCacheTtlsubagentPromptCacheTtl 这对设置处理的是 API key 用户的一个现实经济折中:主会话保留 1 小时缓存,因为上下文相对稳定;而子代理只保留 5 分钟,因为它们的上下文更易变化。修复方面,非交互模式下的远程 MCP 服务器在断开后不再卡死,/resume 不再只覆盖最近 50 个会话,而静默超过 10 分钟的会话现在会在约 3 分钟后过期,然后重试并给出明确错误。

8 月 24 日,Anthropic 另外宣布重写了在 Claude 网页端和桌面端显示生成中回复的渲染引擎。这个思路在界面渲染里很经典:只处理仍在变化的部分,而不是每来一个新片段就重绘整段回复。对于长回复,这种差异是结构性的——渲染成本不再随已经显示的文本长度持续增长。公布的收益也很一致:流畅度约提升 4 倍,在低配笔记本上卡顿减少 9 倍,最差的界面冻结时间缩短 4.5 倍,并且在 120 Hz 的 MacBook 上从头到尾都能保持 120 fps。值得注意的是目标用户:受益最大的是配置较弱的机器。

🔗 Claude Code CHANGELOG · 4 倍更顺滑的渲染,@ClaudeDevs


代码代理正在工业化:Warp 发布 factories 格式,Rohlik 让代理编写 90% 的代码

8 月 24 日 晚些时候——Warp 公开了 Warp Factories 的内部机制,这是它在 8 月 18 日宣布的云端代理平台:所采用的配置格式,以及提前访问权限的开放。起点很明确——Warp 出于质量和成本的考虑,把自家的代理从本地机器迁出,因此需要把环境、运行支架和安全权限都像版本化代码一样描述出来。

配置项采用值
定义文件factory.yaml, schemaVersion: v1alpha1
主要键name, repositories (owner / name), agentDefaults.model
代理定义带有 agentType (FOREMAN, REVIEW…) 和 modelagents/<nom>/agent.md
触发器automations/<nom>/automation.mdagenttriggers(提供方、事件)
可用接口CLI (warp agent run-cloud)、REST API、TypeScript SDK、MCP 服务器
提前访问为符合条件的客户提供最高 10,000 美元的免费使用额度

这种拆分很有意思:代理并不是写在单一的 YAML 里,而是放在专门的 Markdown 文件中,因此一个代理的定义就变成了可读、可 diff 的文档。Warp 还把这套做法用在自己身上——它内部的 factory 叫“wilson”,覆盖了 warp-serverwarp-terraform 等仓库,声明自己的密钥和 MCP 服务器,并按角色(code-review、foreman、implementation、spec、triage)为代理分组,总共 34 行。访问申请页上给出的数据更像是无法在外部验证的商业论据:每天 20 万次代理执行、超过 30% 的 pull request 无需修改即可合并、每个 pull request 的成本降低 20%。

8 月 25 日,Cognition 则发布了一份比前一篇更有文档支撑的案例研究。Rohlik Group 是一家诞生于捷克共和国、覆盖五个国家、已经盈利的在线食品零售商;去年营收超过 13 亿美元;它能在不到 1 小时内或在 15 分钟时段内完成 1.7 万种商品的每周补货配送。文章最核心的数字是:如今大约 90% 的代码由代理生成,工程组织把自己描述为“agent-mostly”。

这并不是接上一个工具就能得到的结果。Rohlik 表示,他们一年前就开始尝试,第一次 Devin 体验被认为有 bug。真正改变局面的,是客户端这边打好的基础:50 多个内部和外部 MCP 集成,并且遵循一个原则——任何新工具从第一天起就必须能被代理访问;Snowflake 数据仓库之上的语义层;以及一个知识库,向代理提供本来会传给新同事的上下文。工作从它诞生的地方流入 Devin:Slack 里关于 bug 的对话,或者 Linear 里的规格文档,一直到 pull request。其声称的结果——自 11 月以来工程吞吐量翻倍、AutoStore 机器人集成在 8 个月内交付而行业通常需要 2 到 3 年、原型开发从 1 个月缩短到 1 天——仍然来自供应商发布的客户页面。更有说服力的效果在别处:最优秀的工程师现在有 80% 的时间都在审代码,而 Rohlik 对 Devin 的使用中约 30% 是业务用户做的数据分析。

🔗 factory.yaml 格式,@warpdotdev · Rohlik 案例研究,@cognition · Devin 客户页面


GitHub:围绕代理式工作流的四个实战练习,以及 Customize 选项卡正式可用

8 月 25 日 — GitHub 在其学习平台 GitHub Skills 上线了 4 个新练习。角度非常明确:与其文档化这一年出现的代理功能,不如直接在演示仓库里动手实践,并在 pull request 流程中逐步给出指引。

已发布练习练习目标
Agent Orchestration Build Your AI Dream TeamCopilot CLI 中的自定义代理:规划、设计、构建、验证、交付
Agentic Workflows that Read the Roomgh aw 扩展、Markdown 代理工作流、通过 pull request 提交的更改
Idea to Merge with the Copilot App从一次会话到一个已合并的 pull request,全程在 GitHub Copilot 应用中完成
Ship with Quality自动化质量信号、测试覆盖率、对 pull request 强制执行的检查

四个练习里最值得注意的是第一个:这是 GitHub 首次在自己的 CLI 中提供多代理编排的引导流程,而这个主题此前只用文字说明。第二个引入了 gh aw 扩展,其中有一个对安全很重要的点——工作流提出的修改是通过 pull request 传递的,而不是直接应用,这样仍然保留了一个人工审核点。

同一天,GitHub Copilot 应用的 Customize 选项卡正式可用。它的作用是把最近几个月分别引入的 4 种扩展机制汇总到一个界面里:MCP 服务器、插件、skills 和 canvases。Featured 视图会从每个类别中挑选编辑精选内容,适合那种“知道自己想做什么,但不知道该用哪种扩展”的用户;MCP 服务器也获得了更清晰的导航,按受欢迎程度突出选项,并提供按类别浏览的路径。Changelog 还用一个具体案例说明 canvases 的价值:一个 Azure DevOps canvas 可以用来整理 issues、优先级排序 backlog、分配跟进事项,然后把某个任务交给 Copilot 去调查、实现或准备评审。

🔗 四个 GitHub Skills 练习 · Customize 选项卡正式可用


Google 开发者工具链:Gemini CLI 0.57.0 与 Antigravity 2.10.0

8 月 25 日 — Google 发布了稳定版 Gemini CLI 0.57.0,而在它前 15 分钟,0.58.0 预览版已经先行推出。这个版本的内容与其说是在讲新功能,不如说是在展示 Google 如何维护自己的工具:在 changelog 的 24 条条目中,13 条以前缀 [SSR Agent] Issue Fix 开头,并指向一系列往往很老的 issue 编号,从 19239 到 28518。这些修复处理的是积压在 backlog 里的痛点——终端界面出现无限期卡住,于是加上了超时;个人账户却收到误导性的管理错误信息;自动补全建议后缺少空格;外部编辑器输出后终端渲染没有刷新。换句话说,Google 正在让一个代理去处理自己的技术债,而结果直接进入了稳定版。

发布版本时间日期(UTC)发布通道重点
v0.57.08 月 25 日, 18:37:14稳定版13 个 [SSR Agent] 修复、eval 验证、上下文重试
v0.58.0-preview.08 月 25 日, 18:22:01预览版macOS Seatbelt 配置文件中的 Docker 隔离、安全检查器

功能层面,重点放在评估上,增加了一个 eval 验证命令和一个将失败摘要整合进去的工具调用格式化器。可靠性也在提升:容量错误会触发考虑上下文的静默重试,而多轮请求被取消时会完整回滚,而不是留下部分状态。对于想找版本说明的人来说要注意,仓库里的 docs/changelogs/index.md 文件并没有更新到 8 月 6 日的 v0.54.0 之后。

在 2.9.1 和 Remote Control 之后四天,Google Antigravity 于 8 月 24 日升级到 2.10.0,补上了两个此前必须跳出工具才能做的能力:内置终端和原生 Git 版本控制,两者都直接放在侧边栏里。这个组合与产品方向是一致的——Antigravity 试图成为一个用于操控代理而不是逐行写代码的环境,但前提是你得能在不切换窗口的情况下运行命令并查看 diff。此次更新还扩大了可提交给代理的内容以及你能看到的工作结果:音频文件加入了可接受的附件,图片上的交互式评论允许你在视觉内容上做标注以引导代理,MCP 工具执行的增强预览则让工具服务器实际做了什么变得清晰可见。Google 把这个版本概括为 13 项改进和 8 项修复,并采用分阶段推送。

🔗 Gemini CLI v0.57.0 · Antigravity Changelog


Anthropic 拿出 500 万美元资助独立的福祉评估

8 月 25 日 — Anthropic 开设了一项 500 万美元的资助计划,用于支持独立研究 AI 对用户福祉的影响。入选者将获得直接资助、模型访问权限和技术支持,但研究保持完全独立:他们的评估以开源形式发布,并可被整个行业复用。申请开放至 9 月 21 日,而被选中提交完整提案的候选人会在 10 月 5 日 前收到通知。

技术说明解释了为什么这一领域难以用常规评估方法处理。对于大多数模型行为,只需检查一个孤立回复,就能判断它是否准确且得体。但福祉评估需要上下文:处于痛苦中的用户未必一开始就提到自伤想法;而对饮食平衡的建议在某些情况下看似合理,如果对方有进食障碍史,就可能变得危险。Safeguards 团队同时发布了 5 条严谨性标准:清楚说明测量对象;让临床医生和领域专家参与设计;同时测试预防措施和伤害——也就是说,既评估过度迎合的风险,也评估过度拒绝的风险——通过多轮场景反映真实使用情况,并用真实专家来验证自动校正器。第三条标准,也就是对“过度顺从”和“过度拒绝”的对称考量,正是这套方法区别于简单加严护栏的地方。

🔗 福祉研究资助


量化感知修复:一个 4 位模型,竟然超过了它的全精度原版

8月25日 — 让一个大模型可部署的标准流程通常分三步:压缩架构、量化结果,然后修复质量损失。最后一步的主流方案是 QAT(quantization-aware training),它会插入伪量化操作并重新训练;另一种替代方案是 QAD,它从压缩后的全精度模型进行蒸馏。无论哪种方式,学生模型最多也只能追上被压缩的教师模型,因此继承了压缩所设下的上限。

Multiverse Computing 提出一个只改一行的变化:直接从原始模型,也就是压缩之前的模型进行蒸馏。于是,量化不再只是一个有损的后处理步骤,而变成了一个完整的训练阶段。结果出人意料——将 GPT-OSS 120B 压缩到 60B 后再量化为 MXFP4,这种方法得到的 4 位模型在 9 个基准中的 7 个上,能与其自身的 bfloat16 源模型持平甚至超越,其中提升最明显的地方正是压缩打击最严重的场景:在长上下文推理的 AA-LCR 上提高 7.4 分,在 AIME 2025 上提高 5.6 分。仅有的两个回落,分别出现在 MMLU-Pro 和 SciCode 上,也都低于 1.5 分。

与相同流水线下的 QAT 直接比较,或许是实践中最有用的结果。对 GPT-OSS 9B 进行 MXFP4 量化时,这两种方法都达到相近峰值,分别是 54.9 和 54.6,但代价并不相同:QAH 只需大约 100 步就能达到并稳定维持,而 QAT 则要花大约 700 步才到达该水平,之后还会退化。实际后果是部署风险不同——QAT 的检查点需要仔细监控早停,而 QAH 的检查点则没那么需要。

🔗 Quantization-Aware Healing


Gradio 集成 gr.Workflow,一个图式 AI 流水线构建器

8月25日 — Hugging Face 发布了一份指南,介绍 gr.Workflow,这是一个如今已集成进 Gradio 的原语。起点很简单:大多数有趣的 AI 应用并不是一次模型调用,而是一串步骤——先生成图片,再抠背景,再提取旁白,最后让 LLM 写标题。到目前为止,要把这串流程连起来并优雅地暴露出去,既要写逻辑又要写界面。gr.Workflow 把两者合二为一:把步骤描述成一个带类型节点的图,而这个图本身就成了界面。

它对开发者的意义不止于视觉演示。图中的每个输出都会自动获得自己的 REST 入口:示例中的媒体工作室串联了 FLUX 生成、抠图、语音合成和 LLM,暴露出三条独立路由(/sticker/voiceover/episode_title),可以直接从代码中调用而无需经过界面。节点可以与四个世界对接——Hugging Face 的 Inference Providers 托管模型、被复用为积木的其他公开 Gradio Spaces、Hub 数据集中的某一行,以及任意 Python 代码。最后这一点打开了最多可能性:一个用 @spaces.GPU 装饰的 operator 节点在执行期间会预留一块 ZeroGPU,这样就能运行自己的权重。指南还配有 5 个真正部署在 Spaces 上的应用,包括一个数据集分析器和一个使用 Lightricks/LTX-Video 让静态图像动起来的演示。

🔗 gr.Workflow 指南


ElevenLabs 推出 Composer,一个按章节编辑歌曲的工具

8月25日 — ElevenLabs 发布 Composer,这是一款按章节工作的歌曲编辑器。它打破了音乐模型主流的生成模式:不是一次性生成整首歌、遇到某段不合适就全部重来,而是允许单独重做某个主歌、副歌或过门。它提供四种起点——你自己的歌词、你带来的现成音轨、空白页,或者一个简单的 prompt——随后歌曲通过逐步修改完成。

这是 ElevenLabs 在 Eleven Music 之后向音乐领域迈出的第二步,而且它出现在公司异常忙碌的一周里,因为 CLI v1 前一天刚刚发布。这个定位与音频行业其他玩家的方向一致:Suno 在 8 月 13 日推出了 Studio 2.0,Pika 在 8 月 18 日发布了 Pika Music 系列,Stability AI 也在同一天交付了面向音频工作站的插件。对歌曲结构的精细控制,而不是单纯的生成质量,已经成为竞争核心。不过也有一个保留意见:这次公告没有附带博客文章,而且目前还没有关于 Composer 可用套餐、导出格式或 API 访问的信息。

🔗 Composer 公告,@ElevenLabs


LiveAvatar 取消所有并发限制,并将价格降至每分钟 0.01 美元

8月25日 — HeyGen 宣布取消其实时头像产品 LiveAvatar 的并发限制。措辞强调了变化的性质:不是提高限制,而是直接取消。无论是一个会话还是一万个会话,都可通过同一个 API 运行,无需事先协商配额。公告还附带两个参数——渲染仍保持 1080p 全身效果,而价格在规模上降至每分钟 0.01 美元。

这个价格水平改变了可行场景的性质:按每分钟一美分计算,实时头像足以用于大规模客户支持、培训或交互式信息亭,这些场景里单次成本过去往往决定了方案能否落地。取消并发上限是技术上最有意思的部分。实时头像平台通常会对同时会话数设上限,因为每个会话都持续占用 GPU;要解除这个上限,要么依赖充足的容量余量,要么依赖模型效率提升。HeyGen 发布了一篇说明其做法的文章,但在扫描时,技术细节尚未公开。

🔗 LiveAvatar 无限制并发


Grok 4.6 进入 OpenCode Go

8月25日 — Grok 4.6 加入 OpenCode Go,这是开源代码代理 OpenCode 的订阅方案。公告由 OpenCode 在当天晚些时候发布,@grok 账户半小时后转发。对开发者最直接的影响是额度:Go 套餐用户每 5 小时可发起 169 次请求。这是一个滚动上限,不是按月计数,因此很适合辅助编码会话中典型的突发式使用。

这次集成是 Grok 4.6 向第三方工具持续开放的一部分:该模型于 8 月 14 日进入 GitHub Copilot,8 月 19 日登陆 Amazon Bedrock,8 月 21 日又上线 Google 的 Gemini Enterprise Agent Platform。xAI 还早在 2026 年 5 月就把 OpenCode 接入了自己的 SuperGrok 和 X Premium 订阅——因此今天带来的并不是对 OpenCode 本身的访问,而是 4.6 模型进入 Go 套餐,并且附带包含在内的额度,而不是要求用户自己单独提供 xAI 订阅。

🔗 @grok 转发 · @opencode 公告


Cohere 发布一份关于 2026 年主权 AI 采用情况的 IDC 研究

8月25日 — Cohere 发布了一份由 IDC 委托撰写的 InfoBrief,内容涉及受监管行业对主权 AI 的采用情况。该研究在 2026 年 4 月至 5 月期间,采访了来自加拿大、美国、英国和德国、年收入超过 10 亿美元企业的 500 多位资深决策者。

最值得注意的结果与其说是采用,不如说是概念混乱。三分之一的高管难以用自己的话解释主权 AI,只有 13% 表示对这一主题非常熟悉。在能够给出定义的人中,52% 将其表述为本地或国家层面的控制,35% 提到数字独立性。这种差距也贯穿于组织架构:IT 负责人对该主题的熟悉度是业务负责人的两倍。

受访行业数据泄露与合规是首要担忧竞争优势是驱动力
金融服务82 %21 %
工业77 %32 %
电信75 %37 %
医疗74 %28 %
能源70 %21 %

在动机方面,结论清晰且具有普遍性:数据泄露、隐私和合规在所有受访行业中都位居首位。竞争优势则是次级但正在上升的驱动因素,在加拿大(35%)和美国(28%)被提及得更多,而在德国(23%)和英国(18%)相对较少。该研究当然也服务于 Cohere 的定位,其代理平台 North 运行在客户选择的基础设施和司法辖区内;但这些数字来自明确标注的来源。IDC 还预测,到 2028 年,跨国公司的 CIO 将把在模块化主权云环境和数据本地化方面的投资提高 65%。

🔗 Sovereign AI Adoption 2026 状况


简讯

  • Bain & Company 加入 Claude Partner Network — 该咨询公司成为 Global Premier 合作伙伴,并围绕向其 19,000 名员工部署 Claude 展开合作;试点阶段就有超过 7,000 名活跃用户,且超过三分之二的参与者采用了 Claude for Excel。🔗 Anthropic 博文
  • Amp 解释 orb 是什么 — Thorsten Ball 撰文回应关于名称的混淆:orb 是一种远程代理,可通过网页、手机或 CLI 控制。关于成本有两点补充值得注意:无限睡眠不计费,同时并发 orb 数量也没有上限。🔗 Amp 笔记
  • Together AI 开放 Qwen3.8 27B 的微调和专用推理 — 该模型现已同时支持使用自有数据进行微调,以及在专用硬件上进行 Dedicated Model Inference。🔗 @togethercompute 推文
  • FINAL-Bench 开放 FINCHAL,一个面向代理的金融预测竞赛 — 奖金 2,000 美元,要求提交的是仓位而不是预测,并公布了一个 luck ceiling,用于区分能力与运气。🔗 FINAL-Bench 博文
  • Au-Zone 发布 EdgeFirst Model Zoo — 在真实嵌入式硅片上测得的四个 YOLO 检测与分割家族,每个已发布的数值都链接到产生它的验证会话,用以对抗厂商宣称的 TOPS 带来的不透明性。🔗 EdgeFirst 博文
  • Gemini for macOS 的智能听写 — 可在桌面的任意窗口中听写,自动去除犹豫词,并处理句中修正;语音还可用于总结文件和改写文本。🔗 blog.google 指南
  • 推送规则接受路径例外 — 在公开预览中,Restrict file paths 和 Restrict file size 规则可以排除特定路径,例如除了 **/gradle/wrapper/*.jar 之外阻止所有 JAR。🔗 GitHub 更新日志
  • 从安全公告中屏蔽用户 — 可以通过公共仓库中描述或评论右上角的三点菜单完成此操作,无需进入设置;公告本身保持不变。🔗 GitHub 更新日志
  • Manus 提示数据恢复需求旺盛 — 未能成功完成的恢复需要在当天稍后重新尝试;明确要求保持备份包完整且不变。🔗 @ManusAI 推文
  • Kling 发布其 MCP 服务器的三份指南 — 将 Kling 连接到兼容 MCP 的助手,以重放已验证的创意配置并批量生成变体;三份教程中的两份都以 Claude Code 作为客户端。🔗 Kling 博客
  • Wan 3.0 登陆 Runway 和 Replicate — Runway 于 8 月 24 日集成了它,支持图像、视频和音频的多重参考输入;Replicate 则在 8 月 25 日跟进,强调可单次输出原生 30 秒并带同步音频。🔗 @runwayml 推文
  • Runway 公布 AI 峰会新增演讲者 — 9 月在旧金山举行的活动扩展了机器人、自动驾驶车辆、营销和基础设施相关议程。🔗 @runwayml 推文
  • MiniMax 发布 H3 集成索引 — Awesome MiniMax H3 Integrations 汇总了围绕这一开放视频模型构建的内容,包括可在 24 GB VRAM 上运行的配置。🔗 @MiniMax_AI 推文
  • Luma 推出 Dream Lab Weekly — 该视频系列的首期节目,聚焦 Luma 的创意专业人士及其每周围绕产品展开的工作。🔗 @LumaLabsAI 推文
  • NVIDIA 发布关于开放模型路由的 Nemotron Labs 会议 — 一场 55 分钟的直播,题为 Get Started with Open Model Routing,是对 Nemotron 3.5 Lightning 和 NeMo Switchyard 相关工作的延伸。🔗 @NVIDIAAI 推文
  • Grok Imagine《奥德赛》竞赛还剩一周 — 需要构思一个取材自《奥德赛》的场景,以突出该工具的视频与语音能力;奖金分别为 100,000、50,000 和 25,000 美元。🔗 @grok 推文
  • Plus 和 Pro 订阅用户的额度重置库 — 与其等待重置窗口,不如消耗一张已预留的重置;启动时赠送一张,之后可通过推荐获得,Business 侧则共享 workspace credits。🔗 ChatGPT 和 Codex 更新日志

这意味着什么

硅再次成为模型实验室的话题。 OpenAI 在同一天公布了其自研推理芯片的首批实测数据,以及阐述其 compute 战略的文章。这不是日程上的巧合:一个设计自己硅片的模型供应商,把它放到第三方公开基准上测量,并公开承认拥有十家合作伙伴的组合,正在改变竞争的性质。问题不再是“哪个模型最好”,而变成“每个成功任务的成本是多少”,而答案既取决于机架,也取决于权重。也许最重要的细节在别处:AI 被用于芯片设计以及内核编写,从进入制造到完成只用了九个月,而且生成的实现代码在所选模块上超过了人类专家。闭环正在形成——模型在设计将让它们运行的硬件。

AI 正在回到设备端,而数据开始跟上。 同一天出现的三个信号指向同一方向。Perplexity 把整个 agent 本地运行在 DGX Spark 上,不消耗 credits,且是否升级到云端仍由用户决定。Multiverse Computing 发布了一种方法:4-bit 模型与甚至超过其全精度来源,这削弱了对激进量化的常见反对意见。Au-Zone 发布了嵌入式硅视觉的测量结果,并批评宣传中的 TOPS 对某个具体模型实际会做什么毫无说明力。这三项工作都没有声称能达到 frontier:Perplexity 的诚实数字是本地 59.6%,而单独使用 Claude Opus 5 在 Terminal Bench 2.1 上为 82.4%。但升级到一个“顾问型”模型,能以三分之二的成本收回五分之三的差距,而正是这种权衡,而非对等,才让本地执行变得站得住脚。

开源权重正在确立为默认立场。 Qwen 转述的一项对 50 万篇 arXiv 文章的分析记录了一个已经可见的逆转:中文开源模型在被提及中的占比已从 10% 上升到约 40%,而美国开源模型则停留在 25% 到 30% 之间。Qwen3.8-27B 以同尺寸中唯一的身份进入 Code Arena 前 10,GLM-5.3 在 DeepSWE 的多次测试中以 2.1 到 5.4 倍更低的成本超过了 GPT-5.6 Sol 和 Claude Fable 5,IBM 以四个量化版本和十四种 GGUF 格式首发开放 Granite 4.2——同样的逻辑一再重复。开放权重不再是追赶动作,而是成为他人默认基础设施的一种方式,不过 Nathan Lambert 自己也指出了这一点的细微差别:论文发表滞后于发布,这些曲线描述的是进行中的工作,而非当下偏好。

而 Web 正在为被 agent 读取,而不是被眼睛阅读做准备。 WebMCP Challenge 是一个奖金 35,000 美元的竞赛,这并不算多;但它揭示的东西更有价值。Chrome、Cloudflare、Shopify、Vercel、Render 和 Netlify 与 OpenAI 一起对齐一个标准,要求网站暴露结构化工具,而不是让 agent 猜测界面。同一天,ChatGPT desktop 可以原生消费 WebMCP,Codex 可以生成并部署兼容应用,OpenAI 还在一个笔记本工具中记录了自己对该协议的内部使用。这种汇合与 Rohlik 所描述的情况相呼应:超过五十个 MCP 集成,以及任何新工具都必须在第一天就对 agent 可访问的原则。面向 agent 的界面层不再是研究课题,而变成了工程要求。


来源