搜索

Gemini 3.8 Flash 达到高端模型水平,价格仅为三分之一;Meta 推出 Muse Spark 1.3;Qwen3.8-Max-0902 登顶 Code Arena WebDev

ai-powered-markdown-translator

使用 gpt-5.6-sol 将文章从法语翻译成中文。

在 GitHub 上查看项目 ↗

9 月 2 日当天共有四十九项公告,这是本次持续追踪开始以来第三高的单日数量。三款一线模型在同一天发布——Google 的 Gemini 3.8 Flash、Meta Superintelligence Labs 的 Muse Spark 1.3,以及 Alibaba 的 Qwen3.8-Max-0902——但三者都没有把追逐原始分数作为宣传重点。

本期贯穿着四股趋势。首先是价格,它已成为三次发布共同的核心卖点。其次是本地推理,视频生成正在下沉到桌面设备,而一款 Apple Silicon 推理引擎也在当晚开放了源代码。然后是企业模型治理:GitHub 对一款模型强制实施数据保留政策,同时允许用户为其他所有模型选择默认设置。最后是网络安全,一款专用模型仅向选定的防御人员开放,同时有一个联盟加入 Linux Foundation。


Gemini 3.8 Flash 与 3.8 Flash Cyber:以相同价格完成更多推理工作的模型

9 月 2 日——Google 发布了两款由 Tulsee Doshi(产品管理高级总监)和 Raluca Ada Popa(Google DeepMind 的 Gemini 安全负责人)署名的模型:Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber。这是六周内发布的第三款 Flash,而 3.7 Flash 问世也才三周。

两种变体共享相同的基础智能能力,Google 明确表示,代码与推理能力的部分提升源于在网络安全领域进行的深度训练:为防御模型开展的工作也带动了通用模型的进步。其首发价格与 3.7 Flash 相比保持不变。

Gemini 3.8 Flash 特性测量值
输入价格每百万 tokens 0.75 美元
输出价格每百万 tokens 3.75 美元
HLE-Verified54.9%

有一点值得开发者关注,因为 Google 直言不讳:该模型消耗的资源更多。可靠性的提升源自一项设计选择——在复杂任务中,3.8 Flash 会执行额外的推理步骤,并以迭代方式调用工具。因此,在较高的推理强度等级下,token 账单会随之上升;对于计算效率优先的工作负载,Google 建议降低推理强度等级,或继续使用 3.7 Flash。上一版本仍获得全面支持。

Cyber 变体更为不同寻常。它通过同日启动的 Fairwind 计划,仅向受信任的防御人员开放,目标是自主发现漏洞,尤其是自动修复漏洞。

网络安全测试Gemini 3.8 Flash Cyber对比数据
CyberGym Pass@1(发现 C/C++ 漏洞)86.2%GPT-5.5-Cyber 85.6% · Mythos 5 83.8% · GPT-5.6 Sol 83.6% · 3.5 Flash Cyber 77.5%
涵盖 20 种语言的内部 Benchmark超过 70%范围比仅限 C/C++ 更广
CWE-Bench pass@1(修复,Collinear)47.2%领先的前沿模型为 47.8%,但成本明显更高

内部部署数据支持的是性价比定位,而非原始性能上的绝对领先:Chrome Security 团队获得的有效修复数量是体量大得多的最佳商用模型的 2.6 倍;Wiz 在其渗透测试 Benchmark 上测得召回率高出 7.5% 至 9.7%,而成本低 2.3 至 5.2 倍;Cloud Vulnerability Research 团队则在不到两小时内发现了一个关键的基础性漏洞,而此类研究通常需要数月。通用模型已经部署于 Antigravity、通过 Google AI Studio 提供的 Gemini API、Android Studio、Stitch 的界面生成功能和 Gemini Enterprise;Google AI Pro 与 Ultra 订阅用户还可在 Gemini 应用、Google Search 的 AI Mode 以及 Google Sheets 中使用它。

🔗 Gemini 3.8 Flash 与 3.8 Flash Cyber 公告

记录此次发布表现的 CursorBench 分数

Cursor 在发布会几小时后将 Gemini 3.8 Flash 加入其模型选择器,而其自有测试平台提供了目前最能衡量该模型在智能体场景中表现的数据。同日发布的 CursorBench 日志显示,3.8 Flash 已被提升为 Gemini 的“Latest”版本,而 3.7 Flash 则退居次要位置。

模型与推理强度等级CursorBench 3.2 分数每项任务平均成本每项任务步骤数
Fable 5.1 Max73.4%9.64 美元70
Grok 4.6 Extra High70.8%2.81 美元46
Fable 5.1 High69.4%4.80 美元44
Opus 5 Extra High69.3%7.35 美元72
Gemini 3.8 Flash High69.2%2.38 美元161
Gemini 3.8 Flash Medium67.0%1.93 美元136
Gemini 3.7 Flash High61.6%1.20 美元99

结果一目了然:Gemini 3.8 Flash High 得分 69.2%,与 Fable 5.1 High 相当,价格却约为其一半;与 Opus 5 Extra High 相当,价格则只有三分之一。它与上一代之间相差 7.6 分。不过,步骤数这一列也揭示了 Google 设计选择的隐性成本:每项任务 161 个步骤,而 Fable 5.1 High 只有 44 个。Cursor 自己也在页面底部提出两点保留意见——结果存在波动,而且显示的成本是根据每百万 tokens 的公开价格推算得出,并非根据实际账单测量。

🔗 Cursor 中的 Gemini 3.8 Flash · 🔗 CursorBench 结果


Meta Superintelligence Labs 的智能体模型 Muse Spark 1.3

9 月 2 日——Meta Superintelligence Labs 发布了 Muse Spark 1.3,它是 Muse Spark 1.2 的继任者,并于当天部署到 Muse Code 以及可通过 dev.meta.ai 访问的 Meta Model API。这是该实验室连续第二天发布产品,此前一天刚刚推出 Muse Voice Transcribe。

其宣称的重点并非追逐分数,而是真实可用性。该模型旨在单个对话线程中同时处理多条工作流,从而完成长周期任务:面对开放式目标时,它会使用工具,从杂乱且相互矛盾的信息源中自行构建上下文,修正计划中的缺漏,并持续记录已学到的内容。最不同寻常之处在于协作能力:Muse Spark 1.3 经过训练,会在指令含糊时提出澄清问题,在遇到阻碍时向用户求助,并在执行会产生后果的操作前请求确认。Meta 工程师的对比显示,与 1.2 版本相比,它的工具调用次数约减少 20%,token 用量约减少 25%——这一差异会直接反映在账单上。

评估类别BenchmarkMuse Spark 1.3Muse Spark 1.2GPT-5.6 SolOpus 5
智能体GDPVal-AA v2(知识工作)1754161517101824
智能体OSWorld 2.0(智能体操作桌面)66.947.662.768.3
智能体DeepSearchQA(智能体式浏览)89.485.993.090.4
智能体AutomationBench(端到端业务流程)49.438.246.750.3
长上下文MRCR 512K-1M98.155.573.8
编码DeepSWE v1.1(长周期智能体编码)75.455.073.074.0
编码SWEAtlas CodeBase QnA59.446.253.552.7

这张表值得仔细解读。Muse Spark 1.3 在长上下文和编码方面明显领先,但在这里选取的四项智能体测试中,Opus 5 均胜过它。更重要的是,这并非在同等条件下进行的比较,而这一点正是 Meta 公布的方法说明中所披露的:Muse Spark 1.3 和 1.2 使用 xhigh 推理强度等级进行评估,而 Claude Opus 5 和 GPT-5.6 Sol 使用的是 max 模式。唯一的例外是 DeepSWE v1.1,其中 Muse Spark 1.3 采用 max 模式测量——而恰恰是这一模式目前尚不可用,Meta 表示它将在额外的安全测试完成后推出。

路线图中的一段话引起了开放生态系统的关注。

Stay tuned for more updates soon, including bigger models, Muse Spark open weights, and more.

🇨🇳 敬请期待即将发布的更多消息,包括更大的模型、Muse Spark 的开放权重,以及更多内容。@AIatMeta 在 X 上

在 Meta 明显减少开放权重发布的一年之后,这项承诺值得注意——但究竟涉及哪个版本仍有待观察,因为官方尚未给出日期或具体范围。

🔗 Muse Spark 1.3 发布介绍


Qwen3.8-Max-0902 登顶 Code Arena WebDev

9 月 2 日——Qwen 发布了其旗舰模型的更新版本:Qwen3.8-Max-0902,这是一份带日期的 snapshot,同时也对应别名 qwen3.8-max-2026-09-02。该模型保留了 8 月版本的结构特征——2.4 万亿参数和 100 万 tokens 的上下文窗口——但额外经历了面向“Coding & Cowork”的后训练阶段。

模型特性公布值
参数2.4 T
上下文窗口1 M tokens
最大输入991 K tokens(thinking 模式下为 983 K)
最大输出131 K tokens
推理预算262 K tokens
输入与输出价格每百万 tokens 分别为 2 美元和 6 美元
显式缓存读取每百万 tokens 0.17 美元
隐式缓存读取每百万 tokens 0.25 美元
显式缓存创建每百万 tokens 2.50 美元
吞吐量限制每分钟 1 M tokens,每分钟 15 K 个请求

该模型接受图像、文本和视频输入,并通过 Responses API 提供五种内置工具:代码解释器、以图搜图、以文搜图、网页提取器和网页搜索。它于当天通过 QwenCloud API 开放使用。

同一天,Arena.ai 公布了 Code Arena WebDev 的结果。Qwen3.8-Max-0902 以 1,691 分直接登上总榜第一,比上一版本高 22 分,比使用 Max 设置的 Claude Opus 5 高 3 分,比使用 Max 设置的 Kimi K3 高 17 分。按每百万 tokens 5 美元的混合价格计算,该模型位于 Arena 帕累托前沿中评分最高的位置,也就是整个榜单中分数与成本比最优的模型。

分类详情让整体情况更具层次:它在 Data & Analytics 和 Consumer Product 类别中排名第一,在 Brand & Marketing、Gaming 和 Simulations 中排名第二,在 Content Creation Tools 和 Reference-Based Design 中排名第三。因此,该模型的优势更多体现在数据应用和大众消费产品上,而不是创意导向任务。Arena 表示 Agent Arena 分数将于之后公布。

🔗 Qwen3.8-Max-0902 公告


推理正在离开云端:桌面上的视频生成,开放许可的本地引擎

这是今天的深层趋势,任何一则公告单独拿出来都无法概括。两项重大发布和四个较低调的信号都指向同一方向:让昨天还需要数据中心 GPU 才能完成的任务在本地运行。

9 月 2 日 — Hao AI Lab(UCSD)的 FastVideo 团队发布了 FastH3 的本地移植版,这是其开放视频模型 MiniMax H3 的蒸馏版本。此前,联合生成视频和音频需要数据中心 GPU;如今,该模型可在一台 NVIDIA DGX Spark、两台通过 QSFP 链路连接的 DGX Spark,或至少配备 36 GB 统一内存的 Apple Silicon Mac 上运行。

主要制约因素不是算力,而是内存。DGX Spark 配备 128 GB LPDDR5X 统一内存,带宽约为 270 GB/s,大致相当于数据中心 HBM 带宽的十分之一,其中实际可供工作负载使用的容量为 121 GB。因此,流水线分阶段执行:编码提示词、释放文本编码器、加载 transformer、去噪、释放 transformer,再加载 VAE。在独立 GPU 上,将权重复制回主机可以释放设备内存;但在 Spark 上,这份副本仍会落入同一个内存池。团队取消了这一步,改为直接将 DiT 加载到 GPU——transformer 的加载时间从 445 秒降至 39 秒,而一次生成 124 帧、分辨率为 768×1344 的运行则从 772 秒缩短至 336 秒。

测试机器首次生成重复生成
Apple M4 Max504 s465 s
DGX Spark264 s243 s
4x GB20010,2 s5,1 s

相比面向 DGX Spark 的公开 vLLM-Omni 方案——生成五秒、1024×576 分辨率的视频并执行 50 个步骤需要 1 881 秒——FastH3 仅用四个步骤便降至 268 秒,约快 7x;在 832×480 下提升至 8,4x,在 1344×768 下则回落到 7,9x。在 M4 Max 上,未缓存提示词的编码时间从约 80 秒降至约 17 秒;TAEH3 解码器则将解码时间从 102 秒缩短至 1 秒,同时把内存峰值从 11,0 GiB 降至 3,6 GiB。MLX 权重以 INT8、INT6 和 INT4 格式发布在 Hugging Face 上,并随附首次发布的 FastVideo Cookbook。下一项目标已经公布:RTX 系列,包括 5090 和 4090。

同日晚些时候,Perplexity 开源了 Lily,这是其混合计算方案中负责 Mac 端侧运行的本地推理引擎。该引擎在前一天的一篇研究文章中亮相;新消息是其代码已在 perplexityai/pplx-garden 仓库中以 Apache-2.0 许可证发布,与 fabric-libpplx-unigram 并列。

代码证实了其极端专用化的取向。Lily 并非通用引擎:它只加载一个 checkpoint,即以 MLX 格式进行 4 位仿射量化、组大小为 64 的 Qwen3.6-35B-A3B,并在加载时进行校验。Qwen 稠密 checkpoint、更小的变体、BF16、GGUF、AWQ、GPTQ、int8 和 fp8 均被明确拒绝。它使用 Rust 编写,Metal 内核在启动时从源码编译,执行路径既不使用 PyTorch,也不使用 MLX,并且要求搭载第 10 代或更新系列的 Apple GPU——即 M5 或更新型号——以及至少 macOS 26。其 API 接口同样极为精简:仅有三个路由,始终采用贪心解码;采样参数、流式传输、工具和多模态内容都会被拒绝,而不是被忽略。这种狭窄定位正是其有趣之处:Perplexity 推出的并非 MLX-LM 的竞争对手,而是在证明,针对特定平台和模型量身打造的引擎能够击败通用框架。

当天另外四项发布也指向同一方向,并收录于简讯:TranslatePsy-Nano,一系列大小为 17 至 42 MB、覆盖十七种语言的翻译模型;i64 Systems 关于让 MoE 模型的专家驻留于 NVMe 且不改变输出中任何一个字节的工作;Cohere 主张合理确定企业小模型规模的文章;以及 NVIDIA 的 DGX Spark 直播,主题是在本地运行 Perplexity 的 Portable Computer。单独来看,它们都不算重磅,但共同推动计算从数据中心转移到设备端。

🔗 本地运行 FastH3 · 🔗 Lily 代码开源 · 🔗 pplx-garden 仓库


Anthropic 开源 Claude Commerce Agents

9 月 2 日 — Anthropic 开源了 Claude Commerce Agents,这是一个采用 Apache 2.0 许可证、用于构建商业代理的参考仓库。此次发布特意安排在节日购物季之前,此时正是电商团队规划部署的阶段。

该蓝图包含两个完整代理。购物代理运行在企业应用中:它搜索商品目录,根据自然语言提出的需求组合一组商品,记住客户偏好,在对话中展示商品、比较结果和购物车,随后将流程交给结账环节——并在同一对话线程中回答客服问题。商家代理面向运营商店的团队:分析销售数据、在促销前对缺货商品发出预警、根据历史数据提出定价建议、撰写营销活动内容。

仓库元素提供的内容
提供的代理购物代理(客户侧)和商家代理(后台)
可运行的垂直领域零售、旅行、电信、票务
运行时Messages API、Claude Agent SDK、Claude Managed Agents(beta)
部署平台Claude API、Amazon Bedrock、Microsoft Foundry、Google Cloud Vertex AI
Claude Code 插件commerce-builder@claude-commerce-agents
技术要求Python 3.11 或更高版本、Node 22
已观察到的成果在使用 Claude 购物代理的零售商中:购物车金额最高增加 35%,买家完成购买的意愿提高 60%

模型所做的决定与实际执行的操作之间的隔离是结构性的,而非仅靠声明实现。在消费者侧,代理调用的后端接口根本不包含任何支付方法。在商家侧,每个写入工具都会生成一项待处理变更,并附带由服务器端生成的标识符;只有标识符经过真正的人类验证界面批准后,apply_change 函数才能成功执行。Anthropic 明确表示,这是一个不受维护且不接受贡献的参考实现:它是供人 fork 的起点,而不是需要持续跟踪的依赖项。演示中的所有企业均为虚构对象,系统不会真正下单,也不会扣款。

🔗 Claude Commerce Agents 公告 · 🔗 commerce-agents 仓库

技术部分:用代码实现缓存、延迟优化和安全护栏

同日发布、由 Ali Shazal 和 Matthew Koen 署名的工程指南与该蓝图配套,总结了团队与零售商、市场平台和旅游业参与者合作一年的经验。它提出的第一条建议颇为反直觉:面对需要覆盖众多类别的代理,不要为每个领域创建一个子代理。商业对话是一个高度耦合的单一会话,拆分会降低质量——能力来自 skills,而不是代理数量的增加。

讨论主题Anthropic 给出的量化指标
渲染后的商业回复500 至 700 个输出 token
缓存 token 的读取成本新 token 成本的十分之一
缓存写入约 1,25x 的额外成本,从第二次使用起即可摊销
目标缓存命中率90 至 99%
缓存读取速度在约 100 000 个 token 时快 1,5 至 2x
记忆带来的提升内部评估套件的事实召回率提高 13%
每个流程的评估用例初期准备 50 至 100 个

在模型选择方面,建议商家代理从 Opus 开始,因为分析占主导地位;消费者代理则从 Sonnet 开始,因为延迟更为重要——随后在每个模型和每个 effort 级别上运行整个评估套件,衡量每项已完成任务的成本,而不是每次模型调用的成本。至于安全部分,其表述毫不含糊。

The prompt is where safe behavior starts, but in commerce it can’t be where safety is enforced. The failures are financial and often irreversible, and a prompt rule is one injection or one bad sample away from being skipped.

🇨🇳 提示词是安全行为的起点,但在商业场景中,它不能成为实施安全控制的地方。故障会造成财务损失,而且往往不可逆转;任何提示词规则都可能被一次注入攻击或一次不良采样绕过。Anthropic,《高效商业代理的结构指南》

因此,四项规则直接通过代码强制执行,并且只定义一次,供三个运行时共享:模型负责准备,但由人或策略负责实施;写入和渲染只接受服务器签发的标识符;设有额度上限的交易必须能够抵御重复请求;第三方内容必须经过净化处理。


Claude Code 和 Claude Cowork 的计算机控制转入后台运行

9 月 2 日 — Claude 的计算机控制(computer use)不再独占屏幕。此前,启动此类任务意味着把机器交出去:Claude 在获准的应用中工作期间,其他窗口都会被隐藏。如今,无论在 Claude Cowork 中,还是在桌面应用的 Code 标签页中,任务都可以在后台继续运行,而用户能够同时处理其他事务。

这项变更目前处于 beta 阶段,仅面向 Pro 和 Max 套餐,并且仅限 macOS——而 computer use 本身仍以 research preview 形式在 macOS 和 Windows 上提供。已经使用该功能的用户无需启用任何设置;其他用户可在 Settings > General 中找到它,同时 macOS 还要求授予辅助功能和屏幕录制系统权限。

安全框架则没有变化。与在沙箱中运行的 Bash 工具不同,computer use 在真实桌面上执行。访问级别仍按应用类别固定,且无法修改:浏览器和交易平台仅可查看,终端和 IDE 仅可点击——以促使 Claude 使用专用工具,而不是屏幕控制——其他应用则允许完全控制。一次批准在当前会话内有效;若会话从 Dispatch 启动,则有效期为三十分钟。

🔗 后台 computer use 公告


Cursor 在客户管理的机器上运行其云端代理

9 月 2 日 — Cursor 发布了一篇由 Jack Pertschuk 署名的产品文章,宣布其云端代理现可使用客户自有基础设施。此前,Cursor 云端代理运行在该公司云端的专用虚拟机上。借助 Self-Hosted Machines,工具执行会转移到企业网络内的机器上,而代理循环、推理和规划仍由 Cursor 负责。

文章开头便给出了推动这一举措的数据:如今,Cursor 内部合并的 pull request 中,超过 60% 由云端代理生成。随着越来越多的工作经由这些代理完成,它们在哪台机器上运行便不再是无关紧要的细节。Cursor 指出,三种情形会促使团队采用自己的机器:让工具直接连接源代码管理器和内部服务;使用 GPU 或用于 iOS 开发的 Mac 等特殊硬件;或运行难以封装进云端代理镜像的操作系统。

机制方面技术细节
注册命令agent worker start,长期保持的出站 HTTPS 连接
连接方向Cursor 永远不会向客户网络发起入站连接
可用配置My Machines(单独的工作站或 VM)和 Pools(团队共享队列)
闲置后恢复通过快照休眠,恢复时沿用同一 worker 标识符
沙箱提供商AWS Lambda、Cloudflare、Coder、Daytona、E2B、Modal、Namespace、Vercel
计算机控制除 Mac 外,现也支持 Linux,可通过 Chrome 或 Chromium 实现

Pools 通过一个控制器进行扩缩容,该控制器监控请求队列,并使用团队提供的脚本启动机器;如果没有空闲 worker,请求就会等待。为了应对“重置机器”和“让机器持续开机”这两个都成本高昂的选择之间的中间场景,Cursor 引入了休眠机制:闲置机器会被创建快照并关机;如果在重新连接窗口内有新的启动请求,系统就会恢复该快照。由于一个 pool 不与某个仓库绑定,同一队列可以服务多个仓库。

文章本身也提出了一项保留意见:转移的只有执行环境。工具输出会传回 Cursor 用于推理,其中可能包含代码;代理转录内容也可能在那里接受处理和存储。因此,这并非完全隔离,而只是执行位置的转移。

🔗 Self-Hosted Machines


Claude Fable 5.1 已通过集成商全面开放

9 月 1 日和 2 日 — Claude Fable 5.1 发布当天即在 GitHub Copilot 中全面开放;次日,Genspark 将其集成到 Code Agent 和 Claw 中。两天内两家集成商采用同一模型:这是一波采用浪潮,而非两条孤立新闻。

GitHub 的覆盖范围很广——Visual Studio Code、Visual Studio、Copilot CLI、coding agent、GitHub Copilot 应用、github.com、iOS 和 Android 版 GitHub Mobile、JetBrains IDE、Xcode 以及 Eclipse——面向 Pro+、Max、Business 和 Enterprise 套餐逐步推出,并按供应商公开价格计费。但此次开放最值得注意之处并非技术层面,而是合同层面。

访问条件适用于 Fable 5.1 的规定
管理员策略默认禁用,必须明确启用
数据保留默认强制启用,供 Anthropic 的安全分类器使用
保留数据的用途不用于训练 Anthropic 模型
其他 Claude 模型仍保持零保留,但 Fable 5 和 Fable 5.1 除外
零保留豁免符合条件的企业可获豁免,直至本日历年度结束
豁免结束后必须使用 Enterprise Frontier Safeguards

与 Copilot 中的其他 Claude 模型不同,Fable 5.1 默认要求保留数据:Anthropic 会保留提示词和输出,以运行其安全分类器。因此,启用该策略即表示明确接受这一约束,而保持关闭则会使该模型不可用。退出途径既临时又具有选择性:符合条件的企业可以在本日历年度结束前继续实行零保留,以等待 Anthropic 部署 Enterprise Frontier Safeguards;后者将提供自动化安全监控,以及由客户控制的存储和加密密钥。资格无法通过自助方式获得:必须经由 GitHub 销售团队申请,支持团队无法绕过该流程,而且即使获批,也不会自动启用任何功能。

Genspark 则声称在发布首日便将其集成到 Genspark Code Agent 和 Claw 中,但未提供 benchmark 或定价细节。该公司由此加入了模型发布数小时内便完成接入的 agent 平台之列,同行还包括 Cursor、Devin、Warp、v0、Amp 和 Perplexity Computer。

🔗 GitHub Copilot 中的 Fable 5.1 · 🔗 Genspark 公告


GitHub 详解如何在不降低质量的前提下降低 Copilot 成本

9 月 2 日 — GitHub 发布了一篇由 Erik Kristensen 署名、Napalys Klicius 参与撰写的工程文章,介绍如何降低 Copilot 的成本。这类文章通常很少如此坦诚:它给出了具体数字,描述了失败的实验,并解释了为何看似显而易见的优化可能适得其反。

文章开篇的论点有悖直觉。统计单次交互的 token 数量并不能衡量效率:如果简洁的工具响应遗漏了 agent 所需的信息,就会迫使它再次运行命令,从而使整个任务变得更慢、成本更高。GitHub 以 RTK(Rust Token Killer)说明了这一陷阱;该工具会在读取 shell 输出前先将其缩短。它确实缩短了部分响应,但后续的信息恢复步骤增加了交互轮次:局部节省的 token,却在整体上花了回去。因此它没有被部署。

评估的变更测得的收益
在离线测试中移除行号推理成本降低约 5%
在 CLI 生产环境中移除行号每位用户的平均每日成本降低约 3%
压缩工具 task 的提示词每轮减少 1,300 个 token,每活跃小时的标准化成本降低 2.9%
直接交付已完成的后台工作以 AI Credits 衡量,与 token 相关的用量降低约 2.3%
在 Copilot code review 中移除行号并进行压缩两项措施分别使每次审查的提示词 token 减少约 5%
此前迁移到共享文件工具审查成本降低约 20%
RTK(Rust Token Killer)被弃用,在测试配置中导致总体成本上升

最终采用的压缩策略有意保持谨慎,分为三个方面:完整保留看起来像源代码的输出;重新组织搜索结果,但不删除任何内容;只压缩安装、build 和测试过程中重复出现的噪声。早期版本曾包含对 git diff 的压缩;但 benchmark 任务显示 agent 会重新打开原始输出,因此该功能后来被移除。

最具启发性的案例与提示词压缩有关。在一个由 Copilot 迭代重写自身指令的元提示循环中,工具 task 的提示词被缩短了一半——但首次在线实验暴露了离线评估未发现的性能退化:该循环将一条关于并行处理的谨慎指令变成了严格的顺序规则,导致相互独立的 agent 被串行执行。修复方案用一句话取代了白名单和黑名单,让模型自行作出决定。最后也是最实用的经验是:收益无法从一个产品直接迁移到另一个产品。受 Copilot code review 良好结果启发而制定的一套更精简指令,反而使 Copilot CLI 的成本上升

None of these changes made the model smarter. They removed work the model never needed to do.

🇨🇳 这些变更没有让模型变得更聪明。它们只是移除了模型原本就无需完成的工作。GitHub Blog:我们如何提高 AI 编程的成本效率


Copilot 模型目录正在重组

9 月 1 日和 2 日 — 同一时期发布的两则 changelog 展现了同一次重组的两个方面:哪些模型将退出 Copilot 目录,以及今后由谁决定默认模型。

自 9 月 1 日起,六款模型在大多数 Copilot 使用场景中被弃用——包括 Copilot Chat、在线编辑、ask 和 agent 模式以及代码补全。

被移除的模型GitHub 建议的替代方案
Gemini 3.1 ProGemini 3.7 Flash
Claude Opus 4.5Claude Opus 4.7、Claude Opus 4.8 或 Claude Opus 5
Claude Opus 4.6Claude Opus 4.7、Claude Opus 4.8 或 Claude Opus 5
Claude Sonnet 4.5Claude Sonnet 5
Claude Sonnet 4.6Claude Sonnet 5
Raptor MiniMAI-Code-1.1-Flash

仍有一项例外:订阅年度个人套餐的用户仍可使用 Claude Sonnet 4.6。用户无需采取任何操作,但 Copilot Enterprise 管理员可能需要在策略中明确启用替代模型,否则这些模型不会出现在 VS Code 或 github.com 中。

与此同时,企业托管设置现在允许将任意模型设为新对话的默认模型。设置粒度甚至可以细化到团队:管理员可将键 model 声明为 overridable,并编辑 team-mappings.json 中的团队配置文件,让每个团队选择自己的默认模型;不属于这些团队的用户则继承全局设置。该功能已在 Copilot Business 和 Copilot Enterprise 中全面开放,适用于 GitHub Copilot 应用、Copilot CLI 和 Visual Studio Code。

🔗 已弃用的模型 · 🔗 企业默认模型


8 月 Ship Log:Slack 和 Teams 中的 Copilot,以及 CLI 中的媒体功能

9 月 1 日和 2 日 — GitHub 以 X 文章形式发布的月度总结带有宣传性质,但它披露了一项此前未被报道的 8 月交付成果:现在可以从 Slack 和 Microsoft Teams 访问 GitHub Copilot。该集成将 Copilot CLI 和 GitHub Copilot 应用的 agent 能力带入团队对话——提及 GitHub,即可在不离开当前讨论串的情况下规划变更、调查问题或转交编程任务。

8 月 Ship Log 项目已交付内容
Slack 和 Microsoft Teams 中的 CopilotCopilot CLI 和 Copilot 应用的 agent 能力
Copilot code review,Balanced 深度与 Lite 一同全面开放,组织或仓库可设置默认值
再次提及的新模型Gemini 3.7 Flash、MAI-Code-1.1-Flash、由 Fireworks AI 托管的 Kimi K3
GPT-5.6 Sol 优惠截至 9 月 3 日半价
自动选择优惠Copilot Max 用户享受 30% 折扣
GitHub Copilot Day2026 年 9 月 10 日

该总结还记录了 Copilot code review 的 Balanced 深度模式,该模式已与 Lite 一同全面开放:Balanced 面向 pull request,旨在提供更深入的分析;Lite 面向直接变更;默认深度可在组织或仓库层级设置。

本月另一项交付成果补全了命令行方面的功能:GitHub CLI 自 gh v2.99.0 起提供可重复使用的 --attach flag,可上传本地图片或视频,并在 issue、pull request 或评论中以内联方式引用。它适用于六个写入 Markdown 的命令,而真正使其便于使用的是对现有 Markdown 的处理:正文中已引用的本地路径会被原地重写,因此 ![alt](./login.png) 会保留其替代文本并指向已上传的 asset。可在路径中的 # 后提供替代文本。支持的格式包括 PNG、JPEG、GIF、WebP、SVG、MP4、MOV 和 WebM;付费套餐中,图片上限为 10 MB,视频上限为 100 MB。此版本不支持 GitHub Enterprise Server。GitHub 特别强调,coding agent 也继承了这一能力,现在可以直接展示结果,而不只是对其进行描述。

🔗 2026 年 8 月 Ship Log · 🔗 GitHub CLI 中的媒体功能


Fairwind Program:Google 面向可信防御者的网络防御计划

9 月 2 日 — 在发布 Gemini 3.8 Flash Cyber 的同一天,Google 推出了分发该模型的渠道 Fairwind Program。安全与隐私副总裁 Four Flynn 阐述的出发点,是防御团队面临的一个现实困境:要么采用规模庞大、成本高昂且难以在企业代码库中掌控的前沿模型,要么退而使用更小的开放权重模型,但后者难以修复复杂漏洞。

其解决方案将 Gemini 3.8 Flash Cyber 与 Google 的自动修复框架 CodeMender 相结合。核心主张不在于检测,而在于补救:发现弱点只会带来认知和恐惧,自动发现并修复弱点才能带来安全。其承诺是在数分钟而非数周内生成经过验证、可部署的修复补丁,并在客户组织的安全云环境内完成。

访问权限被有意分阶段开放,优先面向三个圈层:政府和国家网络安全机构;医疗、电信、能源和金融网络领域的关键基础设施运营商;以及核心技术平台。参与组织须接受严格约束——仅允许内部网络安全、事件响应或渗透测试团队访问,并部署多因素身份验证等防护措施。Google 宣布全球已有超过 650 家合作伙伴参与。在该计划之外,任何 Google Cloud 客户都可在 Gemini Enterprise Agent Platform 上使用 CodeMender 搭配公开可用的模型,并与 AI Threat Defense 配合使用。该公司还表示,通过 Google.org 提供的网络安全累计资助已超过 1 亿美元,其中 3,600 万美元用于资助 35 家网络安全诊所,这些诊所已为美国超过 1,250 家医院、学区和市政服务机构提供支持。

🔗 Fairwind Program


Google 命令行工具:两天内发布三个版本

9 月 1 日和 2 日——Google 在两天内针对同一范围发布了三个版本,整体呈现出明确的优先方向:减少功能,强化隔离与稳定性。

已发布版本日期主要内容
Gemini CLI v0.58.09 月 1 日七项以安全为主的变更,晋升至稳定通道
Antigravity CLI 1.1.239 月 1 日两项改进,十一项修复
Antigravity 2.12.09 月 2 日七项改进,九项修复

Gemini CLI 稳定通道已升级至 v0.58.0,但这次晋升几乎无人注意,因为它发生在 preview v0.59.0 发布三十二分钟后。其内容几乎完全侧重防御。最重要的修复涉及 macOS 沙箱:Seatbelt 配置文件现在会隔离 Docker 和容器 runtime 的 socket 与二进制文件,从而封堵一条典型的逃逸路径——受限进程一旦能够访问宿主机的 Docker socket,实际上就能逃逸出去。另外两项变更强化了核心机制:在处理忽略路径时,对符号链接的求值现在保持一致;顶层安全检查器也在写入策略配置中得到明确声明。

Antigravity 2.12.0 带来了两项新功能。回复引用功能允许高亮回复中的一部分,并将其作为上下文重新注入下一条 prompt——这直接解决了长时间 agent 会话中的日常难题。仅向付费用户开放的 /boost 命令,则通过多 agent 推理 pipeline 提高思考强度。它与 Gemini 3.8 Flash 在同一天推出;Google 明确表示,后者会以消耗更多 token 为代价进行更深入的工作:两项举措方向一致,都让用户能够明确控制投入的工作强度。其余变更则针对实际存在的痛点:常规设置会标明哪些项目覆盖了某项配置;分屏 terminal 布局可在窗口重新加载后保留;语音听写运行期间也能发送消息。

最后,Antigravity CLI 1.1.23 通过让每条子轨迹只发送一次轨迹元数据,而不是在每个步骤都发送,减轻了 subagent streaming 的负担;它还支持通过 Tab 接受 /model 中以幽灵文本形式建议的模型名称。其十一项修复暴露出一些日常使用中令人头疼的缺陷:prompt hook 会引发崩溃;为 Gemini 模型重建历史记录时会遗漏工具调用 ID;权限提示显示笼统标题,而非易于理解的操作说明——这确实是个问题,因为它要求用户授权一项并未说明的操作;以及使用 enable_mcp_tools=true 声明的 subagent 会因缺少 MCP dispatcher 而失败。

🔗 Gemini CLI v0.58.0 发布说明 · 🔗 Antigravity 更新日志


Gemini Notebook 的 Short Video Overviews 扩展至 70 多种语言

9 月 1 日——Gemini Notebook 已将 Short Video Overviews 扩展至 70 多种语言,并新增了三种英语变体。该功能可将 notebook 中的来源转化为约 60 秒的竖屏视频,如今能够以用户的语言生成。

此次部署覆盖网页端和移动端,并且仍仅面向 Ultra 和 Pro 订阅用户——团队还在同一讨论串中说明,向 Pro 用户的推送尚未全部完成。公告还补充了两个细节:notebook 中包含的来源数量不计入 token 消耗;Pro 用户仍可生成英语版 Cinematic Video Overviews。从英语扩展到 70 种语言,使这项功能从演示性质的产品转变为真正能在英语世界之外使用的工具。

🔗 Gemini Notebook 公告


编辑器正在成为模型多路复用器

9 月 1 日和 2 日——两则看似毫无关联的公告描述了同一种趋势:开发环境正在成为第三方模型的接入点,而差异化优势正从模型质量转移到模型运行的条件上。

Zed 发布了稳定版 1.18.0,其中最重要的内容位于发布说明的 AI 部分。编辑器一次性跟进了近期发布的多个模型:Amazon Bedrock 上现已支持 GPT-5.6 的 100 万 token 上下文窗口;Gemini 3.5 Flash-Lite 加入 Google AI 模型阵容;Grok 4.5 和 Grok 4.6 加入 xAI 模型阵容;前一天刚刚发布的 Claude Fable 5.1 也获得了更完善的支持。这四项中的两项是发布说明中注明的外部贡献。此外还有一些专为 agent 工作流程设计的易用性改进——无需重启即可重新加载中断的外部 agent 连接;降低长会话的内存消耗;连接错误会指出无法访问的主机——以及一项值得 MCP server 用户注意的修复:对于要求非标准 scope 的 server,OAuth 身份验证此前会失败。

另一方面,Mistral 已面向 Pro 和 Team 方案,在其编码 agent Vibe Code 中开放 GLM 5.2。值得关注的并非模型本身,而是其服务方式:Mistral 在欧洲通过自有基础设施托管该模型。因此,欧洲开发者通过 Vibe Code 使用 GLM 5.2 时,请求的推理由 Mistral 执行,不会经过 Z.ai 的 server。这正是该公司自 8 月以来倡导的区域化推理定位的具体体现——而且这一情形尤其耐人寻味,因为 Mistral 拥有自己的 Devstral 模型家族,却仍选择在其工具中提供一个由竞争实验室开发的开放权重模型。

🔗 Zed 1.18.0 发布说明 · 🔗 Vibe Code 中的 GLM 5.2


NVIDIA:两篇工程文章与一个更换主管机构的联盟

9 月 2 日——NVIDIA 在同一天发布了三项内容,其中两项涉及技术,一项涉及治理。

第一篇文章是模型协同设计系列的第三篇,提出了调优 speculative decoding 的五条规则。这项技术并不陌生:一个小型 draft 模型先提出多个 token,再由目标模型通过一次并行 pass 进行验证。实际问题仍然存在——应当推测多少个 token,又该采用什么机制。验证期间,计算量随 (1 + D) 增长,但内存访问量保持不变:因此需要增加 draft 长度 D,直到验证过程从 memory-bound 转为 compute-bound。对于一个具有代表性的 expert GEMM,D = 7 时,只需 D = 0 所需 batch 大小的八分之一即可进入这一状态。当 attention 主导解码时间时,最佳长度为 D = 128/G − 1,其中 G 是共享一个 KV head 的 query head 数量;超过该值后,最好选择使 G × (1 + D) 成为 128 倍数的数值,128 是 attention kernel 的 tile 大小。测量基于 NVIDIA 的 speculative decoding benchmark SPEED-Bench:以 Qwen 3.5 122B A10B 为目标模型时,外部 35B A3B draft 模型在 D = 9 时达到 6 的接受长度。文章强调了一个经常被忽视的要点——更高的接受率并不意味着更高的加速幅度——并以一则警告收尾:对目标模型进行 fine-tuning 会改变其输出分布,因此为某个特定 checkpoint 训练的 drafter,即使在目标模型有所改进时,也可能出现接受率下降。

第二篇文章是一份分六步展开的 CUDA 优化指南,始终围绕同一个示例:将三张 RGB 图像转换为灰度图,然后计算每个 32 × 32 像素 tile 的中位数。起点是一段故意包含错误的代码,Compute Sanitizer 立即诊断出问题——共享内存中的越界写入,原因是在应使用 block index 的位置使用了 global index。

优化阶段总耗时本阶段提升
初始代码6,8 s
CUB(DeviceTransform 和 BlockRadixSort)635 ms约 10x
池化内存容器约 244 ms约 2,6x
固定内存25 ms约 10x
每张图像一个 CUDA stream23 ms累计约 300x

仅用 cub::BlockRadixSort 替换自制的冒泡排序,就将中位数计算时间从 2,142 s 降至 773 µs,提升了 2717 倍。这些步骤没有一项属于底层优化:它们都是 API 替换。

最后,由 NVIDIA 参与创立的 Open Secure AI Alliance 加入了 Linux Foundation。该联盟提出的观点改变了常见讨论的焦点:agent 不只是一个语言模型,而是由模型、为其提供上下文的 harness,以及限制其能力范围的 guardrail 组成的软件系统。然而,安全讨论长期以来主要聚焦于模型本身,尽管安全取决于整个系统——harness、alignment 机制、执行环境、身份、策略、可观测性和恢复能力。联盟还与 OpenSSF 合作,就 SAFE(Shared AI Findings Exchange)公开征求意见;该机制用于保密收集与 AI 有关的事故和未遂事故。

🔗 Speculative decoding · 🔗 逐步优化 CUDA · 🔗 Open Secure AI Alliance


Equinix Inference Exchange:覆盖 280 个数据中心的开放模型

9 月 2 日——Equinix 宣布推出 Equinix Inference Exchange,这是一项分布式 AI 推理计划,既扩展了其与 NVIDIA 的合作,也引入了 Together AI。整体架构由三层组成:Equinix 提供通过 Equinix Fabric 与 cloud 相连的物理基础;NVIDIA 提供经过验证的企业参考架构;Together AI 则在其上运行平台,支持 200 多个 open source 模型,可采用共享部署或专用单租户环境。

其核心主张是推理的部署位置,而非模型选择,主要面向三种场景:在大都市边缘进行推理以降低延迟;将工作负载从封闭的专有模型迁移到开放替代方案;以及为受监管企业提供主权 AI。相关覆盖数据体现了所调用网络的规模:在 77 个大都市拥有 280 多个数据中心、230 个 cloud 接入点,并连接了 10 500 多家企业。

不过,时间安排上有一点需要留意:Equinix 的新闻稿明确写明,该解决方案将从 2027 年第一季度开始提供,而 Together AI 的消息却称其平台已在 Equinix 的全球数据中心投入运行。这是一则合作与路线图公告,并不代表服务已经上线。

🔗 Equinix 新闻稿


BenchMIRT:Ai2 用于审计 benchmark 真正测量内容的方法

9 月 1 日——Ai2 发布了 BenchMIRT,这一方法直面了一个很少被直接讨论的问题:benchmark 是否真的测量了它声称要测量的能力?它不再围绕最终得分进行分析,而是深入到每一道问题,评估哪些能力真正决定了答题成功率;其依据是源自心理测量学的项目反应理论(Item Response Theory)及其多维变体。训练采用了 100 个开放权重模型在 16 个 benchmark、超过 34 000 道问题上的结果。

最可靠的成果体现在方法论上:在没有被告知每项 benchmark 理应测量什么的情况下,BenchMIRT 自行识别出了两个主导维度——安全性和通用推理能力;从零开始重新运行分析时,这两个维度再次以相同形式出现。

接受审计的 benchmark与推理能力的相关性与安全性的相关性审计结论
MMLU-Pro0,97-0,21符合其标称目标
BBQ0,85-0,06尽管被定位为安全测试,实际却追随推理能力
WMDP-0,890,21测量危险知识的缺失程度
ToxiGen0,40-0,32两个维度均较弱,benchmark 已在 92 % 处饱和

BBQ 的设计目的是测试模型是否依赖社会刻板印象,但它与通用推理能力的相关性达到 0,85,与安全性却完全不相关:低分反映的也许更多是模型的推理能力,而非其行为。第二项贡献具有实践意义:Ai2 按问题的区分能力进行排序后发现,只保留其中 10 %,仍能维持大致相同的模型排名;该方法对未观察问题答案的预测准确率为 79 %,而朴素方法仅为 70 %。研究也明确承认两项限制:所有训练模型都来自 2025 年 3 月以前;所发现的维度取决于所提供的 benchmark 集合。

🔗 BenchMIRT


Runway Dev MCP:编码 agent 接管媒体集成

9 月 2 日——Runway 推出了 Runway Dev MCP,这是一款托管式 MCP server,可将其开发者平台直接接入日常使用的编码工具——Claude、ChatGPT、Codex 或 Cursor。其主张可以概括为一句话:编写集成代码的 agent 如今能够为它选择合适的模型、配置它所依赖的工具,并进行调试。

该服务覆盖集成过程的三个阶段。在首次调用 API 之前,agent 会查询目录,了解某个项目可以使用哪些模型、价格如何以及接受哪些输入,随后获取所选模型的准确请求 schema——目标是在第一次尝试时就正确调用,而不是靠猜测。进入生产环境后,它会创建并配置 Model Router,根据成本、延迟或质量在多个模型之间进行仲裁,同时设置每次生成的成本上限;它还能查明 router 为某次特定调用选择了哪个模型。同样的逻辑也适用于 Characters。第三个阶段是调试:生成失败时,agent 会通过已定义的工具查询任务,并读取具体的拒绝原因——moderation 拒绝、asset 大小超限或请求 body 格式错误——之后进行修正并重新运行。Quickstart 菜单会创建 API key,然后打开 Claude Code、Codex 或 Cursor,并附上一条预先写好的消息。

🔗 Runway Dev MCP


DreamX-Creator 1.0:从单张图像原生生成 2K 音视频

9 月 2 日 — Alibaba 的 AMAP 团队发布了 DreamX-Creator 1.0。这是一款采用 Apache 2.0 许可证、拥有 70 亿参数的模型,能够从单张图像和文本 prompt 出发,原生生成同步的 2K 视频流与音频流,无需将视频模型和音频模型串联起来。

该系统由三个核心模块构成:结合渐进式联合训练的门控跨模态注意力(Gated Cross-Modal Attention),使两个流能够双向交互;由模态感知型多模态反馈驱动的音视频强化学习;以及单步自回归优化,在保持运动效果和音频时间同步的同时,将视频提升至 2K。

目前发布内容仍不完整。前一天初始化的 GitHub 仓库中包含项目介绍及路线图,技术报告也已发布于 arXiv。经过验证的权重、推理代码、配置和评估工具仍被列为尚未完成的里程碑。该工作以 Wan2.2 和 OpenMOSS 的 MOVA 为基础,并明确向二者致谢。

🔗 DreamX-Creator 1.0 公告


OpenAI API 将扩容过快与模型过载区分开来

9 月 2 日 — OpenAI 修改了其 API 报告两种状况的方式,此前客户端应用无法区分这两种情况。

HTTP 状态错误代码含义应对方式
429slow_down请求速率增长过快遵循 Retry-After,降低速率,然后逐步提高
503server_is_overloaded请求的模型暂时过载遵循 Retry-After 后重试;若错误持续,则延长等待时间

这一区分会立即影响所有重试代码。文档指出,即便流量仍处于组织每分钟请求数和 token 数限制之内,也可能出现 slow_down 错误:它并不表示配额已经耗尽,而是意味着系统判定流量增长过于突然——换言之,应用即使没有超过任何已显示的限制,也可能遭到限流。速率限制指南提出了一条经验法则:当流量达到每分钟 100 万个输入 token 后,每 15 分钟的增幅不要超过 50%。当缺少 Retry-After 标头时,OpenAI 建议采用带少量随机延迟的指数退避,以免同一服务的所有实例同时重试。按量使用流量经常触及这些限制的组织可考虑 Scale Tier;对于 GPT-5.6 及后续模型,则可考虑 Reserved Tier。

🔗 OpenAI API 更新日志


简讯

  • Claude Code 2.1.258 — 仅包含修复的版本:恢复了自 2.1.255 起失效的 macOS 12 Monterey 启动支持,远程及计划任务会话也不再于重新批准权限后失败。🔗 更新日志
  • Claude Campus Ambassadors — 今年开放了三个不同方向的申请:本科、研究生,以及博士和博士后。🔗 公告
  • Nokia 使用 Cursor 分析 5000 万行代码 — Core Networks 部门的两名工程师在两周内完成了这项工作,而团队原本估计需要调动约 12 名专家、耗时数月。该案例研究由厂商发布,没有独立的测量方案。🔗 案例研究
  • TranslatePsy-Nano — Tether AI Research 发布了两个紧凑型翻译模型系列:支持九种欧洲语言的 EuroNano,以及支持八种非洲语言的 AfriNano;两者均提供 42、31 和 17 MB 的版本,每个语言组只使用一个 checkpoint。🔗 公告
  • Puffin-World — 一款统一多模态模型,通过物理、几何和外观三种原生状态来表征世界,并与 Puffin-16M 数据集一同发布。🔗 介绍
  • 驻留于 NVMe 的 MoE 专家 — i64 Systems 将专家权重保留在 NVMe 上,并使用 SHA-256 manifest 进行验证;测量结果显示,租用路径与驻留路径的输出逐字节完全一致。🔗 技术文章
  • Sakana AI 出席 CiNet International Conference — 首席技术官 Llion Jones 与研究员 Kai Arulkumaran 将于 2026 年 10 月 5 日至 7 日在大阪发表关于神经科学与机器学习之间桥梁的演讲。🔗 公告
  • Gemini CLI,9 月 2 日 nightly 版本 — 只有一项变更:改进了网页获取工具中的目标验证和连接路由,延续了 8 月底开始的网络安全加固。🔗 发布说明
  • MrBeast 与 Google 建立多年合作伙伴关系 — 该协议将 Google 与 Beast Industries 的合作关系从 YouTube 扩展至 Gemini 和 Google Health;首支视频将于 9 月 5 日发布,其中使用 Gemini 协助在丛林、沙漠和北极生存。🔗 公告
  • Google 8 月 AI 公告汇总 — 一篇汇集本月已陆续报道内容的月度文章,没有新的独立消息。🔗 汇总
  • Enterprise Live Migrations 正式发布 — 可在近乎零停机的情况下,将仓库从 GitHub Enterprise Server 迁移至具备数据驻留能力的云端,迁移由 gh elm 扩展控制。此项与 AI 无关,为确保完整性而收录。🔗 更新日志
  • ElevenLabs 任命 Ashley Kramer 为首席营收官 — 这是该公司在此期间发布的唯一消息,其产品更新日志自 8 月 24 日以来没有变化。🔗 公告
  • NVIDIA 直播展示在 Perplexity Portable Computer 上运行 DGX Spark — 这段 26 分钟的内容聚焦其本地运行过程,没有说明文字或转录。这是当天第二次将 DGX Spark 作为本地移植目标的演示。🔗 直播
  • Kling AI 介绍其 MCP 服务器的 Elements — 一篇关于如何在不同镜头间保持角色身份一致性的教程;属于产品教学,并非新品发布。🔗 教程
  • Codex CLI 0.152.1 — 在 0.152.0 发布约 20 小时后推出的修复版本:Guardian 审批审查现在会遵循由模型元数据传入的 Node REPL 策略。🔗 发布说明
  • Cohere 主张企业采用小模型 — 该厂商汇集 Command R7B、拥有 33.5 亿参数的 Tiny Aya 和 North Mini Code,以论证合理确定模型规模的重要性;其中 North Mini Code 在 Artificial Analysis 的 Coding Index 中获得 33.4 分。没有发布新产品。🔗 文章
  • Perplexity 发布两份教学指南 — 主题分别为个人助理和幻觉检测。第二份指南介绍了一种两阶段后训练流程:第一阶段培养产品行为,第二阶段使用难度更高的研究任务。🔗 指南

这意味着什么

价格已成为主要卖点,前沿模型也不例外。 同一天发布了三款产品,却没有任何一款强调创纪录的分数。Google 为 Gemini 3.8 Flash 延续上一代的定价,同时承认其模型会消耗更多 token——这种罕见的坦白,将讨论焦点从标价转向完成一项任务的实际成本。Qwen 明确宣称占据 Arena 帕累托前沿的顶端,而非单纯位列第一。Meta 衡量收益时采用的也不是 benchmark 分数,而是工具调用减少 20%、token 减少 25%。CursorBench 表格给出了当天最直观的衡量结果:Gemini 3.8 Flash 得分为 69.2%,每项任务成本为 2.38 美元;达到同等分数,Fable 5.1 需要 4.80 美元,Opus 5 则需要 7.35 美元。不过,步骤数一栏也提醒人们,这一价格优势要从其他方面付出代价——161 步对 44 步。

harness 工程正在成为可量化的经济杠杆。 GitHub 的文章是当天对所有基于这些模型进行开发的人最有帮助的文档:其中介绍了四项不改动模型、却能分别节省 2% 至 5% 的优化措施,并记录了失败的实验。Anthropic 的工程指南从另一个角度表达了相同观点——设计之初就应以 90% 至 99% 的缓存命中率为目标,并关注每项已完成任务的成本,而非每次调用的成本。两者都指向了模型竞赛所掩盖的一点:在模型保持不变时,harness 会决定账单中的很大一部分,而且收益无法直接从一个产品迁移至另一个产品。GitHub 通过一个案例证明了这一点:一项对 code review 有效的优化,却增加了 CLI 的成本。

推理正在下沉至工作站,而计算发生的位置也成为设计参数。 FastH3 让视频生成能够在 Mac 或台式机上运行;Perplexity 开放了一款仅在单一硬件类型上运行单一模型的引擎源码;Tether 发布了 17 MB 的翻译模型;i64 Systems 让 MoE 专家驻留于 NVMe;Cohere 则倡导合理确定模型规模。这一趋势与 Equinix、NVIDIA 和 Together AI 从上层推动的方向汇合:后者出于延迟和主权方面的考虑,将推理分布至 280 个数据中心。共同主线不是小型化,而是专业化:Lily 的优势源于它拒绝支持 Apple Silicon 上的 Qwen3.6-35B-A3B 之外的任何组合,而 Perplexity 的押注是,这种狭窄性是一项优势,而非限制。

控制和治理正在收紧,并且如今既通过技术落实,也通过合同落实。 GitHub 对 Fable 5.1 实施数据保留要求——豁免将在本日历年末到期——同时允许各企业团队选择默认模型,并在同一天从目录中移除六款模型。Cursor 将 agent 的执行迁入客户网络,同时明确说明转录内容仍由其处理。Google 将其网络防御模型限定为仅供 650 家选定合作伙伴使用,并附带书面运营条件。Mistral 从欧洲提供一款中国模型,并将此作为卖点。最后,BenchMIRT 提醒人们,作为这些决策部分依据的评估工具本身也值得审计:一个与通用推理的相关系数为 0.85、与安全性的相关系数为 -0.06 的社会偏见 benchmark,并没有测量其标签所宣称的内容。


来源