搜索

Google发布Gemini 4 Argon,OpenAI称挫败一起蒸馏攻击活动,Cohere推出Embed 5

ai-powered-markdown-translator

使用 gemini-3.8-flash-medium 从法语翻译成中文的文章。

在 GitHub 上查看项目 ↗

9 月 30 日星期三,Google 宣布推出 Gemini 4 Argon,这是一款前沿模型,率先向 Fairwind Program 中受信任的网络防御者部署,其输出上下文提升至 100 万 token。OpenAI 表示已挫败一起旨在提取其模型受保护推理的协同攻击活动,并将其核心归咎于与 Moonshot AI 相关的个人。Cohere 推出 Embed 5 及其专有评估方法,Ideogram 4.5 承诺可进行无伪影的连续局部重绘,HeyGen 发布了基于 MiniMax H3 构建的视频模型;在开发者方面,Claude Code 2.1.286、Zed 1.22.0 和 VS Code 1.140 于同日上线。


Gemini 4 Argon:Google最新前沿模型,优先面向网络防御者

9 月 30 日 — Google 在由 Google DeepMind 高级副总裁兼 Google 首席 AI 架构师(Chief AI Architect)Koray Kavukcuoglu 署名的博文中,宣布推出其全新前沿模型 Gemini 4 Argon。Argon 旨在为长周期复杂工作流(long-horizon workflows)提供深度推理支持,涵盖三大领域:真实环境中的软件工程、企业知识工作(法律、金融)以及网络防御。

该模型尚未向公众开放。它首先部署给 Fairwind Program 中一批受信任的网络防御者,该计划于 9 月 2 日伴随 Gemini 3.8 Flash Cyber 启动;这些测试人员与 Google 内部团队一样,接收到的模型不带网络防护栏(cyber guardrails)。开发者、企业和公众将“尽快”获得访问权限,首先从付费 API 客户和 Google AI Ultra 订阅者开始,但未公布具体日期。在此之前,Google 强化了对网络和 CBRN 领域有害请求的拒绝机制,加强了对模型思维链及操作的监控,并将高风险训练和评估隔离在密封沙盒中;该公司还表示,正参与美国政府关于模型发布前访问的自愿流程。

Introducing Gemini 4 Argon – our new frontier model. It’s built for complex workflows across coding, enterprise knowledge work, and cybersecurity defense – rolling out today to a set of trusted testers through our Fairwind Program.

🇨🇳 这就是 Gemini 4 Argon,我们全新的前沿模型。它专为编程、企业知识工作和网络防御中的复杂工作流而设计,今天起通过我们的 Fairwind Program 向一批受信任的测试人员部署。 — @GoogleDeepMind 在 X 上

定价已敲定:首发优惠价为每百万输入 token 2 美元,每百万输出 token 10 美元,与前一天推出的 GPT-6.1 Sol 价格相同;在一段未指明时长的优惠期结束后,价格将分别调整为 4 美元和 20 美元;缓存输入的费用比标准输入低 95%。输出上限从之前的 64K 提高至 100 万 token,Google 称其为行业最高水平:该模型可以在单次推理轨迹中生成数十万 token,以攻克棘手难题。

每百万 token 价格首发优惠价首发期后价格
输入2 美元4 美元
输出10 美元20 美元

Google DeepMind 页面在 19 个评估指标上将 Argon 与 GPT-6 Astra、Claude Fable 5.1 和 Claude Opus 5.5 进行了对比。Argon 在其中 13 项上斩获最高分,在 CWE-bench v1 上与 GPT-6 Astra 并列第一(68%),并在 5 项上落后。智能体编程是竞争最激烈的领域:Argon 在 DeepSWE v1.1(77.9%)和 Vibe Code Bench 上排名第一,但在 FrontierSWE v2 和 Terminal-bench 4.0 上在四者中垫底。其在知识工作方面的领先优势显着,尤其是在 Harvey 的 Legal Agent Benchmark 上(达到 19.6%,而其他三者最高仅为 6.7%),并且在 256K 至 1M token 的长上下文表现中表现优异。各行的最高得分均以粗体标出。

评估基准(领域)Gemini 4 ArgonGPT-6 AstraClaude Fable 5.1Claude Opus 5.5
Vals Index(知识工作)68.9 %63.1 %65.8 %67.0 %
AutomationBench(知识工作)51.3 %41.4 %31.4 %42.5 %
Vals Finance Agent v2(知识工作)65.4 %53.5 %58.9 %58.6 %
Harvey 的 Legal Agent Benchmark(知识工作)19.6 %5.4 %6.7 %3.8 %
DeepSWE v1.1(智能体编程)77.9 %74.1 %67.4 %74.2 %
FrontierSWE v2(智能体编程)55.0 %65.5 %56.3 %62.3 %
Vibe Code Bench(智能体编程)91.9 %89.6 %90.3 %90.3 %
Terminal-bench 4.0(智能体编程)57.4 %58.2 %57.9 %66.4 %
PostTrainBench(机器学习工程)45.3 %44.3 %40.2 %49.3 %
Terminal-Bench Science 0.1(科学与数学)57.6 %68.1 %52.6 %63.3 %
LABBench 2(科学与数学)88.8 %85.4 %68.6 %73.1 %
RiemannBench(科学与数学)76.0 %72.0 %65.6 %69.6 %
GraphWalks BFS 最多 128K(长上下文,F1)99.7 %98.7 %91.4 %90.6 %
GraphWalks BFS 256K 至 1M(长上下文,F1)84.2 %71.8 %65.0 %66.8 %
Agent’s Last Exam(计算机使用)39.5 %34.2 %—38.2 %
OSWorld-2.0 离线子集,部分得分(计算机使用)69.2 %72.6 %——
Chartography(多模态理解)71.6 %71.0 %46.2 %66.3 %
LVBench(多模态理解)91.7 %87.5 %79.7 %83.7 %
CWE-bench v1(网络安全)68.0 %68.0 %58.0 %67.0 %

在 Google 内部,已有数千名员工开始使用该模型。在 Google 开源视频解码器 libgav1 上,Argon 智能体将现有 Rust 移植版本中的 32,000 行 SIMD 代码替换为安全的 Rust:最终生成的解码器比该移植版快 2.7 倍,且视频输出完全一致。其他智能体为数据中心准备了内存优化方案,部署后预计可释放超过 300 TiB 的内存空间。在网络安全方面,Wiz 在其 Scan for Good 倡议中使用了该模型:Argon 在一款供全球医院使用的医疗软件中,发现了一个暴露敏感个人数据的严重漏洞,而此前的各类前沿模型均未能检出。

🔗 Gemini 4 Argon: our next era of frontier intelligence(Google 博客) 🔗 Google DeepMind 的 Gemini 页面及基准测试表


OpenAI称挫败一起蒸馏攻击活动,并将核心归咎于与Moonshot AI相关的个人

9 月 30 日 — OpenAI 在其 Security 专栏博文中表示,发现并化解了一起旨在提取其模型受保护推理(protected reasoning)的协同活动,即模型处理任务时生成的内部思考轨迹。该公司将其定性为对抗性蒸馏(adversarial distillation):即系统性且未经授权地利用某个模型的输出或推理过程,来训练、复现或改进另一个模型。

据 OpenAI 称,攻击者既未破解加密体系,也未入侵数据库,更没有直接访问存储的用户对话。他们通过操纵对话交互,迫使受保护的推理以可见形式重新呈现,例如复制某次对话中加密的推理内容,并在另一次对话中要求模型对其进行解密和转录。独立研究人员曾通过负责任的漏洞披露通报过类似弱点,这些弱点在 8 月 10 日提交至 arXiv 的论文《Stealing Reasoning Traces from Proprietary LLM APIs》中有详细描述;OpenAI 证实这些攻击路径确实存在。

活动阶段OpenAI 记录的日期或体量
活动开始,低体量7 月 1 日
活动高峰7 月 24 日与 25 日
高峰期间符合提取特征的请求数16,000 次,来自 4,000 多位用户
与此模式关联的群体规模超过 15,000 位用户
彻底瓦解该群体7 月 28 日

在溯源归因方面,博文措辞保持谨慎:尚无法确定所有操作者是否隶属于同一个实体,且高峰期的 16,000 次请求属于提取尝试,未必全部成功。然而,OpenAI 将该活动的核心部分归咎于与 Kimi 开发者 Moonshot AI 相关的个人。

… we attribute a core cluster of the activity to individuals associated with Moonshot AI …

🇨🇳 ……我们将活动的核心归咎于与 Moonshot AI 相关的个人…… — OpenAI,Security 专栏博文

作为应对措施,OpenAI 封禁或限制了违规账户,加强了注册和基础设施层面的控制,扩大了对关联网络的监控,并强化了跨用户、跨工作区、跨组织及跨模型系列隐藏推理的保护机制。它封堵了一条允许重放其他用户加密推理以恢复其内容的途径,并新增了能够检测并拦截可能暴露该内容的流式输出(streaming)控制机制。相关调查结果已通过 Frontier Model Forum 及政府渠道共享:OpenAI 认为,该技术不仅针对其自身模型,任何使推理具备可移植性或可重放性的系统都可能面临类似风险。该公司将对抗性蒸馏定性为一项安全及国家安全风险,因为提取出的推理数据可用于在剥离原模型防护栏的情况下训练另一个模型。这一问题并非首次出现:早在 2 月份,Anthropic 就曾将几起蒸馏活动归因于 DeepSeek、Moonshot AI 和 MiniMax;自 9 月 24 日起,Anthropic 已开始对包括推理提取在内的多个类别的被拦截请求进行计费。

🔗 arXiv 上的《Stealing Reasoning Traces from Proprietary LLM APIs》论文


Embeddings:Cohere 推出 Embed 5 与 RCP-nDCG@10 指标,Perplexity 发布 pplx-embed-v2-context-9b-preview

9 月 30 日 — Cohere 推出 Embed 5,这是一个面向企业搜索的嵌入模型家族,分为共享同一嵌入空间的两个层级:Embed 5 Pro,用于最高质量与离线索引;Embed 5 Fast,用于交互式搜索、高吞吐量 RAG 以及智能体搜索。用户可以使用 Pro 对语料库进行索引,然后使用 Fast 进行查询而无需重新索引任何内容,前提是保持相同的输出维度:在 40 个开发数据集上,Cohere 推荐的这种模式平均保留了全 Pro 系统 98.4% 的质量,而全 Fast 系统则为 96.6%。

这两款模型均可处理多达 128K tokens,支持文本、图像或将两者融合到同一个向量中,涵盖 100 多种语言,并可生成 256 到 2 048 维度的 float、int8 或二进制向量。Cohere 建议采用 1 024 维的 int8 格式,即每个向量 1 KB,而 2 048 维的 float32 格式则为 8 KB。Pro 的文本价格为每 100 万 tokens 0.12 美元,Fast 为 0.08 美元(低三分之一),文档吞吐量平均高出 2.4 倍;两者的图像计费均为每 100 万 tokens 0.40 美元。Embed 5 即日起可通过 Cohere API、Model Vault、Microsoft Foundry 和 Amazon SageMaker 以及 North 获取,并可通过 vLLM 进行私有化部署。

基准测试(指标)Embed 5 ProEmbed 5 Fast其他引用的模型
ViDoRe V3,8 个领域 (RCP-nDCG@10)85,884,5Voyage 4 Large 83,7;Gemini Embedding 2 83,2;OpenAI text-embedding-3-large 75,5
FinanceBench (RCP-nDCG@10)80,180,0Pro 领先 OpenAI text-embedding-3-large 21,4 个百分点
FinQA (RCP-nDCG@10)90,088,8—
ViDoRe V3 Finance (RCP-nDCG@10)85,083,9—
解析 PDF,测试套件平均值 (RCP-nDCG@10)84,883,4Voyage 4 Large 83,6;Gemini Embedding 2 80,8;Embed 4 78,6
文本与图像融合,5 个数据集 (nDCG@10)82,381,2Gemini Embedding 2 61,3
页面图像,5 个金融数据集 (nDCG@10)77,073,2Embed 4 71,1;Voyage Multimodal 3.5 70,1;Gemini Embedding 2 56,7
5 种欧洲语言 (nDCG@10 或 RCP-nDCG@10)77—Voyage 4 Large 76;Gemini Embedding 2 73

这些分数大多以 RCP-nDCG@10 表示,这是 Cohere 于同日发布的评估方法(见下文):博文中的一条附注指出,它对一组固定的候选集进行重新排序,因此衡量的是重排序质量,而非一级检索。第二个多语言表格值得完整阅读:Cohere 在其中强调了相比 Embed 4 的进步,波斯语提升高达 13 个百分点,但在所列的 10 种语言中,Gemini Embedding 2 在 9 种语言上领先于 Embed 5 Pro(中文是唯一的例外),Voyage 4 Large 则在 5 种语言上领先。Cohere 将于 10 月 8 日在 X 上举办一场关于 Embed 5 的直播分享。

🔗 Cohere 的 Embed 5 博文 · @cohere 在 X 上的公告

RCP-nDCG@10:Cohere 用于评估 Embed 5 的指标

9 月 30 日 — Cohere 还发布了 RCP-nDCG@10(Rubric-Calibrated Preferences nDCG@10),这是其搜索评估方法。出发点在于:MTEB 和 BEIR 的评估指标 nDCG 是将结果与预先标注的文档列表进行比对,而该列表必然是不完整的,以至于从未被标注过的相关文档无法获得任何分数;在 Cohere 的研究中,被标记为不相关的文档中有 28% 实际上被人类判定为有用。RCP-nDCG@10 将判定交给一个经过校准的 AI 裁判,该裁判针对每个查询回答相同的 5 个“是/否”问题,并成组比较文档。在 46 位标注者针对 289 组对决进行的双盲验证中:当两个指标给出不同的胜者时,人类在 70% 的情况下支持 RCP-nDCG。相关论文、代码和数据已公开发布,MTEB 的主要维护者宣布将对其进行集成。Cohere 表示已针对该指标优化了其第五代 Embed 和 Rerank(后者尚未公布发布日期),并提醒用户这些模型仅在传统 nDCG 指标上衡量时可能并不总是显得最为出色。

🔗 Cohere 的 RCP-nDCG@10 博文 · GitHub 上的代码与数据

Perplexity 发布 pplx-embed-v2-context-9b-preview 与 context-bench 基准测试

9 月 30 日 — Perplexity 在 Hugging Face 上以 MIT 许可证预览版发布了 pplx-embed-v2-context-9b-preview,这是一款上下文嵌入模型:文档的每个片段都在结合完整文档视野的情况下进行编码,使得提及“她”的段落依然能与正确的实体关联。该模型不再针对每个查询仅依赖单个“黄金片段”(gold passage),而是向一个教师模型学习——即 Perplexity 的上下文压缩模型,该教师模型会对文档的每个 token 打分:模型由此学会检索答案以及证明该答案的段落。在博文共同署名方 turbopuffer 的私有基准测试 context-bench(2 099 个查询,38 894 篇文档)的双盲提交测试中,它超越了 voyage-context-4;在 ConTEB 上,它获得了最高的平均分,尽管并未在所有任务中均拔得头筹。Perplexity 提醒称模型权重和接口可能还会发生变动,并正在准备通过其 API 提供访问,目前暂未公布日期。

Perplexity 发布的指标pplx-embed-v2-context-9b-preview与 voyage-context-4 的差距
context-bench 上的答案召回率(K = 10)45,5 %+14,4 个百分点
context-bench 上的证据召回率(K = 10)40,6 %+5,0 个百分点
单个向量存储占用(1 024 维,int8)1 Ko比 float32 格式的 voyage-context-4 少 8 倍

🔗 Perplexity Research 博文 · Hugging Face 上的模型


Ideogram 4.5:专为连续编辑设计的图像编辑模型

9 月 30 日 — Ideogram 推出 Ideogram 4.5,并将其誉为“最精准的编辑模型”。其出发点在于:在每次编辑时,图像模型都会增加伪影、像素偏移和色彩偏差,以至于图像在经过多次处理后很快就变得无法使用。Ideogram 4.5 旨在消除这种累积效应,使多轮编辑(multi-turn editing)成为可能。

Introducing Ideogram 4.5, the most precise edit model. With each edit, leading models add artifacts, pixel shifts, and color changes. Ideogram 4.5 eliminates artifact buildup, making multi-turn editing possible. Live in Ideogram, the API, and launch partners. Open weights soon.

🇨🇳 隆重推出 Ideogram 4.5,最精准的编辑模型。在每次编辑时,前沿模型都会增加伪影、像素偏移和颜色变化。Ideogram 4.5 消除了伪影的累积,使多轮编辑成为可能。已在 Ideogram、API 及首发合作伙伴处上线。开源权重即将推出。 — @ideogram_ai 在 X 上

为了支持这一观点,Ideogram 发布了与 GPT Image 2.5 Sunburst、Nano Banana Pro 和 Nano Banana 2 进行相同连续编辑的并排对比,据其称,这些竞品的输出在几次编辑后就变得无法使用。该对比基于视觉展示,没有具体数值评分。示例涵盖了色彩与光影(阴影、倒影和高光随之调整而不会改变构图)、文本修改、产品摄影、室内设计、逐步老照片修复、从草图或深度图生成图像以及重新构图裁剪。

该模型还引入了全分辨率编辑(Zoom editing):可在不降低图像分辨率的情况下对高分辨率图像的某个区域进行编辑(在 Ideogram 的示例中为 24.2 百万像素,4 016 × 6 016 像素),其边缘得以完整保留以便无缝拼合。据 Ideogram 称,尽管该模型专为定向编辑设计,但在通用编辑方面也表现出色。

公告内容已知信息
可用性9 月 30 日起在 Ideogram 和 API 中上线
首发合作伙伴Pika 与 Luma,均于同日宣布
开源权重承诺“即将推出”,如同 6 月发布的 Ideogram 4.0 权重
定价尚未公布

🔗 Ideogram 4.5 模型页面


HeyGen Video:基于 MiniMax H3 构建的视频模型,通过 API 开放

9 月 30 日 — HeyGen 推出 HeyGen Video,这是一款面向希望以较低成本获得生产级质量视频的企业而设计的视频生成模型。该模型基于 MiniMax H3 构建并由 HeyGen 进行后训练,可根据文本或图像生成视频,并在同一次调用中生成音频,支持通过 HeyGen API 以及 OpenRouter、Runware 和 ComfyUI 使用。

在定价方面,存在三种不同数据。根据目录页面的信息,截至 10 月底,起步价为每秒 0.01 美元,即在 0.02 美元标准价格的基础上提供 50% 折扣。而其对比表格采用的是首发促销前的 768p 带音频目录价:每秒 0.03 美元。即便按这一价格计算,HeyGen Video 依然是受对比模型中最便宜的。

对比模型每秒目录价(768p,音频)HeyGen 内部 Elo 分(HeyGen Video = 1 000)
HeyGen Video0,03 美元1 000
Seedance 2.00,303 美元955
H3 Max0,08 美元952
H3 Max Turbo0,04 美元920
H3 Max balanced0,08 美元860
Kling 3.0 Pro0,168 美元857
Veo 3.10,40 美元744

在质量方面,HeyGen 依靠根据 Artificial Analysis Arena 查询开展的内部评估(4 800 次投票),将其模型的 Elo 分定为 1 000。在针对 H3 Max 的双盲偏好测试中,650 次投票中有 55.8% 投给了 HeyGen Video,置信区间在 49% 至 62% 之间,并未排除持平的可能。对于一个 10 秒的图生视频片段,扩散 Transformer 的推理时间降至 3.7 秒,相比之下 H3 Max Turbo 为 4.1 秒,H3 Max 为 8.3 秒(不含字幕生成时间)。

MiniMax 对此次发布表示祝贺,并于同日重点推荐了另一款基于 H3 衍生的模型:Creatify 的 Boreal-H3,这是一款针对广告优化的视频模型。

🔗 HeyGen Video 目录 · @HeyGen 在 X 上的公告


通用助手与智能体:Gemini 的 Skills、Manus Flex 与 Grok Bot

Gemini 应用推出 Skills,将取代 Gems

9 月 30 日 — Google 在 Gemini 应用中推出 skills:这些是一次性保存的指令,只需输入正斜杠加其名称即可调用。Gemini 还可以根据对话内容创建 skills,并在提示词匹配时自行触发;多个 skills 可以叠加使用,且每个 skill 均可附带参考文件(纯文本、PDF、图像)。该功能此前已在 Gemini Spark 中上线,现已面向全球所有 Google AI 订阅层级的 Gemini 聊天推出,目前仅限 18 岁及以上用户使用;Workspace 客户将在未来几周内陆续获得支持。Skills 将取代 Gems,个人账户的 Gems 将从 11 月起停止服务,Workspace 商务版、企业版及非营利组织版将于 2027 年 3 月停用,教育版将于 2027 年 6 月停用,届时将进行自动迁移。迷你应用创建工具 Opal 也将于 11 月关闭,同样关闭的还有“Gems by Google Labs”,后者将不会被迁移。

🔗 Let skills in Gemini tackle your most repetitive tasks(Google 博客)

Manus Flex:在 Manus 智能体中使用自带的 API 密钥

9 月 29 日 — Manus 推出 Manus Flex,允许使用受支持的推理服务商的 API 密钥来为 Manus 提供支持(bring your own API key)。此前,Manus 由自身选择模型,并提供智能体测试架构及基础设施;有了 Flex 后,服务商的密钥可用于驱动相同的项目、工具、执行环境及智能体工作流,并支持自主选择主模型和推理努力程度。计费方式分立:推理费用由服务商直接收取,而执行任务所调用的其他服务及基础设施则继续消耗 Manus 积分。OpenRouter、Fireworks 和 Modal 是推理合作伙伴计划(Manus Flex Inference Partner Program)的首批三家成员。该博文发布于 Manus 2.0 上线次日,未提供具体的套餐方案、价格或模型列表。

🔗 Introducing Manus Flex

Grok Bot 将代码任务托付给 Cursor 并管理拉取请求

9 月 30 日 — 在发布 Team Bots 两天后,SpaceXAI 强化了面向软件开发的 Grok Bot。在 @bot 账号的一条推文串中,该开发商宣布其 Bots 可以将代码任务委托给 Cursor,通过 GitHub 和 Origin(后者未作具体说明)插件管理拉取请求,并分享其构建成果的视频演示。SpaceXAI 还以可安装模板(templates)的形式发布了其自身工程团队使用的 Bots,每个 Bot 都自带其专属 skills、日常流程与连接器。推文串未说明具体套餐、价格或日期,x.ai 上亦未发布配套博文。与 Cursor 的联动并非新鲜事:9 月初,Grok Bot for Enterprise 曾向 Grok 和 Cursor Enterprise 客户免费提供两周;而现在的变化在于,Bot 能够自主委托代码编写工作。

🔗 @bot 在 X 上的推文串


机器人与世界模型:Runway 的 Praxis-1、Ai2 的 MolmoAct 2 与 NVIDIA 的 Physis-Lang

Runway 推出开源权重世界动作模型 Praxis-1

9 月 30 日 — Runway 推出了首个开源权重世界动作模型(world action model)Praxis-1,旨在控制真实机器人。它基于与其世界模型(如 Solaris 或 GWM Worlds 2)相同的视频预训练,致力于成为面向机器人开发者和研究人员的通用策略模型。Runway 的赌注在于:机器人演示数据稀缺,而视频数据几乎无限。在演示中,相同的策略无需重新训练即可从演播室切换到厨房。目前尚无任何内容可供下载:Praxis-1 正由 Noble Machines、Standard Bots 和 Ultra 分别在其自有硬件上进行测试,包括权重在内的公开版本预计将在未来几个月内发布。

Runway 发布的指标公布的结果
世界模型模拟与真实结果之间的相关性0,95
使用网络视频微调后的最终放置误差16,1 cm
使用遥操作机器人视频的相同误差16,0 cm

🔗 Runway Research 上的 Praxis-1

Ai2 的 MolmoAct 2 在经基准组织者微调后领跑 Reality Check

9 月 30 日 — Ai2 宣布,其完全开源的机器人模型 MolmoAct 2 在真实环境操作独立基准 Reality Check 的总体成功率上排名第一,不过有一个重要细节:参赛模型由该基准的主办方 Poke & Wiggle 在测试任务上进行了微调。Reality Check 由该公司在前一天推出,在慕尼黑德意志博物馆安装的 FR3 Duo 工作站上进行了 14,400 次真实机器人执行,涵盖十种环境(如分拣螺钉、插入直流连接器、用螺丝刀打开工具箱等)。仍有两个方向“即将推出”:放置在训练区域之外的物体,以及在工作站 100 小时数据上进行中期训练。

评估模型总体成功率每个环境约 10 次演示后的成功率每个环境约 300 次演示后的成功率
MolmoAct 228 %4 %44 %
Pi 0.521 %5 %33 %
DiT-Flow19 %2 %29 %
GR00T N1.712 %4 %19 %

🔗 Ai2 的推文 · Reality Check 排行榜

Physis-Lang:向世界模型解释物理规律的视频字幕

9 月 29 日 — 来自 NVIDIA、MIT 和牛津大学的研究人员发布了 Physis-Lang,这是一个为视频字幕添加物理推理以改进世界模型的框架。字幕明确指出了原因、起作用的定律和结果;专业评判机制会发现缺失或未经证实的陈述,一个智能体负责优化字幕指令,模型的失败案例则用于寻找能够弥补其不足的视频。据 NVIDIA 称,仅在提示词中添加这种推理而无需重新训练,就能使 Cosmos 3 的 PhyGenBench 得分提高 5.62 分。经过训练后,应用于 Cosmos3-Super 和 Cosmos3-Nano 的 Physis-Lang 在 Physics-IQ Verified 图像转视频排行榜中包揽前两名(分别为 48.2 和 43.3,而此前最高分为 42.7)。PhyGenBench 和 VideoPhy-2 由 GPT-5.5 评分,而在完整的 VideoPhy-2 数据集上 Veo 3.1 仍保持微弱优势。

视频物理基准Cosmos3-NanoVeo 3.1Physis-Lang 基于 Cosmos3-Nano
PhyGenBench61,6765,6371,04
Physics-IQ Verified40,2334,9943,41
VideoPhy-2 Hard48,3158,4362,36
VideoPhy-2 完整集60,4168,8768,02

🔗 Physis-Lang 项目主页 · @NVIDIAAI 在 X 上的公告


开源模型:Hunmin-397B-A17B-CUA 与 JEV-27B-VL

Hunmin-397B-A17B-CUA 将 Qwen-CUA 的智能体能力移植至 3970 亿参数的 MoE 上

9 月 30 日 — 在 Hugging Face 社区博客上,hojun Lee 详细介绍了 Hunmin-397B-A17B-CUA,这是由 mncai 组织在 Apache-2.0 许可下发布的一款计算机使用(computer use)模型,不过作者本人也提出了一点保留意见:评估均为内部自测,智能体基准仅运行单次,与公开发布的排行榜不具可比性(基座模型在 OSWorld 上获得 48.16 分,而 OSWorld-Verified 公布的得分为 62.2 分)。该模型基于 Qwen3.5-397B-A17B,这是一个拥有 170 亿激活参数的混合专家(MoE)模型,整个项目仅在一个配备 8 张 B200 的单节点上完成。团队计算了基座模型与已具备专业能力的 Qwen-CUA 之间的权重差异,仅将低秩版本移植到选定的模块上:仅凭这一迁移就使 OSWorld-316 得分从 48.84 提升至 68.25,且没有继承 Qwen-CUA 在视觉定位方面的弱点。微调及随后的 GRPO 强化学习又提升了 4.3 分。

评估基准(自测协议)Qwen3.5-397B 基座Hunmin-CUAQwen-CUA(源模型)
OSWorld,360 项任务48,1670,4577,12
WindowsAgentArena,153 项任务41,7750,8556,68
ScreenSpot-Pro72,7475,6162,20
KMMLU-Pro(韩语)77,9176,1271,41

🔗 Hunmin-CUA 博客文章 · Hugging Face 上的权重

AutoTrust AI 发布开源决策模型 JEV-27B-VL,兼具图像评判能力

9 月 30 日 — AutoTrust AI 在 Apache-2.0 许可下发布了 JEV-27B-VL,这是其于 9 月 27 日推出的开源决策模型 JEV-27B 的视觉版本。向其展示图像和文本并提出问题,它只需单次前向传递即可在大约一百毫秒内输出每个选项经过校准的概率;当问题需要时,它会一边观察图像一边进行逐步推理。然而,其决策头在训练期间并未接触过任何图像。主要测试:在公开短视频应用数据集 MicroLens 上,它仅根据缩略图为 200 名用户对 20 个候选视频进行排序,其 AUC 与在 59,045 名用户上训练的协同过滤不相上下,且在 Top 5 命中率上表现更佳。作者提醒,该结果仅基于 200 名用户的单一数据集得出。

MicroLens 上的推荐方法AUCTop 5 中的优质视频
JEV-27B-VL,仅凭缩略图,无交互数据0,72759 %
在 59,045 名用户上训练的协同过滤0,72849 %
JEV-27B-VL,仅凭标题0,64946 %
随机顺序0,48921 %

🔗 JEV-27B-VL 博客文章


排行榜:Hugging Face 的 Open TTS Leaderboard 与 LILT 的 AURORA

Hugging Face 推出开源语音合成排行榜 Open TTS Leaderboard

9 月 30 日 — Hugging Face 推出了 Open TTS Leaderboard,这是一个专注于开源及多语言模型的语音合成(text-to-speech,TTS)排行榜。Hub 上拥有超过 8,000 个 TTS 模型,但作为参考标杆的投票竞技场往往难以跟上更新节奏,且开源模型代表性不足:根据博文,在 Artificial Analysis 排名的 92 个模型中,仅有 16 个采用开源权重。因此,该排行榜用客观指标取代了人工投票:清晰度(提示文本与 Qwen3 ASR 转录文本之间的词错误率或字符错误率)、速度(在 H200 和 CPU 上的批量推理及首音延迟)以及克隆声音的保真度(WavLM 相似度)。评估一个模型仅需数小时,而非数周的人工投票。在英语方面,Kokoro-82M、supertonic-3 和 Fish Audio 的 s2-pro 处于领先地位;在多语言方面,OmniVoice、s2-pro 和 Fun-CosyVoice3-0.5B 领跑。作者提醒,目前尚未对自然度和表现力进行测量,并将在“近期”发布其评估脚本。

🔗 Open TTS Leaderboard 博客文章 · Hugging Face 上的排行榜

LILT 推出多语言智能体任务排行榜 AURORA

9 月 30 日 — LILT 推出了 AURORA 排行榜,旨在评估顶尖模型在非英语智能体任务上的表现,所有任务均由母语专家设计并验证,未使用机器翻译。首发包含四个基准:涵盖 10 种语言、324 项代码任务的多语言 Terminal-Bench,用于客户支持的多语言版 τ³-bench,用于长上下文指令遵循的 MultiChallenge,以及用于智能体推理的 GAIA-v2-LILT。Claude Opus 5.5 在多语言 Terminal-Bench 中拔得头筹,并在 τ³-bench 的全部 5 种语言中均位居榜首。在 GAIA 上,与机器翻译相比,模型在经 LILT 审核的版本上平均得分高出 20.7 分:LILT 认为,这一差距反映了翻译所引入的误差。在韩语或阿拉伯语中,同一段对话消耗的 token 数量也比英语多出约 1.4 倍。

评估模型(多语言 Terminal-Bench,节选)平均成功率
Claude Opus 5.5 (effort high)76,4 %
Claude Opus 5 (effort high)73,5 %
Gemini 3.8 Flash67,3 %
GPT-6 Sol64,8 %
Command A+4,3 %

🔗 LILT 的 AURORA 博客文章 · AURORA 排行榜


公共部门与企业:Claude for Government、Anthropic 采购智能体及 OpenAI 携手 America’s SBDC

Claude for Government 正式公开发布

9 月 30 日 — Claude for Government 结束公测:Anthropic 宣布其面向美国联邦及州政府机构正式公开发布。该平台自 7 月起进行公开测试,在通过 FedRAMP High 认证的环境中提供 Claude 的代码与智能体工作能力,功能与商业客户相当;Claude Code CLI 与 Claude for Microsoft 365 也在此迎来抢先体验。无需按席位购买许可证:各机构按固定档位根据用量付费,并设有严格上限以防止超出承诺预算,同时 SCIM 用户组映射按席位层级设定速率限制、金额上限和允许使用的模型。在管控方面,Anthropic 端的敏感操作需要双人审批,用量导出仅包含计量数据,对话历史记录则保留在由机构管理的设备上。Anthropic 未公布任何定价。

🔗 Claude for Government 现已正式公开发布

Anthropic 利用基于 Managed Agents 构建的智能体接待商业需求

9 月 30 日 — Anthropic 分享了其销售团队如何利用基于 Claude Managed Agents(测试版)构建的采购智能体,重构每月数以万计的入站咨询接待流程。该智能体部署于 Contact Sales 和 Pricing 页面、claude.ai 以及电子邮件中,它会询问几个问题,推荐套餐及席位数量,随后引导完成购买、附带完整历史记录移交给销售人员,或仅解答疑问;客户也可从一开始就选择人工客服。根据 Carl Johnson 撰写的博文,该智能体每天进行数千次对话;由其转交的潜在客户转化为商机的比例比原有表单提升了一倍以上,成单周期缩短了约五天,且需要销售人员介入才能促成交易的对话比例下降了约一半。第一版仅由一名工程师在几周内搭建完成;该智能体经常建议小型团队选择 Team 方案而非 Enterprise 方案,Anthropic 对此完全欣然接受。

🔗 Anthropic 销售团队如何利用 Claude Managed Agents 重构入站流程

OpenAI 携手 America’s SBDC 并发布小型企业报告

9 月 30 日 — OpenAI 与美国小型企业发展中心(America’s SBDC)全国网络达成合作,该网络每年为 100 万名创业者提供支持。在第一阶段,通过 9 月 23 日试运行的 OpenAI Academy 社区培训师计划(Community Trainer Program),OpenAI 计划培训约 150 名顾问,这些顾问将在 SBDC 网络中主持 3 小时的研讨会,目标是线下触达至少 1,000 家小型企业。同一天发布的报告《小型企业,更大能力》(Small Businesses, Bigger Capabilities)量化了使用情况:在 9 月 9 日至 15 日这一周内,约有 400 万名 500 人以下企业的员工使用了 OpenAI 的产品,其中近五分之一来自员工人数少于 10 人的企业。8 月份,智能体输出 token(尤其是 ChatGPT Work 和 Codex)占小型企业总输出 token 的三分之二,而 4 月份这一比例仅为三分之一。

🔗 OpenAI 关于小型企业的博文


Runway Ads:面向效果广告的自主引擎

9 月 30 日——Runway 推出 Runway Ads,全面端到端接管付费广告活动的创意环节。用户只需连接广告账户和品牌资产包:该工具基于 Runway Agent 构建,可生成视频和图像素材,将经批准的变体发布到 Meta、Google 和 TikTok,监测其效果,并围绕带来支出的素材生成下一波创意。它根据团队设定的规则对每个素材进行本地化(包括屏幕上的文字),针对每种格式调整尺寸,进行自动化品牌审查,并遵循预算限制。人工批准默认启用;也可按广告活动或变体类型开启自动发布。

Runway 自 7 月以来的内部指标文章中公布的结果
每周广告数从 77 增加到约 900
广告支出回报率翻倍
转化率约 +34%,点击率保持稳定
每位关注者成本−41 %

Runway Ads 目前正面向精选的企业合作伙伴进行试点。发布推文承诺将在未来几周广泛推广,并声称自 7 月以来该工具还助力增加了 1 亿美元的 ARR(年度经常性收入),而博文中未提及这一数据。

🔗 Runway Ads 博文 · @runwayml 的推文


ElevenLabs 在 3 亿美元要约收购后估值达到 220 亿美元

9 月 30 日——ElevenLabs 完成了一项针对员工的 3 亿美元股票要约收购(tender offer),公司估值达 220 亿美元,是 2 月份 D 轮融资估值的两倍。该交易由 Wellington 和 T. Rowe Price 领投;EQT、Goldman Sachs、GIC、OTPP、Sapphire Ventures 以及 BDT & MSD 作为新投资者入局,现有投资者 Andreessen Horowitz、Lightspeed 和 ICONIQ 也参与其中。企业客户占其营业收入的 55%:ElevenAgents 每周处理超过 1500 万次对话,是 2 月份的三倍,其年度经常性收入在此期间增长了两倍多。根据对其客户的分析,语音智能体解决请求的速度比聊天智能体快 31%。该公司在完成估值为 900 万美元的首轮融资四年后,现已拥有超过 800 名员工。

🔗 ElevenLabs 博文


Vera Rubin NVL72 在 CoreWeave 投入生产,Cognition 测得吞吐量最高提升至 4.8 倍

9 月 30 日——在旧金山举行的 CoreWeave Fully Connected 大会上,NVIDIA 详细介绍了 Vera Rubin NVL72 在 CoreWeave 的量产部署:该平台配备 Spectrum-X Ethernet 102.4T 网络,现已在 CoreWeave Cloud 上可用,后者在本月早些时候接收了首批生产机架。Devin 的开发商 Cognition 是首个在其上运行生产负载的客户:在基于 FrontierCode 任务的初步测试中,其测得 SWE-2 推理的总 token 吞吐量相比 GB200 NVL72 最高提升至 4.8 倍。CoreWeave 还将提供专为智能体设计的 Vera CPU:每个机架拥有 128 颗 CPU 和 11,264 个核心,足以同时运行 11,000 多个隔离环境,且智能体沙箱的启动速度提升三倍以上。最后,CoreWeave 还推出了 CoreWeave Forge,它汇集了 Weights & Biases、OpenPipe 和 marimo,用于将生产数据闭环反馈至训练;据称其无服务器强化学习(serverless RL)速度提升 1.4 倍,成本降低 40%。

🔗 NVIDIA 关于 CoreWeave 与 Vera Rubin 的博文


代码智能体与开发工具:Claude Code 2.1.286、Zed 1.22.0、Gemini CLI、VS Code 1.140、HydraFusion 及 gcloud MCP 服务器

Claude Code 2.1.286:VS Code 中的书签、重试上限及收紧的 bare 模式

9 月 30 日——Claude Code 2.1.286 于 UTC 时间 19:10 发布,包含 88 项更新,其中包括 49 个修复。当多个请求堆叠时,权限提示会显示其当前位置(“2 of 5”);VS Code 扩展新增了书签(bookmarks)功能,以便将 Claude 的回复保留在侧边面板中,并新增了一个 Questions 行以回顾 Claude 提出的问题及所选回答,还在问题卡片中提供了选项预览。两项重要的行为变更:现在由单一限制统辖模型调用的重试次数,默认设置下最多 14 次请求;且 --bare 现在仅连接命令行中指定的 MCP 服务器,不再包含系统提示词或后台任务。如果存在名为 verify 的 skill,Claude 会被提示在每次提交前执行它(文档或测试除外),此外插件会拒绝作为 git 仓库或文件夹的 npm 源。最后,当 API 拒绝默认模型时,Claude Code 会在同级别的上一代模型上重试一次,而不是在每个轮次中都直接失败。

🔗 Claude Code 2.1.286 版本说明

Zed 1.22.0:每个子智能体可独立配置模型

9 月 30 日——Zed 发布稳定版 1.22.0,重点聚焦子智能体:工具 spawn_agent 新增可选参数 model,用于在不同于父级配置或继承的模型上启动子智能体,并且每个子智能体的卡片都会显示所使用的模型。子智能体还会自动压缩上下文,据 Zed 称,这使其能够处理更长时间的任务。模型方面,GPT-6.1 Sol 支持通过 OpenAI API 密钥以 BYOK 形式接入,Grok 4.7 作为 SuperGrok 和 xAI 的推荐模型进入稳定版,OpenCode Zen 和 Go 的模型列表现可动态获取。该版本修复了终端中每完成一条命令约泄漏 2 MB 内存的问题,并更改了一个快捷键:在所有平台上关闭活动停靠面板的操作均改为 ctrl-alt-w。总计包含 18 项新功能和 37 个修复。

🔗 Zed 1.22.0 版本说明

Gemini CLI:v0.62.0 迎来稳定版,预览版无需确认即可执行计划

9 月 29 日——Gemini CLI 在傍晚(UTC 时间)发布了两个版本。v0.62.0 于 21:17 进入稳定版:其 19 项更新涵盖了 9 月 16 日至 24 日期间推出的预览版及每夜构建版(MCP 工具调用的结构化标题、保留 OAuth 刷新令牌(refresh token)、Gemini 3.8 Flash 和 3.5 Flash Lite)。新特性出现在 20:58 发布的预览版 v0.63.0-preview.0 中:在非交互模式下,智能体现在编写并执行其计划而无需等待确认(PR 29539),而此前 Plan Mode 的指令仅会让其回复一条对齐确认消息,不调用任何工具。将 maxChars 限制设为 0 或负数还会禁用工具输出的截断(PR 29542)。9 月 30 日的每夜构建版开启了 0.64.0 系列:在 ACP 模式下,CLI 终于开始汇报标准用量,此前根据 PR 29549,Zed 或 OpenHands 等客户端的高估计费达到了约 3 倍。

🔗 Gemini CLI v0.63.0-preview.0 · Gemini CLI v0.62.0

VS Code 1.140 引入 Copilot Harness

9 月 30 日——Visual Studio Code 1.140 发布稳定版,正式引入 Copilot Harness(Copilot harness):它基于 Copilot SDK 构建,使 VS Code 智能体具备 GitHub Copilot 应用及 Copilot CLI 的行为与能力,并在基于 Agent Host Protocol 的专用宿主进程中运行,从而允许多个窗口接入同一会话;版本说明提示,部分用户可能已默认启用了该功能。在实验性功能方面,多文件夹会话使每个聊天拥有专属的文件夹或 worktree,并且智能体可以将任务委托给远程主机,远程主机根据操作系统、内存、CPU 数量和模型进行选择。面向企业新增了三项管控能力:在聊天中说明管理员要求的最低版本要求、通过托管设置(autoTier)指定 Auto 模式的默认级别,以及将用户身份添加到 Copilot 的 OpenTelemetry 数据中(该选项默认关闭)。

🔗 VS Code 1.140 版本说明

HydraFusion 登陆 VS Code 及 GitHub Copilot 应用

9 月 30 日——GitHub 将于 9 月 4 日在 Copilot CLI 中推出的多模型编排架构 HydraFusion 扩展至 VS Code(1.140 及以上版本或 Insiders)以及 GitHub Copilot 应用(仍处于研究预览阶段)。HydraFusion 在选择器中可像模型一样被选中,但它本身并不是模型:它将工作流选择视为一个优化问题,并在三种方案中采用其一。在 Single 模式下,由单一模型完成任务;在 Cascade 模式下,高效模型进行起草,由质检环节决定采纳结果或上报升级至更强模型;在 Critique 模式下,来自另一模型家族的只读审查模型负责审阅,随后起草模型进行一次修订。Auto 模式是为每个请求选择一个模型,而 HydraFusion 则是在同一轮次内协调多个模型。它面向 Copilot Pro、Pro+、Business 和 Enterprise 用户开放,其中 Business 和 Enterprise 需由管理员启用预览版;GitHub 未公布新的数据指标。

🔗 VS Code 和 GitHub Copilot 应用中的 HydraFusion

Google Cloud 公测可执行 gcloud 和 bq 的远程 MCP 服务器

Google Cloud 在其托管的远程 MCP 服务器中新增了处于公开预览阶段的 Google Cloud CLI remote MCP server。它将 gcloud 和 bq(BigQuery)命令行工具的数百条命令整合在两个 MCP 工具(run_gcloud_command 和 run_bq_command)之后。Google 为选择命令行给出了两点理由:一条命令封装了若使用 API 则需自行编排的多步操作,且模型已在这些命令的公开文档上进行了充分训练。远程服务器避免了在智能体环境中安装 CLI,从而向诸如 Gemini Enterprise 等基于 Web 托管的智能体平台开放了这些操作。命令在隔离沙箱中运行,位于网络受限的代理之后且不携带环境凭据(ambient credentials),每条命令均以调用方身份的 IAM 权限执行,并通过 Agent Identity 或 OAuth 2.0 进行身份验证;Model Armor 可过滤提示词和回复,且每次调用均可记录在审计日志中。服务器本身不收取额外费用:仅对创建的资源及可能产生的数据传输收费。

🔗 借助 Google Cloud CLI remote MCP server 赋能您的智能体(Google Cloud 博客)


简讯

  • Codex CLI 0.159.2 — 于 9 月 29 日 23:57 UTC 发布,该版本仅包含一项反向移植修复:在 Windows 下,当 Codex 在其沙盒中启动后台进程或命令时,控制台窗口不再闪烁。🔗 来源
  • Amp 中的 Plaid — Amp 中使用 GPT-6 Astra 的模式引入了基于 OpenAI 极速档的 Plaid:请求速度提升最高达 6 倍,每 token 成本增加 6 倍,仅适用于 Amp 提供的推理;子智能体保持在 fast 或 standard 速度,Amp 未公布具体价格。🔗 来源
  • Warp 与 Factories as Code — Warp 将其软件工厂的配置形式称为“智能体领域的 Terraform”:通过代码仓库来描述智能体、自动化、访问权限及指标。factory.yaml 格式始于 8 月底;交互式指南详细介绍了对 AWS 或 GCP 的联合访问、Webhooks 以及与 Slack、Linear 或 Jira 的集成。🔗 Warp 帖子 · 🔗 配置指南
  • Devin 在 Crosby 的应用 — 在 Cognition 的一项案例研究中,纽约律师事务所 Crosby(拥有十几名工程师,服务 50 多位律师)让 Devin 负责事件的初步响应:每天审查 20 到 40 个缺陷与告警,大部分在约 5 分钟内处理完毕,并将 Sentry 干扰噪音减少了至少 50%。🔗 来源
  • claude.dev — Anthropic 正式推出 claude.dev,作为基于 Claude 构建应用的开发者的基地:涵盖深度技术解析、Claude Code 与 API 指南、Agents、Engineering、Playbooks 和 Skills 专栏,以及一个彩蛋 Terminal 页面。该网站的部分文章自 9 月 22 日起就已被转载分享。🔗 来源
  • ChatGPT Sites 支持编辑 — 根据 9 月 29 日的发布说明,已发布的 Site 可以通过 Edit site 进行修改,Plus 和 Pro 用户可通过 Automations 进行定时调度;在 Enterprise 版本中,私有 Sites 可依托已连接的应用运行,并在每个插件中提供 Allow use in Sites 设置,默认处于禁用状态。🔗 ChatGPT 发布说明 · 🔗 Enterprise 与 Edu 说明
  • Kimi Work 3.2.15 — 9 月 30 日发布的版本支持在内置浏览器中对 Notion 和飞书文档进行人机协同编辑,默认折叠智能体的运行过程,并修复了同时编辑 PPT 时的文件损坏问题。🔗 来源
  • Cue 管理财务 — 随 Manus 2.0 推出的个人智能体应用现在可追踪订阅与支出趋势,并通过 Plaid 将银行账户设为自动运行模式;未指明支持的国家、方案或条件。🔗 来源
  • Genspark 上线 GPT-6.1 Sol — Genspark 在 GPT-6.1 Sol 发布次日便在 AI Chat、Code Agent 和 Claw 中开放了该模型,沿用了 OpenAI 的宣传点(接近 Astra 的智能水平,而 API 价格仅为其五分之一),未说明套餐要求或积分消耗。🔗 来源
  • Qwen3.8-27B-pi — Thomas Kim 在 Apache-2.0 协议下发布了针对 Pi harness 的 Qwen3.8-27B 微调版本,该版本重新理顺了思考强度(effort levels):在 Terminal-Bench 2.1 上,medium 级别的表现追平了基座模型的 xhigh 级别(89 项任务中完成 67 项),且输出 token 减少约 41%。🔗 来源
  • Nebius 上线 Qwen3.8-27B — Qwen 转发了其 270 亿参数密集模型上线 Nebius Token Factory 的消息(于 9 月 28 日宣布),适用于代码、研究和智能体工作流;未公布价格或吞吐量。🔗 来源
  • Bekko System One v0 — 馆野祐一发布了三个参数量分别为 17M、68M 和 400M 的决策模型,其中最小的两个可在浏览器中运行,同时发布了基准测试 S1MB:400M 模型得分 50.60,而 Jev 1.13 为 59.59,但在泛化能力测试中为 54.48 对比 96.27。🔗 来源
  • ZooWork Instinct Tuned 4B — SRP 在 Apache-2.0 协议下发布了一个 40 亿参数的决策模型,基于 Qwen3.5-4B 构建,单次前向传播即可对各选项打分而无需解码:作者指出,在开发过程中使用过的 JevBench 公开任务上取得了 231 项中完成 198 项(85.71%)的成绩。🔗 来源
  • Transformers v5.18.0 — Hugging Face 新增了四种架构:NVIDIA 的 Nemotron 3 Diarization 与 NemotronH Omni、NAVER 的 HyperCLOVAX Vision V2 以及 GTE,并列出了六项破坏性变更。🔗 来源
  • TaskSmith — 在 Hugging Face 从事强化学习环境工作的 Adithya S K 发布了一个编排工具,可将 pull request 转换为可验证的强化学习环境:涵盖从 TRL、PEFT、Accelerate、Diffusers 和 Transformers 中提取的 50 个环境,以 Harbor 任务形式交付。🔗 来源
  • TraceML 0.4.1 — 这款开源工具现已支持对优化器更新的整个参数组进行度量;在 ResNet-50 和 T4 GPU 上,经过数据加载调优后,等待数据的时间从单步耗时的 23% 降至 2 毫秒以内,中位数开销仅为 0.35%。🔗 来源
  • 循环 Transformer — 在一个拥有 54,106 个参数和 260 个可验证案例的玩具模型上,在固定为 80 次块传递的相同算力预算下,1 次循环平均学会全部 260 个案例,2 次循环平均学会 125.3 个,8 次循环平均学会 37.0 个:增加循环次数并未使学习过程更加高效。🔗 来源
  • 懂得说“不”的评测 — Eric Mey 的教程展示了在电影评论情感分析(SST-2)任务中,一种评估体系如何否决了一个在保留数据集上高出 7 分的模型,原因在于该模型的某项关键行为发生了退化;其脚本在 CPU 上的运行时间不到一分钟。🔗 来源
  • 10,000 名合成投保人 — Intelligent Actuaries 在 CC-BY-4.0 协议下发布了一份针对寿险退保与保单失效的合成研究数据:包含覆盖 10 个市场的 10,000 名虚拟投保人,即 2023-2025 年间符合 SOA-LIMRA 调查格式的 27,692 条保单年度记录。🔗 来源
  • cuObject 与 SCADA Server SDK — NVIDIA 正式全面推出 cuObject 库,支持通过 RDMA 直接访问对象存储而无需经过 CPU 内存,并推出了由 IBM 基于 Storage Scale 原型开发的 SCADA Server SDK,该项目属于 40 多家机构参与的 Storage-Next 倡议。🔗 来源
  • NeMo Relay 与 Hermes Agent — 一份由 NVIDIA 与 Nous Research 的 Teknium 联合撰写的教程对 Hermes 智能体进行了追踪:在 108 次运行中,工具修正使 Qwen3 Coder 30B 的成功任务数从 27 项中的 19 项提升至 22 项,代价是模型调用次数从 3.8 次增加到 4.9 次。🔗 来源
  • 面向 OpenClaw Enterprise 的 OpenShell — NVIDIA 提供了其开源环境 OpenShell 来治理 OpenClaw Enterprise 的智能体;后者是由 OpenClaw 基金会与 Red Hat、NVIDIA 及 OpenAI 于前一天宣布的面向常驻智能体的开源控制平面。🔗 来源
  • GitHub Advanced Security 试用 — GitHub Team 客户现可在组织的 Overview 页面、账单页面或通过 Risk Assessment 自行开通 GitHub Code Security 与 GitHub Secret Protection 的试用;试用时长未说明。🔗 来源
  • GHE.com 与 X25519 — 自 2026 年 10 月 7 日起,支持数据驻留的 GitHub Enterprise Cloud 将拒绝仅提供 X25519 进行密钥协商的 TLS 客户端;P-256 和 P-384 仍受支持,SSH 不受影响。🔗 来源
  • Runway 的两项案例研究 — 法国饮料品牌 Bonjour 使用 Runway 制作了 500 多种广告变体,重新调配了超过 50,000 欧元的制作预算;世界杂技杂耍联合会(World Juggling Federation)仅凭一人就完成了 ESPN 一小时节目的包装制作。🔗 Bonjour · 🔗 World Juggling Federation
  • Luma 推出 Ad Variants — Luma 重点展示了一项能在同一营销活动中将已完成的广告转换为多种尺寸并适配多个市场的功能,未提及定价、套餐、发布日期,也未附带博文。🔗 来源
  • Microduck 进入量产 — Pollen Robotics 宣布,其售价 399 美元、在仿真中训练、采用开源强化学习技术栈的小型双足机器人 Microduck,将有 10,950 台在 12 月 10 日至 1 月 10 日期间按周分批下线。🔗 来源
  • Cognition 招兵买马 — 这家 Devin 的开发商迎来了 Snowflake 前首席营收官 Chris Degnan 出任首席营收官(CRO),在此前一天,Alex Stamos 刚刚加盟担任首席信息安全官(CISO)。🔗 Chris Degnan · 🔗 Alex Stamos
  • Claude Founder House — Anthropic 在旧金山科技周期间(10 月 6 日至 8 日在 Terra Gallery)以及 10 月 14 日在斯德哥尔摩举办创始人日活动,包含演讲、工作坊以及与其 Applied AI 团队的交流环节。🔗 来源
  • AI Engineer Paris — Mistral 对前一周在 Station F 举行的活动进行了总结:超过 900 名参会者、60 位演讲嘉宾、57 场讲座和 22 家合作伙伴,未发布新产品。🔗 来源
  • NVIDIA 博士奖学金 — 2027-2028 年度研究生奖学金计划(Graduate Fellowship Program)申请开放至 2026 年 10 月 30 日,每位博士生最高可获 60,000 美元;自 2002 年以来已资助了 220 多项奖学金。🔗 来源

行业启示

安全如今已成为前沿模型发布日程的主导因素。Gemini 4 Argon 延续了 Fairwind Program 的逻辑:受信任的网络防御者会率先获得无网络防护护栏的模型,其他用户则将在进一步强化防护后“尽早”跟进,具体时间未定。同一天,OpenAI 揭示了该问题的另一面:需要保护的已不再仅仅是模型本身,还包括其推理过程。无论这是否由单一组织所为,OpenAI 指出其核心与 Moonshot AI 关联人员相关的这一轮行动,都让推理轨迹成为一项必须捍卫的资产,需要技术防御手段以及实验室与政府之间的信息共享。

今天公布的相当一部分数据来自发布者自行设计或执行的测试。Cohere 使用其当天公布的新指标来评估 Embed 5,并主动提醒称若用旧指标衡量,其模型表现可能看似更差;HeyGen 依赖内部 Elo 评分,Hunmin 采用自研协议且对智能体基准测试仅执行单次运行,而在 Reality Check 上,模型微调正是由主办方完成的。相反,Perplexity 将其模型以盲测方式提交至 turbopuffer 的私有基准,而 Open TTS Leaderboard 和 AURORA 则用可验证的任务和指标取代了主观投票或自动翻译。在对比两项得分之前,必须看清数据由谁生成。

图像和视频生成正日益转向依据实用场景和成本进行评估。Ideogram 4.5 承诺的不是生成更精美的图像,而是能够经受连续局部重绘修图的图像;HeyGen Video 按秒计费,比其价目表中的所有模型都便宜,并表明像 MiniMax H3 这样的基座模型可以衍生出专业化分支(从 HeyGen 到 Creatify)。Runway Ads 将链条延伸到了广告投放支出,而 ElevenLabs 自 2 月以来翻倍的估值,正是建立在企业对对话智能体的强劲需求之上。

开发者层面,运行框架(harness)正成为独立于模型的成熟产品。VS Code 采用 Copilot 框架以使其智能体与应用程序和 CLI 保持一致,HydraFusion 在单轮交互中协调多个模型,Zed 允许智能体为不同子智能体选择不同模型,Manus 则向第三方供应商的 API 密钥开放了其框架。Gemini CLI 现可在非交互模式下无需人工干预执行计划,Claude Code 针对脚本化场景收紧了 --bare,Google Cloud 则在沙盒中向智能体开放了 gcloud 和 bq 命令,且绑定调用者的 IAM 权限。这种需求甚至直接反映在基础设施上:CoreWeave 投入生产的首批 Vera Rubin NVL72 客户正是 Devin 的母公司 Cognition。


来源