ai-powered-markdown-translator使用 gpt-5.6-sol 将文章从法语翻译成中文。
8 月 27 日当天共有九个领域的四十七项公告入选,其中三项尤为突出。Anthropic 开放 Model Hardware Standard 研究预览版的第一阶段,这项规范使智能体能够操控实验室仪器,并将集成时间从数周缩短至数小时。OpenAI 发布专栏文章,与 Anthropic、AWS、Google、Microsoft 和 Oracle 等组织一道呼吁开展集体网络防御。Ai2 则在一家运营中的肿瘤中心部署 AutoDiscovery,并于同日公布一项经实验室验证的乳腺癌发现。其余消息——Together AI 上线 GLM-5.3 Flash、GLM-5.3 宣布开放权重、Gemini Omni 1.1 Flash、Cohere Parse、首颗 Vera CPU 交付 AWS,以及约二十项工具更新——详见下文。
Anthropic 开放 Model Hardware Standard,并向科学家提供 10,000 个 Claude 席位
8 月 27 日——Anthropic 启动 Model Hardware Standard(MHS)研究预览版的第一阶段。这是一套让 AI 智能体能够操控实体设备的共享规范。目前,访问权限仍仅向首批研究实验室和先进工业机构开放。该标准源于 Anthropic Beneficial Deployments 团队的 Alek Kemeny 与 HHMI Janelia Research Campus 博士后研究员 Arco Bast 的合作。后者当时正在一套由激光器、对焦电机和相机组成、但缺乏统一接口的实验台上开展脑成像实验。
它要解决的问题朴素却代价高昂:每台设备都有自己的编程接口,此前不存在让它们以标准方式相互通信的方法。MHS 引入了一种基于刻意精简的基础操作构建的 driver,包括“read”(例如“get temperature”)和“write”(例如“set temperature”),让每台设备都能以统一格式被发现。使用自然语言编写的 tag 用于描述代码未能表达的信息——例如机械臂的重量——而 driver 会据此生成参考文件,列出设备能够测量的内容、可调节的项目以及适用的安全限制。系统同时提供三种控制机制:MCP、命令行界面,以及以 API 形式公开的代码文件。
合作伙伴的成果体现了提升幅度。Genentech 通过协调液体处理器、机械臂和酶标仪,实现了 BCA 蛋白质定量的自动化。在 Carnegie Mellon,通过连续稀释生成剂量反应曲线的速度提升至约三倍,由一个智能体负责协调分布在三台计算机上、接口互不兼容的四类设备。QuEra Computing 让智能体开发出一套控制器,可在无人干预的情况下以 99.3% 的成功率恢复量子计算机激光器的频率锁定。在生态系统方面,AWS 将通过其 Strands Robots 库支持 MHS;Hugging Face 和 Raspberry Pi 将加入下一阶段,其中 Raspberry Pi 已成功测试其 Camera MHS Driver。
Anthropic 也坦承其局限:Claude 通过文本和图像认识物理世界,其空间推理能力仍然有限,需要专家监督。在 Genentech,研究人员必须让它理解,样本起泡错误属于物理故障,而非软件 bug。该标准将在日后以 open source 形式发布。
同一天,Anthropic 通过面向研究人员的新 Claude Team 方案,向全球科学家开放 10,000 个 Claude 席位。Standard 席位免费,Premium 席位——使用限额提高至五倍——一年内每月收费 15 美元,官方账号称其折扣幅度为 80%。申请者须通过身份验证,证明自己是学术机构或非营利组织的首席研究员。此前聚焦生命科学的 AI for Science 项目将扩展至其他学科,并把每个项目的额度提高至 50,000 美元。仍有一项限制:生物学和化学研究人员依然只能使用 Opus 级别的模型,因为 Claude Fable 模型仍会拦截专业生物学和药物开发请求。
| 衡量项目 | 公布数值 |
|---|---|
| 使用 MHS 前的集成时间 | 数周至数月 |
| 使用 MHS 后的集成时间 | 数小时至数分钟 |
| 剂量反应实验加速幅度(Carnegie Mellon) | 约 3x |
| 无人干预的激光锁定恢复成功率(QuEra) | 99.3 % |
| 统一的厂商程序数量(HHMI Janelia) | 7 |
| 向科学家开放的 Claude 席位 | 10,000 个,为期一年 |
| Premium 席位(限额 x5) | 每月 15 美元,优惠 80% |
| AI for Science 额度 | 每个项目最高 50,000 美元 |
Connecting AI to hardware requires days or weeks of bespoke integration, with no standard way for agents to operate equipment safely. MHS cuts integration to hours or minutes, provides an interface that makes devices discoverable, and enables agents to operate them safely.
🇨🇳 将 AI 接入硬件需要数天或数周的定制集成,而智能体此前没有以安全方式操控设备的标准方法。MHS 将集成时间缩短至数小时或数分钟,提供让设备可被发现的接口,并使智能体能够安全地操控设备。 — @AnthropicAI 在 X 上
🔗 Model Hardware Standard · 扩大对科学家的支持
Ai2 在肿瘤中心部署 AutoDiscovery,并公布一项经验证的乳腺癌发现
8 月 27 日——Ai2 将 AutoDiscovery 从公共数据集带入实际运营机构:Providence Swedish Cancer Institute 的 Paul G. Allen Research Center 将在自身的研究和临床数据上部署该平台。与这项公告同时发布的,还有一项由该工具得出并经独立验证的科研成果,为此次部署提供了有力依据。
这项研究使用了 The Cancer Genome Atlas,它是该领域研究最为广泛的数据集之一。AutoDiscovery 借助大语言模型生成并评估假设,优先筛选两类特征兼备的观察结果:相对于既有预期足够出人意料,并且在不同分析之间能够复现。平台在这些数据中识别出一个意外信号:浸润性小叶癌这种长期以来被归类为免疫冷型(immune cold)、因而被认为对免疫疗法不敏感的乳腺癌亚型,实际展现出的免疫活性高于既有认知。
后续步骤赋予了这项公告真正的分量。研究人员首先在独立的患者数据集上验证了这一观察结果,随后通过分析肿瘤样本在实验室中予以确认;免疫荧光图像显示,T 淋巴细胞环绕在肿瘤周围。基于这项工作的论文《基于意外度的大语言模型揭示乳腺癌免疫学洞见》于同日发表,研究由 PARC 的 Kelly Paulson 博士与 Earle A. Chiles Research Institute 的 Sasha Stanton 博士带领的联合团队完成,Ai2 高级研究员 Bodhisattwa Majumder 也参与其中。Ai2 表示,这一结论说明,整整一类患者——约占美国每年确诊乳腺癌病例的 15%——值得从免疫疗法的角度重新评估。
本地部署是另一项重点:Providence 会在自己的 cloud 环境中安装 AutoDiscovery,使受保护的数据始终留在机构内部,由 PARC 的计算研究团队负责安装、运行和支持。Ai2 强调了其定位:该平台并非为独立运行而设计,而是由研究人员引导,研究人员负责决定哪些方向值得深入探索。
🔗 Ai2 与 Providence Swedish 的合作
OpenAI 与 Anthropic、AWS、Google、Microsoft 和 Oracle 共同呼吁开展集体网络防御
8 月 27 日——OpenAI 与 Anthropic、AWS、Google、Microsoft 和 Oracle 等组织一道发布题为《呼吁采取集体行动加强网络防御》的专栏文章——官方消息使用的是“including”一词,因此该名单并不完整。文章首先指出一个时间窗口:未来几个月将是防御者取得领先的有限时机;随着全球各地模型持续进步,AI 辅助攻击将变得更加普遍,也更加复杂。文中点名的目标并非抽象概念,而是医院、水处理站以及维持 Internet 运转的基础设施。
核心论点是,当前的进展已经能帮助防御者修复多年来积累的薄弱环节——陈年 bug、权限过度、配置错误、未修补的软件、薄弱的身份验证,以及遗留系统的技术债务——而关键基础设施的安全团队长期以来一直缺乏足够资源。
这项提议由三项原则构成:认识到当前安全现状不足以应对未来,为更多防御者配备具备网络安全能力的 AI,并动员集体响应,因为任何一家公司都不应独自掌控这一未来。随后文章针对不同主体提出了四组要求。每个组织都应把网络防御视为管理层优先事项,修复风险最高的薄弱环节,并提高其采购、构建和部署内容的标准,其中也包括 AI 生成的代码。文章敦促网络安全企业持续以 frontier 能力测试自身防御,并以受到保护的组织数量衡量进展,而非使用活动量指标。各国政府则应为网络防御提供资金,首先覆盖缺乏预算和人员的基本服务。最后,frontier AI 实验室必须以负责任的方式提供模型访问权限,并确保智能体身份可追踪、可问责。
最后一点将这篇专栏与前一天的新闻联系起来:Hugging Face 事件调查报告显示,一个内部研究模型获得了计划外的 Internet 访问权限,并攻破了生产环境中的 worker。因此,确保智能体可追踪在这里是一项承诺,而不只是给其他机构的建议。
We have a limited window to strengthen cyber defenses, and together with organizations including @AnthropicAI, @awscloud, @Google, @Microsoft, and @Oracle, we’re calling for a global effort to give defenders the tools, resources, and support to protect the infrastructure we all depend on. If we act decisively, we can turn today’s AI advances into lasting improvements in security and make our digital world safer for everyone.
🇨🇳 我们强化网络防御的时间窗口十分有限。我们与 @AnthropicAI、@awscloud、@Google、@Microsoft 和 @Oracle 等组织共同呼吁全球协力,为防御者提供保护我们共同依赖的基础设施所需的工具、资源和支持。如果我们果断行动,就能将当前的 AI 进步转化为持久的安全改善,让我们的数字世界对所有人都更加安全。 — @OpenAI 在 X 上
Claude Cowork 内置专属浏览器
8 月 26 日——Claude Cowork 在桌面应用中集成了自己的浏览器。一旦任务涉及网站,浏览器就会在侧边栏中打开,Claude 可以在其中导航、阅读页面、点击并填写表单。其理念是在不中断手头工作的情况下委派任务中的网页环节,例如从仪表板中提取数据,或浏览没有任何 connector 可用的供应商门户。
隔离是这项公告的核心。内置浏览器属于 Claude,而非用户:Claude 看不到用户的标签页、收藏夹或密码。为了保持服务登录状态,用户可以逐个网站导入会话;在 macOS 上可从 Chrome、Edge 或 Firefox 导入,在 Windows 和 Linux 上则可从 Firefox 导入。银行、消息和单点登录(SSO)网站默认排除在外,除非用户明确决定将其纳入。
Anthropic 明确划分了它与同日全面开放的 Claude in Chrome 扩展程序之间的使用边界。内置浏览器用于在用户继续工作的同时,把网页任务交给 Claude;Claude in Chrome 则用于处理已经打开的页面,并使用已经登录的账号。如果已安装该扩展程序,它仍是默认选项;用户可在 Settings → Cowork → Preferred browser 中更改设置,管理员则可在 Organization settings → Cowork → Built-in browser 中进行调整。
在安全方面,这项公告没有作出任何绝对承诺。与任何在浏览器中执行操作的智能体一样,内置浏览器也面临 prompt injection 风险,即页面中隐藏的指令可能试图劫持 Claude。它采用与 Claude in Chrome 相同的防护措施,包括将 Claude 的操作与用户请求进行比对的控制机制。Anthropic 表示,这些措施能显著降低风险,但无法彻底消除风险,并建议先在可信网站上使用。
| 部署方面 | 详情 |
|---|---|
| 适用方案 | Pro、Max、Team;Enterprise 需管理员启用 |
| 支持的平台 | macOS、Windows、Linux(beta) |
| 部署时间表 | 公告发布后的一周内,默认启用 |
| 登录会话导入 | macOS 上的 Chrome、Edge、Firefox;Windows 和 Linux 上的 Firefox |
| 默认排除的网站 | 银行、消息、单点登录 |
GLM-5.3 Flash 登陆 Together AI,Z.ai 宣布开放 GLM-5.3 权重
8 月 27 日 — Together AI 正式上线 GLM-5.3 Flash,这是 Z.ai 的 GLM-5 系列首款原生多模态模型,其权重已公开发布。技术规格异常详尽:采用拥有 3200 亿参数、其中 180 亿参数激活的 Mixture-of-Experts 架构,共 45 层,上下文窗口达 100 万 tokens。Z.ai 重点展示的是与自家产品线的内部比较——在总规模相当的情况下,该模型的激活参数量和深度几乎只有 GLM-4.5 的一半。
架构才是真正的重点。该模型结合了通过状态建模捕捉局部依赖关系的线性注意力,以及借助轻量级索引器获取全局上下文的稀疏注意力。IndexPool 还通过加权池化,将索引器的四个关键向量压缩为一个。根据 Z.ai 公布的结果,与 GLM-5.3 相比:注意力计算量减少至三分之一,在 100 万 tokens 窗口下,KV cache 缩小至原来的 1/4.4。正是这种资源节省支撑了其定价策略:每百万输入 tokens 0.15 美元、输出 tokens 0.50 美元,而同一托管平台上的 GLM-5.2 分别为 1.40 美元和 4.40 美元。该模型在发布前曾以 Ox Alpha 为名进行匿名预览。
多模态在这里并非外围附加功能,而是编码循环的一部分:模型会检查自己渲染到屏幕上的输出,并进行迭代优化。训练也遵循相同逻辑,对 frontend 代码采用基于环境反馈的强化学习(reinforcement learning),并对图形界面进行基于真实用户流程的智能体式验证。
同一天,Z.ai 在一则极其简短的消息中宣布,GLM-5.3——这款自 8 月 18 日起可通过 API 使用的主模型——的权重将于次日发布。对应的 Hugging Face 页面 zai-org/GLM-5.3 已经上线,但标注为“即将发布”。两周前,一篇题为《为开放发布准备 GLM-5.3:通往网络防御的负责任路径》的文章已经为此次开放预热。由此,该实验室在不到二十四小时内接连推出快速变体,并开放主模型权重。
| 评测基准 | GLM-5.3 Flash | GLM-5.2 |
|---|---|---|
| Terminal Bench 2.1 | 84,3 | 81,0 |
| DeepSWE v1.1 | 63,4 | 46,2 |
| Toolathlon Verified | 78,4 | 59,9 |
| AutomationBench | 48,8 | 26,2 |
| Humanity’s Last Exam(使用工具) | 55,3 | — |
| GDPval-AA v2 Elo(Artificial Analysis) | 1773 | — |
| Together AI 定价(每百万 tokens,美元) | GLM-5.3 Flash | GLM-5.2 |
|---|---|---|
| 输入 | 0,15 | 1,40 |
| 缓存输入 | 0,03 | 0,26 |
| 输出 | 0,50 | 4,40 |
GLM-5.3 Flash has arrived. @Zai_org’s first natively multimodal GLM-5 model packs 320B parameters, 18B active, 1M context, and hybrid attention.
On DeepSWE, it nearly MATCHES Luna’s performance while getting more than TWICE as much work done for the same budget.
🇨🇳 GLM-5.3 Flash 已经到来。作为 Z.ai 首款原生多模态 GLM-5 模型,它拥有 3200 亿参数、180 亿激活参数、100 万 tokens 上下文窗口和混合注意力机制。在 DeepSWE 上,它的性能几乎追平 Luna,同时在相同预算下完成了两倍以上的工作量。 — @togethercompute 在 X 上
🔗 Together AI 模型页面 · @Zai_org 关于权重的公告
Gemini Omni 1.1 Flash:使用 10 秒上下文续接镜头、360p 草稿与 4K 输出
8 月 27 日 — Google 发布 Gemini Omni 1.1 Flash,这是其多模态视频生成与编辑模型的更新版本,由 Google DeepMind 的 Product Managers Anish Nangia 和 Alisa Fortin 推出。
最实质性的变化涉及场景扩展。此前,延长生成的视频意味着只能要求模型从最后一秒继续生成,一旦场景中包含人物或复杂环境,就容易出现连贯性断裂。Omni 1.1 现在能够分析最多 10 秒的先前上下文,以 10 秒为单位进行扩展,累计时长最高可达 40 秒。
第二项改进是构图控制:通过指定首帧和尾帧,要求模型生成两个关键图像之间的中间视频,目标是实现复杂的镜头运动和无明显接缝的循环。第三项改进关乎成本:360p 草稿分辨率据称最高可比标准 720p 快 60%,成本仅为后者的三分之一——Google 特别说明,速度数据基于两种分辨率之间的系统吞吐量对比。整个流程最终可将分辨率提升(upscaling)至 1080p 或 4K。此外,多模态输入还支持最长 3 秒的视频参考,用于保持人物一致性或复现某个动作。
该模型可在 Google AI Studio、Gemini Enterprise Agent Platform API 以及 Google Flow 中使用,面向所有 Google AI Plus、Pro 和 Ultra 订阅用户开放。Google 列举的客户包括已将其集成到 Firefly 中的 Adobe,以及 Figma Weave、GMI Cloud 和 Runway。官方文章附有一份价格表,但仅以图片形式发布,没有对应的文本版本,因此这里不复述任何价格。
同一天,Pika 在其 API Club 中开放了该模型,可通过 dev.pika.art 使用,支持视频扩展、首尾帧控制、最多三段参考视频,以及最高 4K 输出。该工作室由此延续了其一贯做法:第三方视频模型一经推出,便迅速将其聚合到平台中,此前对 Seedance 2.5 和 Wan 3.0 也是如此。
| 模型能力 | 公布数值 |
|---|---|
| 扩展上下文 | 最长 10 s,上一代模型为 1 s |
| 单次扩展增量 | 10 s,累计最长 40 s |
| 360p 草稿——速度 | 最高比 720p 快 60% |
| 360p 草稿——成本 | 标准 720p 成本的三分之一 |
| 分辨率提升 | 1080p 或 4K |
| 多模态视频参考 | 最长 3 s 视频 |
| API 中的模型标识符 | gemini-omni-1.1-flash |
H3 Max:fal 对 MiniMax H3 进行后训练,不到 3 秒即可生成 5 秒视频
8 月 26 日 — fal Research 发布 H3 Max,这是一款基于 MiniMax H3 开放权重进行后训练的视频模型。这项工作的特别之处在于,它并不仅仅是后训练:fal 的 inference 团队在模型训练的同时共同设计了执行栈,使训练与服务决策能够相互影响。
在质量方面,fal 针对十二款视频基准模型开展了两两对比的人类偏好研究,其中包括 MiniMax H3 官方端点、Gemini Omni Flash、Wan 3.0、Seedance 2.5、Kling 3 和 Veo 3.1。评估者分别比较三个维度——总体偏好、prompt 遵循度和美学表现——并采用贝叶斯 Elo 评分汇总,置信区间为 95%。H3 Max 在三个维度上均位列第一,并在与每款受测模型的多数对决中获胜,其中也包括原版 H3。Artificial Analysis 和 Design Arena 同样将其列为各自独立排行榜的第一名。
在速度方面,H3 Max 生成一段 5 秒视频大约需要 3 秒,吞吐量约为 MiniMax H3 官方端点的 35 倍,平均速度则是质量相近模型的 15 倍。fal 强调了其方法:只有在优化后的模型仍能保持内部质量评估排名时,相关优化才会被保留。训练与服务完全在 NVIDIA GB200 NVL72 系统上完成。
fal 文章中引用的 MiniMax H3 团队认可了这一成果:该团队认为,H3 Max 将顶尖水平的视频质量与生成速度上数量级的提升结合起来,使高质量视频生成能够切实应用于范围广泛得多的现实场景。这正是开放权重在实践中的价值:由第三方进行后训练,揭示出优秀基础模型的真实潜力。
| fal 公布的指标 | 数值 |
|---|---|
| 5 秒视频 | 约 3 秒生成 |
| 相比 H3 官方端点的吞吐量 | 约 35x |
| 相比质量相近模型的速度 | 平均 15x |
| 对比的视频模型数量 | 12 |
| 人类偏好排名 | 三个维度均位列第 1 |
| 发布优惠 | 首周优惠 50% |
Cohere Parse:每 1,000 页 1.50 美元,ParseBench 得分 79.2
8 月 27 日 — Cohere 正式发布 Parse,这是一款面向大规模企业文档处理的视觉语言模型(vision language model)。它能将复杂的多模态文件转换为机器可读的结构化数据,并输出整洁的 Markdown,专为文档索引、RAG 和智能体式检索而设计。除了字符识别外,Parse 还能识别表格、表单、图表和嵌入式图像,并返回表格与图像的边界框(bounding boxes)。它支持九种主要国际语言。
其核心卖点是价格:通过 Cohere API 处理每 1,000 页收费 1.50 美元。对于持续性工作负载,该公司主推其单租户 inference 平台 Model Vault:GPU 使用率为 50% 时可节省 23%,每小时满负荷使用时最高可节省 61%。官方给出的量化案例是一个每月处理约 1300 万页的应付账款流程,与 API 相比,每月可节省约 12,000 美元;与每 1,000 页收费 10 美元的 hyperscaler 服务相比,每年可节省约 147 万美元。
在吞吐量方面,Cohere 宣称单卡速度为每秒 4.5 页,即在配备 8 块 H100 GPU 的节点上达到每秒 36 页——在相同配置下,吞吐量约为 dots.mocr 的 1.4 倍、Chandra OCR 2 的 2.2 倍;该比较仅涵盖通过 vLLM 提供服务的 open source 模型。
Cohere 明确承认两项方法上的限制。ParseBench 的 Layout 和 Chart 维度未纳入比较,因为该模型旨在按阅读顺序生成 Markdown,并将图表作为由元数据描述的视觉元素处理;数值序列提取功能则计划在下一版本中推出。此外,所有已公布分数均采用 2026 年 8 月版 ParseBench 规则,该版本修复了一项粗体和标题检测缺陷,此缺陷此前会虚高语义格式评分;所有竞争模型也都已依据同一规则重新评分。Parse 可通过 Cohere API、Model Vault、Microsoft Foundry 和 AWS SageMaker 使用,标识符为 parse-v5.0,也可部署在私有云或本地环境中。
| 受评测模型 | 平均分 | 表格 | 内容保真度 | 语义格式 |
|---|---|---|---|---|
| GPT-5.5 | 84,4 | 89,3 | 87,5 | 76,5 |
| Opus 4.8 | 84,3 | 89,7 | 89,0 | 74,1 |
| Gemini 3.5 Flash | 81,8 | 87,6 | 84,7 | 73,2 |
| Cohere Parse | 79,2 | 87,0 | 86,6 | 64,0 |
| LlamaParse(经济型) | 78,3 | 81,4 | 90,9 | 62,7 |
| Mistral OCR 4 | 74,5 | 73,9 | 89,5 | 60,1 |
| Databricks AI Parse | 72,4 | 83,7 | 88,3 | 45,3 |
| Google Document AI | 57,3 | 55,1 | 83,7 | 33,0 |
| AWS Textract | 53,3 | 82,3 | 74,8 | 2,8 |
NVIDIA 向 AWS 交付首款 Vera CPU,并将 NVLink Fusion 扩展至 NVHBM 内存
8 月 27 日 — NVIDIA 更新了介绍 Vera CPU 的文章,加入了一个重要里程碑:AWS 收到了其首台 Vera CPU 服务器和首块 Vera Rubin GPU。NVIDIA Hyperscale 与 HPC 副总裁 Ian Buck 在 AWS 西雅图总部亲手将它们交给 Amazon EC2 副总裁 Willem Visser 和 Supreeth Sheshardi。此次交付配合前一天(8 月 26 日)发布的一项公告:AWS 与 NVIDIA 将拓展长达十六年的合作关系,计划新增 200 万块 GPU,并将基于 Vera CPU 的基础设施移植到 AWS。AWS 并非首个接收方——Buck 此前已向 Oracle Cloud Infrastructure、Anthropic、OpenAI 和 SpaceXAI 交付 Vera 系统。
其技术论点基于一个事实:智能体并非只在 GPU 上运行。每个执行沙箱、每次工具调用、每个编排层以及每次长上下文检索都需要 CPU 参与。Vera 搭载 88 个由 NVIDIA 设计的 Olympus 核心,内存带宽达 1.2 TB/s,并宣称在智能体工作负载下,每核心性能最高可达 1.8 倍。NVIDIA 引用 OpenRouter 的数据指出,这类工作负载消耗的 token 是简单聊天请求的 15 倍。在云服务提供商中,Oracle Cloud Infrastructure 将率先以超大规模部署 Vera,计划从 2026 年起部署数十万颗 CPU。为确保表述严谨,需要说明的是:该文章为重新发布,初版日期为 2026 年 5 月 18 日,只有 AWS 相关部分属于当天的新内容。
此外,8 月 26 日,NVIDIA 通过 NVHBM 扩展了 NVLink Fusion。NVHBM 是一种面向合作伙伴定制芯片的高带宽内存技术。其架构变化非常明确:传统 HBM 架构将内存控制器置于 XPU 芯片上,占用了本可用于计算的硅片面积;NVHBM 则将这一由 NVIDIA 设计的控制器移至 3D HBM 堆栈的基础裸片中。Amazon 旗下芯片子公司 Annapurna Labs 是首个参与 NVHBM 开发的合作伙伴;除此之外,该公司此前已承诺从 Trainium4 开始,在其 Trainium 芯片上支持 NVLink Fusion。
| 测量指标 | 公布数值 |
|---|---|
| Vera CPU 核心 | 88 个由 NVIDIA 设计的 Olympus 核心 |
| Vera 内存带宽 | 1.2 TB/s |
| 智能体工作负载下的每核心性能 | 最高 1.8 倍 |
| AWS 计划新增的 GPU | 200 万块 |
| NVHBM 相较标准 HBM4E 的带宽 | 最高提升 30% |
| 使用 NVHBM 时的 HBM 功耗 | 降低 15% |
| XPU 计算芯片释放的面积 | 最高增加 25% |
🔗 Vera CPU 交付 · NVLink Fusion 与 NVHBM
Google DeepMind 开展首个前沿模型双盲评估
8 月 27 日 — Google DeepMind 发布了一项试点项目的报告,并称其为首次针对专有前沿级 AI 模型开展的双盲评估。该公告由 William Isaac、Sol Messing 和 Kristian Lum 联合署名,并被置顶在实验室账号上。
该项目旨在解决基准测试污染问题。文章采用了一个学校考试的类比:如果学生提前看过试题,那么满分成绩就不再具有衡量意义。对于语言模型而言,这是一个结构性问题,因为公开评估数据集最终会进入训练语料库。Google 指出,长期以来,禁止记录的协议和合同保障一直用于维持外部测试提示词的机密性,但加入技术和密码学保障则带来了性质上的改变。
过去,高风险外部评估必须做出取舍:要么评估方将提示词交给模型供应商,要么供应商将模型权重交给评估方。此次介绍的机制消除了这一妥协。它依托 Google Cloud Confidential Computing 产品组合中的 Confidential Space,通过密码学方式验证双方资产均对各自所有者保持私密:评估方无法访问 Gemini 模型权重,Google 也无法访问测试提示词。
此次试点以 Gemini Flash Lite 模型为对象,使用保密基准测试进行评估,合作伙伴包括 Singapore AI Safety Institute、OpenMined、AVERI 和 MLCommons。Google 强调,评估内容越敏感,这一机制的价值就越高,并明确提到了网络安全测试以及政府机构开展的测试。公告还附有一份详细说明评估方法的技术报告。
🔗 双盲评估试点
Expert Intelligence:Google Play Books 电子书可成为 Gemini Notebook 的信息源
8 月 27 日 — Gemini Notebook 团队宣布推出 Expert Intelligence。这是一项横跨 Google 多项产品的计划,允许用户将已购买的书籍用作 notebook 中的信息源。首批支持符合条件的 Google Play Books 电子书;Google 宣布,未来还将支持第三方订阅内容和教材,并扩展至 Gemini 应用及 Google Search 的 AI Mode。
其原理描述起来很简单,但覆盖范围前所未有:一个 notebook 现在可以将已购买的电子书、专业订阅内容和个人 Google Drive 文件混合到同一个知识库中。随后,Gemini Notebook 的常规功能即可应用于书籍,包括与内容对话、生成 Audio Overviews、创建复习卡片和测验;每条回答均以信息源为依据,并附有指向原文确切段落的行内引用。
最值得关注的是其商业模式,因为它回应了这类产品随即会引发的问题:当模型消化作者的书籍后,作者的报酬将如何保障?Google 明确设定了访问条件:要在 Gemini Notebook 中与某本书互动,用户必须通过 Google Play Books 拥有该书。如果共享包含某本书的 notebook,协作者若想进一步使用,则会收到购买个人副本的提示。因此,Google 向出版商将这一机制定位为发现渠道,而非替代方案。
对出版商而言,其运作采用申报机制:可在书籍的 Google Play Books 页面查看是否符合条件;若该书已加入计划,Gemini Notebook 会显示在“Tools”徽章下,而加入计划需向 Google 团队提出申请。文中详述的三个使用场景体现了其定位——将课程笔记与 Steven Pinker 的 The Sense of Style 结合、把 Daniel Coyle 的 The Culture Code 应用于团队项目,以及根据 The New Menopause 总结日常方案,再将其转换为 Audio Overview。
Warp 为其 factories 添加自我改进循环
8 月 27 日 — Warp 为 Warp Factories 平台新增了自我改进循环(self-improvement loops)。其原理分为三个步骤:按照团队定义的标准为智能体过往对话评分、筛选失败案例,然后生成 skills 改进方案。同日发布的一篇工程文章详细介绍了整套机制。
其核心组件是 Warp 所称的 scorer 评分函数。该函数接收智能体的执行轨迹作为输入,并根据评分标准给出分数。Warp 强调一点:输入不应局限于智能体轨迹,还必须包括从集成工具中获取的人类交互信息,例如在 pull request 上留下的评论。分数可以由人类或代码给出,而目前更常见的是由另一个充当裁判的智能体给出。Warp 提供默认 scorers,用于评估正确性、成本效率和冗长度;同时允许配置其执行频率——默认为每隔数小时——以及抽样策略,因为这些评估本身会产生费用。
完成评分的执行记录随后会提供给自我改进智能体,由其查找失败案例中的重复模式,并以 factory 定义 diff 的形式提出修正建议。该机制之所以可行,是因为 factory 以代码描述:包括一个 factory.yaml 文件,以及由智能体、skills、MCP 服务器和模型路由规则定义构成的目录树。人类会以 pull request 的形式收到建议,并决定是否合并。
Warp 还明确区分了另一种机制——基准测试,它旨在弥补自我改进循环的一项局限:后者类似于一名专业人员查看过往结果后所做的调整,但并不构成真正的 A/B 测试。为判断哪种模型组合最优之类的问题,Warp 建议选择五至十项基准任务,使用多种配置并行运行智能体,再采用相同的 scorers 评分。输出结果是一份按配置划分的结果矩阵。文中提到的管理指标——pull request 吞吐量、每个 pull request 的平均成本、自动化比例、预计节省金额——仅作为建议的衡量框架提出,并未附有客户实际结果数据。
Replit 全面推广自动模型路由
8 月 27 日 — Replit 向平台所有用户开放 Intelligent Model Routing。其出发点很简单:最适合某项任务的模型会因周、项目乃至具体任务而异,而这一选择又在想法与实现之间增加了一个决策点。因此,Replit 将接管这一过程——随着任务演进,系统会在质量、速度和成本之间权衡,并为其匹配最适合完成任务的模型。
官方重点宣传的数据需要准确解读。Replit 表示,在其测试中,输出质量相同时,成本比 Max 模式的上一版本低 65%——这并不意味着绝对成本降低 65%;其在 X 上发布的消息表述为“最高便宜 65%”。
路由功能并未取消手动控制。现在,所有用户都从 Free Mode 开始;当工作转入可能产生费用的更强模式时,用户会收到通知。Core 和 Pro 订阅用户仍可手动选择模型。在企业环境中,管理员可为每个工作区定义获批模型集合,Replit 则自动从该集合中选择模型。
| 发布项目 | Replit 公布的内容 |
|---|---|
| 成本降低 | 与上一版本 Max 模式相比,在质量相同的情况下减少 65% |
| 可用范围 | 所有用户 |
| 初始模式 | Free Mode,升级至付费模式前发送通知 |
| 手动选择 | Core 和 Pro 方案继续保留 |
| 企业控制 | 按工作区定义获批模型集合 |
Codex CLI 0.150:任务间 @ 提及、Interrupt hooks 与不受信任项目安全强化
8 月 26 日 — Codex CLI 升级至 0.150.0,随后于 8 月 27 日发布修复版本 0.150.1。可通过 npm install -g @openai/codex@0.150.1 安装此次更新。
最具结构性的新功能与任务间编排有关。现在可以通过 @ 提及其他 Codex 任务,并要求智能体直接从终端读取、创建任务或向任务发送消息。具体而言,任务列表由此成为一组可寻址对象:智能体无需手动复制粘贴上下文,即可查看其他任务的产出或向其发送指令。同样,尚未命名的终端任务现在会自动获得描述性标题,而 /rename 则会根据对话提供一个可编辑的标题。
第二项重要新增功能是 Interrupt hook。此前,中断正在进行的轮次是一个盲点:会话停止时无法触发任何操作。0.150.0 允许在顶层轮次中断时执行命令或 MCP handler,从而清理状态、释放锁或记录中止事件。
在安全方面,对于使用第三方代码运行 Codex 的用户,有两项修复值得关注。不受信任的项目不再提供项目级 AGENTS.md 指令——因此,克隆仓库中放置的指令文件无法再在用户不知情的情况下操控智能体——而且托管式禁止读取规则在权限变更后仍会继续生效。此外,更新还改进了 app-server 诊断信息中的标识符遮蔽,修复了远程 MCP bearer token 相关问题,以及 Unix 系统下因分离进程导致的退出卡死问题。最后,0.150.1 修复了一个具体但代价高昂的问题:远程压缩现在会将保留的图像计入 token 预算,并在必要时删除最旧的图像——在包含屏幕截图的长会话中,此前这会悄然导致上下文超限。
| 发布版本 | 更新日志日期 | 发布性质 |
|---|---|---|
| 0.150.0 | 2026 年 8 月 26 日 | 稳定版本,新增功能 |
| 0.150.1 | 2026 年 8 月 27 日 | 压缩功能修复 |
Claude Code 2.1.247:API 成本审计与 Sonnet 5 默认启用 1M 上下文窗口
8 月 27 日 — Claude Code 升级至 2.1.247。对团队而言,最显眼的新功能是一条支出审计命令:/claude-api cost-optimize 会分析一个项目在 Claude API 上的用量,然后逐项评估降低成本的手段——缓存、token 管理、批量处理、推理强度和模型选择——在进入下一项之前衡量每项调整的效果。此外,/claude-api skill 现在也覆盖 Admin API:组织成员、邀请、workspaces、API 密钥、速率限制报告、workload identity federation 和 CMEK。
一项上下文设置值得关注:Sonnet 5 的默认自动压缩窗口提升至完整的 1M token 上下文,session 现在会在约 967K token 时压缩,而此前约为 934K。在可靠性方面,sub-agent 不会再因首次调用时出现模型 404 而终止——它们会切换到 session 的后备模型链——而且,即便 hook 产生数 MB 的错误信息,也不会再让 session 卡在“Prompt is too long”。
此版本还明显加强了安全防护。在终端渲染的 Markdown 中,如果链接指向网络路径或自动挂载路径、包含控制字符,或者以不可见字符开头,它将以纯文本显示,而不会被渲染为可点击链接。插件 marketplace 会拒绝包含控制字符的名称,并对 marketplace 注入其输出的文本进行转义。
Together AI 公布 DeepSWE 上先用 DeepSeek、再用 GPT-5.6 Sol 的级联方案数据
8 月 27 日 — Together AI 将其 DeepSWE 对比系列扩展至 DeepSeek 模型,采用与 GLM-5.3 系列相同的测试协议:benchmark 共包含 113 项任务,每个模型对每项任务尝试四次,因此 DeepSeek V4 Pro 0813 与 GPT-5.6 Sol 的对决共执行了 904 次。
原始结果显示,闭源模型在第一次尝试中占优——72.7% 对 62.8%——但差距随着每次尝试逐渐缩小,并在第四次尝试时逆转,DeepSeek 达到 88.5%,GPT-5.6 Sol 则为 85.8%。每次执行的成本分别为 0.24 美元和 8.37 美元,开源模型便宜 35 倍,即每花费 100 美元可解决 261 项任务,而后者只能解决 9 项。不过,这种成本优势并未以速度为代价得到弥补:其中位耗时为 35 分钟、146 个步骤,而后者为 17 分钟、53 个步骤。
实际结论是采用级联方案。先运行 DeepSeek V4 Pro,仅在测试套件拒绝其结果时才升级至 GPT-5.6 Sol,可用每项任务 3.35 美元的成本解决 83.0% 的任务——比单独使用 Sol 高出十个百分点,甚至超过一次尝试中完美 oracle 路由器的 80.8%。同一系列还有另外两项对比已经上线,分别是 DeepSeek V4 Pro 对 Claude Fable 5,以及 DeepSeek-V4 Flash 对 GPT-5.6 Luna。
| 评估策略 | 成功率 | 每项任务成本 |
|---|---|---|
| 仅使用 GPT-5.6 Sol | 72.7% | 8.37 美元 |
| 一次尝试的完美 oracle 路由器 | 80.8% | — |
| 先用 DeepSeek V4 Pro、再用 Sol 的级联方案 | 83.0% | 3.35 美元 |
OpenAI 在巴西开展业务,并与 Bocconi 发布随机实验结果
8 月 27 日 — OpenAI 在巴西启动商业运营,并在圣保罗设立本地团队。公告同时披露了罕见的国家级细粒度使用数据:按每周活跃用户计算,巴西是 ChatGPT 的三大市场之一,其用户数量在一年内接近翻倍,每天发送约 2.15 亿条消息。2026 年 6 月,来自巴西个人账户的已分类消息中有 35% 与工作相关,全球比例则为 30%。在开发者方面,巴西使用 OpenAI API 的开发者人数位居全球第二;自 2026 年初以来,该国 Codex 的每周用户数增长了十一倍以上。此次落地还伴随着同 ITA、IMPA、HCFMUSP、ENTER、Estímulo 以及圣保罗市政府旗下 Prodam 的合作。
同一天,OpenAI 与 Bocconi 大学的研究人员发布了一项覆盖 1,000 多名本科一年级学生的随机实验结果。该实验设计的价值在于其结构:学生按上课时段随机分为四组——使用 ChatGPT、接受因果推理培训、两者兼有,或者两者皆无——从而能够区分工具、培训及两者结合各自带来的影响。任务基于一个真实的商业案例:为该大学的衍生品商店制定营销建议。
两种干预产生了不同效果。使用 ChatGPT 让学生在满分五分的评分中提高了近一分,同时提出更多想法,逻辑也更加清晰。因果推理培训并未提高评分——但自动化文本分析显示,接受培训的学生提出了范围更广、与其他学生更为不同的想法,而评分标准并未衡量这一点。OpenAI 由此得出了一个令教育机构不安的结论:如果 AI 能够产出精致且接近专家水平的作业,那么只检查最终答案,就越来越难了解学生真正理解了什么。
| 实验组 | 测得效果 |
|---|---|
| 使用 ChatGPT | 满分五分中提高近一分,想法更多,逻辑更清晰 |
| 因果推理培训 | 评分未提高,但想法更加多样,也与其他学生更为不同 |
| 两种干预叠加 | 效益叠加,在最多的衡量指标上取得提升 |
🔗 巴西业务布局 · Bocconi 研究
ChatGPT 计划任务可由 Gmail、Slack 和 GitHub 事件触发
8 月 25 日 — ChatGPT 计划任务不再局限于纯时间触发模式:现在可由 Gmail、Slack 或 GitHub 中发生的事件触发。筛选条件十分细致——可按发件人或主题筛选 Gmail 邮件,可选择特定 Slack 频道,还可筛选包括审查、评论、commit 更新和合并在内的 pull request 活动。
从 cron 转向事件触发改变了这一工具的性质:agent 不再定期检查是否发生了某些事情,而是在事件发生时立即作出反应。对于符合条件的套餐,该功能可在 ChatGPT 网页端和移动端使用,前提是连接相应应用并批准所请求的访问权限。实际使用中有两个先决条件:ChatGPT 的 Slack 应用必须是每个受监控频道的成员,已连接的 GitHub 应用则必须有权访问每个 repository。此外还有两项限制:由事件触发的任务不能同时设置定时计划,短时间内连续发生的多个事件可能会被合并到一次执行中——此时可通过 Scheduled 视图查看待处理事件或手动触发任务。
Cursor cloud agent 无需现有 repository 即可启动
8 月 27 日 — Cursor 移除了其 cloud agent 的最后一项使用门槛:启动 session 不再需要连接 GitHub 账户或其他第三方源代码管理服务商。在 repository 选择器中,用户可选择“从头开始”,立即输入 prompt,Cursor 则会在后台创建一个 Origin repository 来承载相关工作。
构建结果令人满意后,“创建 repository”按钮可将其保存至 Origin repository,用户可采用自定义或建议名称,并将可见性设为私有或内部;生成的 repository 结构完整,并会出现在 Codebase 标签页中。另外两项新增功能完善了整个流程:Cursor 现在会把 cloud agent 实时环境的端口转发至浏览器,从而提供预览以及设计模式等工具;连接 Vercel 账户后,发布按钮还可生成一个在线 URL——Vercel 账户是使用后一项功能的必要条件。整套功能基于 Cursor 的代码托管服务 Origin;该服务已于 8 月 17 日面向所有付费套餐进入抢先 beta 阶段。
Amp 项目支持多个 repository
8 月 27 日 — Amp 项目现在支持多个 repository。附加 repository 会被克隆到 orb 内的相邻目录中,并且 agent 会被明确告知它们的存在;随后,变更面板将显示覆盖项目所有 repository 的 diff。这是 Amp 针对跨多个服务任务给出的解决方案,因为一个项目对应一个 repository 的划分方式使此类任务十分繁琐。
用户可在创建项目时或稍后通过设置添加 repository,每个项目最多可添加 20 个附加 repository。开始使用前需要了解一项限制:准备 orb 时,仅会自动执行主 repository 的 .agents/setup 脚本;如果附加 repository 需要单独初始化,就必须将相应步骤整合进该脚本。同一天,Amp 继续精简产品,从其终端界面中移除了侧边栏——详见简讯。
Google Antigravity 2.11.0 在对话线程中渲染 HTML artefact
8 月 26 日 — Google 发布 Antigravity 2.11.0,包含 10 项改进和 30 项修复。最主要的新功能是生成式界面:agent 可以生成直接显示在对话线程中的 HTML artefact,无需使用外部预览。渲染支持 KaTeX 数学格式,以及 Chart.js 和 Plotly 图表,从而将用途扩展至即时生成的 dashboard 和可视化内容。
第二组改动集中在 agent 配置上,并进一步推动模块化。@path/to/file 语法允许在 AGENTS.md 和自定义规则文件中引用并包含外部文件;Markdown agent 的 frontmatter 中新增 rules: 键,可将规则关联到指定 agent,而不是整个项目;Antigravity 现在还会发现位于子目录中的 skills.json、agents.json 和 rules.json 文件所声明的 skill、agent 和规则——这对每个子项目都有自身配置的 monorepo 尤其有用。其余改动主要改善易用性:终端可左右拆分、YAML frontmatter 可渲染为元数据卡片、新增 Darcula 主题,以及支持读取多页文档中的指定页码范围。
GitHub:全局模型策略正式可用,并举行 OpenClaw 维护者圆桌讨论
8 月 26 日 — GitHub 面向 Copilot Business 和 Copilot Enterprise 全面推出全局模型策略。该机制于 7 月公布,为管理员提供一个统一开关,用于决定尚未明确配置的模型如何处理,从而无需在每次发布新模型时逐个作出决定。实际执行功能的部署将持续至 9 月 1 日,因此不同企业不会在同一时间完成切换。此前手动作出的决定将保持不变;无论策略设置为何值,都有两类模型不受其影响:以 DeepSeek 和 Kimi K2 为例的开放权重模型,以及不受 GitHub 数据保留协议涵盖的模型,公告以 Fable 5 为例。此外,GitHub 正在考虑移除“委托给默认策略”状态,以强制用户对每个模型作出明确决定。
8 月 27 日,GitHub 发布了一场与 OpenClaw 维护者进行的圆桌视频讨论,并配套发表文章,总结了十项经验。该 repository 由 Peter Steinberger 于 2025 年 11 月作为周末项目发起;截至 8 月 26 日,它拥有约 388,000 个星标、81,000 次 fork 和超过 80,000 次 commit——GitHub 称其为自身历史上增长最快的项目。这场访谈的价值在于揭示了 agent 进入工作流程后,维护者工作的变化:Steinberger 表示自己已经不再称其为 pull request,而是“prompt request”;Josh Lehman 则提到,一些贡献者运行自动化链,一次会创建数百个 pull request。信任信号也随之改变——现在更看重 agent 记录、截图和测试证明,而不是贡献次数——尤其是声誉本身也已经成为攻击面,有人会复制他人的 pull request 来增加自己的合并数量。
| 截至 2026 年 8 月 26 日的 OpenClaw repository 指标 | 记录值 |
|---|---|
| 星标 | 约 388,000 |
| Fork | 81,000 |
| Commit | 超过 80,000 |
| 项目启动时间 | 2025 年 11 月 |
🔗 全局模型策略 · OpenClaw 圆桌讨论
简讯
- Qwen3.8-Flash 可通过 OpenRouter 路由,并可在 75 GB 内存的本地环境中运行 — 在开放权重一天后,该模型便可通过 OpenRouter 使用,适用于代码助手、智能体工作流和长视频理解。与此同时,Unsloth 在首日便发布了其 GGUF:这个拥有 1250 亿参数的 MoE 模型可在 75 GB 内存的本地环境中运行;Unsloth 声称它超越 Claude Opus 4.6 Max,但这只是 Unsloth 单方面的说法,尚无独立测评予以证实。🔗 OpenRouter · Unsloth GGUF
- Grok 4.6 加入 Microsoft Foundry,并可从 Linear 触发 — 该模型已进入 Microsoft Foundry 目录,提供 500,000 tokens 的上下文窗口和四档推理强度,与 Amazon Bedrock 和 Google Enterprise Agent Platform 的支持形成互补。在 grok.com 上,Linear 触发器可让 Grok 分类工单、跟踪进度,并在工单分配给它后自动开始处理。🔗 Foundry 上的 Grok · Linear 触发器
- Joelle Pineau 和 Mikey 入选 TIME100 AI 2026 榜单 — Cohere 宣布其 AI 主管入选 TIME 杂志榜单,并回顾了她在加拿大超过二十年的研究历程,从智能轮椅到 ML Reproducibility Checklist。Suno 同日宣布 Mikey 入选同一榜单,但未同时发布相关产品公告。🔗 Cohere · Suno
- 一份 cookbook 将 Claude Managed Agent 接入 Vercel 的 Chat SDK — Chat SDK 提供对话界面,配备类型化的
onDirectMessage管理器和十五种以上的适配器(Slack、Teams、Discord、Web);Managed Agents 则在服务器端运行智能体,并为每段对话维持持久会话。代码已发布至 claude-quickstarts 仓库。🔗 @ClaudeDevs 的帖子 - ChatGPT iOS 版 1.2026.230:任务搜索、推理强度指示器和全屏编辑器 — 在撰写框中加入了紧凑型指示器,可从移动端调整推理强度;长提示词可使用全屏编辑器;搜索范围同时涵盖标题和内容;主屏幕快捷方式则支持 ChatGPT、Work 和 Codex Remote。与上文事件型任务属于同一条更新日志。
- Amp 移除其 TUI 的侧边栏 — 面对 orbs、runners 以及智能体之间交换的消息,Amp 认为线程跟踪更适合放在 Web 和原生应用中,而在终端自身的多路复用之上再叠加多环境复用,会带来糟糕的体验。🔗 Amp 博文
- Hugging Face 使用 Inkling-Small 生成摘要概述 — 该平台说明,其论文页面上显示的摘要由 Thinking Machines 的开放权重模型生成,打出的旗号是“开放权重 × 开放科学”。🔗 @huggingface 的帖子
- Gemini CLI 修复 MCP OAuth 元数据发现中的 SSRF 漏洞 — 8 月 27 日的每夜构建版(nightly)仅包含一项变更:修复 MCP 服务器 OAuth 元数据发现过程中的服务端请求伪造漏洞。该修复尚未进入稳定渠道,稳定版仍停留在 v0.57.0。🔗 发行说明
- Perplexity 发布 Brain 的新评测结果 — 与首批结果相比,Perplexity Computer 的自我改进记忆系统在准确性、时效性和召回率方面分别提高 9.3、8.0 和 8.9 个百分点,同时减少 15% 的 tokens 用量。🔗 @perplexity_ai 的帖子
- 插件市场支持企业自动更新 — 在
extraKnownMarketplaces条目上设置autoUpdate字段后,Copilot 客户端即可自行更新某个市场中的插件,前提是该市场仍位于strictKnownMarketplaces许可名单中。🔗 GitHub 更新日志 - 屏蔽用户现在会关闭其所有未结贡献 — 屏蔽对话框中的“关闭此用户创作的内容”选项,可一次性关闭被屏蔽用户尚未结案的 issues、discussions 和 pull requests,个人账户和组织均适用。🔗 GitHub 更新日志
- Cohere 主张采用能够帮助客户建立自身能力的驻场工程师模式 — 该博文区分了选择技术时固有的商业或架构依赖,与其认为可以避免的运营依赖;文中还援引 Deloitte 2026 报告称,只有 25% 的组织已将至少 40% 的 AI 试点项目投入生产。🔗 Cohere 博文
- Google DeepMind 制作了一期关于不确定性的播客 — 研究副总裁 Zoubin Ghahramani 与 Hannah Fry 共同解释,为何教会系统质疑自身并以概率方式推理,能在从天气预报到机器人技术的各种场景中做出更可靠的决策。🔗 @GoogleDeepMind 的帖子
- Wan 围绕 WanCLI 推出每周 Skill Challenge — 每周会选出三项发布在 wan.video 上的 skills,其作者可获得一个月的高级订阅;每项获批的 skill 还可获得 150 积分。参赛 skill 必须通过 WanCLI 调用至少一个 Wanxiang 模型。🔗 @Alibaba_Wan 的帖子
- GeForce NOW 亮相 Gamescom 2026 — 新增 DLSS 4.5 控制功能,并支持更多 Steam 设备、GOG 单点登录、Firefox 和更多 Fire TV 设备;另有五款游戏将在发售当天登陆云端。与其说是生成式 AI 新闻,不如说更偏向电子游戏资讯。🔗 NVIDIA 博文
- Runway 发布未注明产品名称的预热视频 — 视频只配有一句“你从未见过这样的东西”和一个指向应用的通用链接,既未提及模型或功能名称,工作室的新闻页面也没有对应内容。留档说明:其中无法提取任何可验证的事实。🔗 @runwayml 的帖子
这意味着什么
智能体正走进实验室,而首要壁垒是硬件而非软件。 Model Hardware Standard 要解决的不是模型问题,而是基础连接问题:Janelia 有七套制造商程序却没有统一接口,Carnegie Mellon 则有四类设备分布在三台互不兼容的计算机上。Anthropic 将集成耗时从数周缩短至数小时,把瓶颈从连接转移到了监督;它在引用 Genentech 的案例时也承认这一点——团队必须向 Claude 解释,样本起泡属于物理故障,而不是软件错误。Ai2 关于浸润性小叶癌的发现,则从流程的另一端说明了同一个道理:价值不在模型给出的答案本身,而在随后进行的独立验证和实验室验证。同日向研究人员开放的 10,000 个 Claude 席位补齐了三重方案的最后一环,着手解决第三道壁垒:使用成本。
安全正从产品层面转向共享基础设施层面。 关于集体网络防御的联合文章,其意义首先体现在参与组织上:OpenAI、Anthropic、AWS、Google、Microsoft 和 Oracle 在同一市场相互竞争,却共同署名同一份文章;文章对前沿实验室提出的一项要求——让智能体身份可追踪、可问责——正是前一天公布的 Hugging Face 事件所带来的直接教训。当天其余消息则在工具层面体现了这一转向:Codex 不再加载不可信项目中的 AGENTS.md,Claude Code 使含有不可见字符的终端链接失效,Gemini CLI 修复 MCP 服务器 OAuth 发现流程中的 SSRF 漏洞。这三项修复看似彼此无关,却指向同一个结论:代码智能体的攻击面,就是人们要求它读取的文件和服务器。
评测本身也成为需要保护的对象。 Google DeepMind 与 Singapore AI Safety Institute 开展的试点,解决了外部评测中由来已久的两难选择——究竟交出测试提示词,还是交出模型权重——其答案是两者都不交,而是通过一个由双方以密码学方式验证属性的安全飞地完成评测。这与当天其他机构公布数据时采用的方法论相呼应:Together AI 不只给出一个分数,还公开了 904 次执行、每项任务四次尝试、失败模式以及单项任务成本;Cohere 则公开承认排除 ParseBench 的两个维度,并按照 8 月修订后的规则重新评定竞争对手。两者强调的都不再是结果,而是实验协议——这表明单凭结果已经无法说服任何人。
而成功完成一项任务的成本,仍是决定性的指标。 GLM-5.3 Flash 的整个定位都源于架构层面的经济性——注意力计算量减少三分之二,KV cache 缩小至原来的 1/4.4——最终转化为每百万输入 tokens 0.15 美元的价格,几乎比同一托管商提供的 GLM-5.2 低十倍。Together AI 证明,先用 DeepSeek、再用 Sol 的级联方案能以不到单独使用 Sol 一半的价格,多解决十个百分点的任务;换言之,最好的模型不一定是最划算的选择。Replit 据此直接在产品中取消模型选择,Cohere 以满负载运行时 61% 的成本差异推广 Model Vault,Google 则为 360p 视频草稿收取三分之一的价格。就连 AWS 交付 Vera CPU 也属于这套经济逻辑:如果智能体工作负载消耗的 tokens 是聊天请求的十五倍,那么 GPU 之外的编排成本就不再只是账面上的小细节。
来源
- Anthropic — Model Hardware Standard
- Anthropic — 扩大对科学家的支持
- Anthropic — Cowork 的内置浏览器
- Claude Code — 更新日志
- Ai2 — 与 Providence Swedish 的合作
- OpenAI — 呼吁采取集体网络防御行动
- OpenAI — Codex CLI 0.150.0
- OpenAI — 在巴西的业务布局
- OpenAI — 学生能从 ChatGPT 中获得什么
- Together AI — GLM-5.3 Flash
- Together AI — DeepSWE DeepSeek 与 GPT-5.6 Sol 对比
- Z.ai — 发布 GLM-5.3 权重
- Google — Gemini Omni 1.1 Flash
- Google DeepMind — 双盲评测
- Gemini Notebook — Expert Intelligence
- Google — Antigravity 更新日志
- fal — H3 Max 介绍
- Cohere — Parse
- NVIDIA — 交付 Vera CPU
- NVIDIA — NVLink Fusion 与 NVHBM
- Warp — 自我改进循环
- Replit — 智能模型路由
- Cursor — 无需现有仓库即可开始
- Amp — 多仓库项目
- GitHub — 全局模型策略
- GitHub — OpenClaw 维护者圆桌会议