ai-powered-markdown-translator使用 gpt-5.4-mini 将文章从法语翻译成中文。
8 月 23 日,这一天谈得更少的是新能力,而更多是真实使用。Claude Code 的创建者 Boris Cherny 解释说,自 2025 年 11 月起他就不再手写代码,但仍每天用代理编程;他还把 Claude 放在三个能力层级上来描述。紧接着,他也承认 Opus 的冗长是 Anthropic 需要优先修复的问题。在 Google 这边,Gemini 3.7 Flash 于 8 月 13 日发布,成为增长最快的 Gemini 模型,并进入 Google Search;与此同时,开放的 Gemma 家族下载量突破十亿。Amp 为托管在其 orbs 上的应用提供了可读域名,而一个开放的药物性质预测基准则在每个分数旁公布了其噪声下限。
Boris Cherny 将 Claude 分为三个层级,并自 2025 年 11 月起不再手写代码
8 月 23 日 — Claude Code 的创建者将模型进步拆解为三个层级:比他更会写代码;在代码周边的工程工作上比他更强,从调试到系统设计;然后在计算机上能完成的大多数任务上超过大多数人。他认为 Claude 处于第一个层级并接近第二个层级的一部分,并将 Opus 4.8 视为第一个让他觉得比自己更强的模型。他补充说明:对于 TypeScript 设计者 Anders Hejlsberg 来说,第一个层级或许还没有被突破。
Back in Nov 2025 I fully stopped writing code by hand, though I continue to code (using agents) every day. […] But engineering is more than coding.
🇨🇳 从 2025 年 11 月开始,我就完全停止手写代码了,但我仍然每天都在编程(借助代理)。[…] 不过,工程工作不只是写代码。 — @bcherny 在 X 上
Anthropic 承认 Opus 的冗长是优先事项,并给出临时补救
8 月 23 日 — 面对有关 Opus 缺陷的追问,Boris Cherny 直接公开承认:冗长是团队已识别出的一个问题,而且优先级很高。与此同时,claude /config outputStyle=concise 命令会启用 8 月 20 日发布的 Concise 风格。真正的信息在于:Concise 不是一种舒适选项,而是团队试图从源头修正某种行为之前的临时应对方案。
同一段交流还包含一个前一天即 8 月 22 日 给出的使用建议:在迭代优化方面,Opus 可能没有被充分使用——CPU 和内存占用、CI 时间、延迟、帧率——按照一种可复现的模式,用剖析器和数据集在 X 上反复迭代,直到达到 Y。
We know Opus is not perfect, and it is a big priority for the team to fix it.
🇨🇳 我们知道 Opus 并不完美,而修复它是团队的一项重大优先事项。 — @bcherny 在 X 上
Gemini 3.7 Flash 在创下纪录级采用后进入 Google Search
8 月 22 日 — Sundar Pichai 公布的不是一个模型:Gemini 3.7 Flash 于 8 月 13 日发布。他公布的是采用速度,这是 Gemini 家族中最快的;以及部署情况:该模型如今已在 Google Search 中运行,同时也用于 Gemini 应用。发布时,它仅通过 Spark 向 Pro 和 Ultra 订阅者、Gemini Enterprise Agent Platform 以及 API 开放——进入 Search 之后,其曝光规模发生了变化。
| 已评测基准 | 得分 | 每任务成本(USD) |
|---|---|---|
| ARC-AGI-1 | 95,5 % | 0,12 |
| ARC-AGI-2 | 84,6 % | 0,25 |
Gemini 3.7 Flash smashed previous Gemini growth records in its first week, making it our fastest growing model yet.
🇨🇳 Gemini 3.7 Flash 在第一周就打破了此前 Gemini 的增长纪录,使其成为我们迄今增长最快的模型。 — @sundarpichai 在 X 上
🔗 ARC Prize 于 8 月 20 日发布的 ARC-AGI 分数
Gemma 突破十亿次下载,Google 发布 Awesome Gemma 仓库
8 月 20 日 — 来自 Google DeepMind 的 Clement Farabet 和 Olivier Lacombe 宣布,开放模型家族 Gemma 的累计下载量已超过 10 亿次,社区在两年内发布了超过 10 万个变体。被提及的部署体现了其覆盖范围:NASA、Satlyt 和 Starcloud 将 Gemma 部署在卫星上,用于机载图像分析;在印度,National Health Authority 已将 Gemma 4 集成到 Aarogya Setu 2.0 中,用于标准化医疗报告。在研究方面,Yale 和 Google 基于 Gemma 构建的 C2S-Scale 识别出一条抗癌治疗路径,随后在活细胞上得到了验证。Google 还为开发者准备了一项配套交付物:GitHub 仓库 Awesome Gemma,这是该生态系统项目和教程的官方目录。
| 测量指标 | 公布的数值 |
|---|---|
| Gemma 累计下载量 | 超过 10 亿 |
| 社区发布的变体 | 超过 100 000 |
| 提交到 Gemma Challenge 的项目 | 超过 1 600 |
Amp 为其 orbs 的 portals 提供可读域名
8 月 23 日 — orb 是 Amp 运行代理的远程、一次性机器;portal 则是一个 HTTP 入口,可在浏览器中打开该 orb 上正在构建的应用。每个 portal 原先都会收到一个难以辨认的自动生成地址,例如 t-01a0095e-9568-whatever-p1234.onamp.dev——用来看一眼还行,但传给团队链接时就不太实用了。现在有三种替代方式:自定义前缀、个人域名,或工作区域名(workspace)。Amp 还举例说明了 park.mixfox.org 这样的普通地址,它可服务于托管在 orb 上的应用。配置可以在 Portal 标签页中完成,也可以直接让代理来处理。其公开说明中的动机与功能同样重要:portal 越来越不像临时预览,而越来越像持久化应用。仍然有一个限制,Quinn Slack 也予以确认:共享不会跨越工作区边界。
🔗 Amp 公告
LEADBOARD 发布其药物预测基准的噪声下限
8 月 22 日 — FINAL-Bench 团队在 Hugging Face 上发布了一个开放的药物性质预测基准:21 个表格、7 个学科、212 670 个训练化合物和 18 382 个测试化合物。与其说这篇文章是一次发布,不如说是一场方法论展示。在 hERG 表上,把时间切分改为随机切分,会让 AUROC 从 0,606 提升到 0,818,而分子、指纹、算法和超参数都保持不变:随机抽样只是把同一化学系列分到测试集的两边。第二个发现来自标签质量:hERG 的噪声下限为 0,421;而在 19 个回归表上,简单预测均值就在其中 7 个表上获得了最佳绝对误差。
| hERG 数据切分 | 得到的 AUROC | 模型的 MAE | 常数的 MAE |
|---|---|---|---|
| 时间切分,2022 年截断 | 0,606 | 0,599 | 0,589 |
| 随机切分,5 个种子均值 | 0,818 | 0,457 | 0,671 |
🔗 Hugging Face 上的 FINAL-Bench 文章
简讯
- 为什么手机端会话启动花了这么久 — 在昨天报道的公告之后,Boris Cherny 于 8 月 22 日 解释说,默认安全设置决定了时间表:设备信任与验证,以及对 prompt 注入的防护。后续还会有其他更新。🔗 @bcherny 线程
- GitHub 重新强调 Dependabot 冷却期 — 没有安全风险的版本升级会等待三天,以便扫描器识别被投毒的版本;安全补丁仍然立即生效。延迟可通过
cooldown调整。7 月 23 日的博文在 8 月 23 日 被重新强调。🔗 @github 推文 - 蒙特利尔 Music Technology Hackathon 上的 Stable Audio 3.0 — 与 Music Hackspace 和 MUTEK 合作举办的 48 小时黑客松,时间为 8 月 22 日和 23 日,围绕面向音乐制作人的工具展开。Stability AI 在此强调开放权重:透明度、艺术控制,以及对技术使用方式的话语权。🔗 收官视频
- DOOM 运行在一颗由 GPT-5.6 Sol 设计的处理器上 — 该模型在游戏 Turing Complete 中组装出了一颗名为 Codex-R32 的 RV32IM 处理器,PureDOOM 移植版则以原生机器码在其上运行。该演示于 8 月 23 日 由 @OpenAIDevs 转发。🔗 @Angaisb_ 线程
这意味着什么
这个周末没有任何模型发布,这正是让这一天显得清晰的原因。真正发生变化的是现有模型的部署、实际使用它们的人数,以及那些妨碍使用体验的问题被修正。各家公司在推进采用,而不是发布公告。
在开发工具方面,Boris Cherny 的表述之所以重要,主要在于他在同一句话里划出的边界:对一部分从业者来说,编码似乎已经解决了,但工程没有;而且他还特意引用了一位专家,在那位专家看来,第一个层级甚至都还没达到。对 Opus 冗长性的承认也与此一致:模型的默认行为已经变成了一个独立的产品问题。像 outputStyle=concise 这样的配置补救把负担转移给了用户,而 Anthropic 也明确将其视为临时修复而予以接受。
本周末,大规模部署呈现出三种不同形式。Gemini 3.7 Flash 从订阅用户和开发者范围走向 Search,按照 ARC-AGI-2 上 84,6 % 的得分和每任务 0,25 USD 的成本,这在经济上变得可行。Gemma 则通过下载量和社区变体来衡量采用程度,而其在轨道与公共卫生中的部署,与任何演示型用例都截然不同。最后,Amp 只是顺势承认了它未预料到的一种用法:当一次性预览变成持久化应用时,就必须给它们一个稳定地址。
剩下的是测量问题,而 LEADBOARD 出现得正是时候。若不改变模型一行代码就能得到 0,21 个 AUROC 点的差异,一条恒定预测却在 19 个回归表中的 7 个上胜过模型:没有切分方式、噪声下限和基线参考的已发布分数,是无法解释的。这正是 Google 同一周末重点强调 ARC-AGI 数值的原因——来自第三方的、经过验证模式下的测量,而不是内部自报的结果。
来源
- Boris Cherny — 三个能力层级
- Boris Cherny — Opus 的冗长与 Concise 风格
- Boris Cherny — Opus 与迭代优化
- Boris Cherny — 远程会话启动安全性
- Sundar Pichai — Gemini 3.7 Flash 进入 Search
- Logan Kilpatrick — Gemini 3.7 Flash 的增长
- ARC Prize — Gemini 3.7 Flash 的 ARC-AGI 结果
- Google DeepMind — Gemma 下载量突破十亿
- Amp — orb portals 的域名
- Quinn Slack — 共享仍限于 workspace
- FINAL-Bench — Hugging Face 上的 LEADBOARD
- LEADBOARD — Hugging Face Space
- GitHub — Dependabot 冷却期
- GitHub 博客 — 支持冷却期的理由
- Stability AI — 蒙特利尔黑客松
- 运行在 Codex-R32 处理器上的 DOOM