ai-powered-markdown-translator由 gpt-5.4-mini 将文章从法语翻译成中文。
7 月 17 日标志着代理式编码工具商业模式的一次变化:Amp 推出首批月度订阅,终结其纯按量付费模式。Claude Code 发布了带有 WebSearch 和子代理防失控护栏的新版本,而 Perplexity、Gemini 和 Grok 则继续强化它们面向企业的自主代理平台。HeyGen、ElevenLabs 和 Runway 的媒体生成依然活跃,开放研究也发布了两篇质疑当前模型局限性的论文。
Amp 推出首批月度订阅:Megawatt 和 Gigawatt
7 月 17 日 — Amp(Sourcegraph / Amp Frontier Corporation)以测试版形式推出首批月度订阅,这对一款此前完全按使用量计费(原始 API 价格)的产品来说是一次战略转向——这种模式让它比按订阅收费的竞争对手更贵。Amp 在其公告文章中自述,自己此前一直是“agentic coding tools 中的 Apple 或 Porsche”。
| 评估方案 | 月费 | 包含的 orbs 时长 | 包含的代理使用量 | 可用模式 |
|---|---|---|---|---|
| Megawatt | $20 | 750 小时(小型 orbs) | $20 | low, medium |
| Gigawatt | $200 | 1,000 小时(大型 orbs) | $200 | low, medium, high, ultra |
Megawatt 还包括绑定自己的 ChatGPT 订阅以访问 GPT-5.6,或绑定 X Premium+/SuperGrok 订阅的能力。限时首发优惠会将包含的使用量(orbs 和 agents)翻倍,为期一个月,适用于在 7 月 19 日星期日之前订阅的所有用户。对不想订阅的人来说,按量付费仍然可用;超过包含额度后,需要绑定 ChatGPT 订阅或追加付费积分。
Amp 将这一转向归因于高质量 token 的总体成本下降(其引用的例子是新“low”模式中的 GLM-5.2),以及代理工作从本地工作站转移到远程机器(“orbs”)——公司表示希望用户“杀死他们的单例本地开发环境”。
“Introducing Amp Subscriptions. $20 or $200 gets you on the agentic frontier with us.”
🇨🇳 Amp 订阅介绍。20 或 200 美元即可与我们一起进入 agentic 前沿。 — @sqs 在 X 上
Claude Code 与 Amp:新的代理能力
Claude Code CLI v2.1.212:防失控护栏
7 月 16 日 — Anthropic 发布 Claude Code 2.1.212 版本(巴黎时间 21:20 上线到 npm)。最明显的变化涉及 /fork:该命令现在会把对话复制到后台的新会话中(在 claude agents 中可见),而原先在会话中启动的旧子代理会被重命名为 /subtask。出现了两项防失控护栏:每个会话对 WebSearch 工具调用的限制(默认 200 次,可通过 CLAUDE_CODE_MAX_WEB_SEARCHES_PER_SESSION 调整),以及可启动子代理数量的上限(默认 200 个,CLAUDE_CODE_MAX_SUBAGENTS_PER_SESSION)。超过两分钟的 MCP 工具调用现在会自动转入后台。
还有两项安全修复:计划模式不再能在没有权限提示的情况下执行会修改文件的 Bash 命令(touch、rm),而在 .claude/worktrees 中提交的 symlink 上创建 worktree,也不再能写入仓库之外的文件。
Amp:代理现在可以再生成其他代理
7 月 17 日 — Amp 推出“From Agent to Agent”:Amp 代理现在可以生成(spawn)其他代理——可在 orbs(远程机器)上、本地机器上,或任何其他机器上——并在彼此之间交换消息和文件。
Amp 提到的用例包括:在 orb 中启动一个代理处理次要 bug,而用户继续主任务;并行运行多个线程(例如在 “low” 模式下运行四个线程,以测试四种不同屏幕尺寸下的流程);从已放弃的旧线程中取回有用文件;把任务转移到另一台机器;或通过让一个代理记录 API 变更来协调跨项目工作。该功能延续了 6 月 30 日的 “Agents in Orbs” 和 6 月 19 日的 “Custom Agents”,但首次引入了跨线程和跨机器的代理间通信。联合创始人 Thorsten Ball 在正式发布前几小时已在 X 上提前预告了这一功能。
自主代理:企业中的自动化与生产力
Ascendea 的 Manus(James):90× 生产力案例研究
7 月 17 日 — Manus 发布一则案例研究,重点介绍位于华威大学 Science Park 的英国机构 Ascendea。该机构为小型企业开发 CRM、代理和自动化系统。其 CTO Rob Arnold 将自己的 Manus 实例命名为 “James”,并将其设为公司的 AI 首席幕僚长,位于三层架构之巅:复杂任务交给 Manus,日常人机界面由 Slack 会话代理(Victor、Victoria、Ava)承担,另有六个本地代理在专用服务器上执行计划好的重复任务。
最亮眼的用例是:一天内生成了 303 份标准操作程序(SOP),若用手工方式,估计两个人需要约 14 周才能完成。如今 Ascendea 仅有 10 名员工,服务 112 位活跃客户,并通过 Manus 协调运行 28 到 33 个生产中的 AI 工作流。
Perplexity 在 Computer 中推出 Projects,作为 Spaces 的演进
7 月 17 日 — Perplexity 公布 Projects,这是 Perplexity Computer 中 Spaces 的升级版,也是其代理环境的一部分。Projects 将文件、应用和对话线程汇聚到同一个持久会话中:每个新任务都会带着前序会话的完整上下文开始。
该功能面向企业团队:它连接 Drive、Notion、Linear、Salesforce、Snowflake 或 Slack/Microsoft Teams 等工具(官方宣称支持 400 多个连接器),同时隔离每个用户的数据、记忆和访问权限。Projects 依托 Computer 的自学习记忆系统 Brain,并与 Skills 集成,还提供一个 “trust panel”,列出已连接的数据源和回答的可追溯性。现有的 Spaces 会自动迁移,今天起对所有 Computer 用户开放。值得注意的是:官方页面显示的发布日期是 7 月 22 日,但它实际上已于 7 月 17 日上线并可公开访问。
Grok 中的 Automations
7 月 16 日 — xAI 在 Grok 中推出 Automations:只需描述一次任务,然后让它自动执行,可按计划运行(一次性、每日、工作日、每周、每月或每年),也可由符合设定过滤条件的邮件到达时触发。每次执行都会打开一段与 Grok 的完整对话,可在运行历史中查看,并可通过邮件、应用通知、两者同时或都不通知来提示。
这些自动化功能可在 grok.com 和 Grok 移动应用(iOS、Android)中使用。计划任务对所有用户开放,而邮件触发器仅限 SuperGrok 订阅用户。
Google / Gemini:企业代理平台
Conductor 变为可移植插件,兼容 Antigravity CLI 和 Claude
7 月 16 日 — Conductor 是去年为 Gemini CLI 推出的、以规范驱动开发(Spec-Driven Development)为核心的开发扩展,如今变成了 Conductor Plugin:一种将 skills、规则、MCP 服务器和 hooks 打包进单一包体的格式。此前它只与 Gemini CLI 绑定,现在也可用于 Antigravity CLI 和 Claude。
该代理现在能够自然地对话,以生成并演进上下文、规范(spec.md)和计划(plan.md),并将它们作为持久化、可版本管理的 Markdown 资产保存。Google 表示,这与旧命令保持向后兼容,并且在 TerminalBench 最复杂任务子集上的成功率更高。Antigravity CLI 的安装通过 agy plugins install https://github.com/gemini-cli-extensions/conductor 完成。
🔗 官方公告
Gemini Enterprise Agent Platform 与 Parallel Web Systems 合作
7 月 16 日 — Google Cloud 宣布与 Parallel Web Systems(由 Twitter 前 CEO Parag Agrawal 创立)合作,把其搜索基础设施原生集成为 Gemini Enterprise Agent Platform 上新的网页 grounding 提供方。目标是让代理依赖最新、可验证的网页结果,并附带精确引用,用于自动化 KYC 检查或产品目录丰富等任务。
该功能可通过 Gemini API 使用,可在 Agent Studio 中选择,并通过 Google Cloud Marketplace 按量计费;对于敏感负载,还提供数据零保留选项。不同于传统网页搜索,这种集成允许提取并永久缓存数据,以丰富内部数据库,并允许其他 LLM 对结果进行后处理。根据 Parag Agrawal 的说法,AI 代理很快会比人类更频繁地使用网络,这要求搜索基础设施必须按其工作方式来设计。
🔗 官方公告
媒体生成
HeyGen — Batch APIs 上线生产环境
7 月 17 日 — HeyGen 上线其 Batch APIs,允许在一次请求中提交最多 100 个视频、翻译、口型同步(lipsyncs)或上传,并在整批处理完成后只发送一个通知 webhook。该功能面向大规模生产场景——代理公司、营销团队等——他们此前处理相同数量的内容时,需要管理数百次单独的 API 调用。
HeyGen — HyperFrames 获得集成媒体库
7 月 17 日 — HeyGen 为 HyperFrames 增加了集成媒体库,HyperFrames 是其基于代码的视频创作工具(write HTML, render video)。它汇集了 10,000 多条音频轨道、75,000 张图片、音效和 logo;只要拥有 HeyGen 账户即可免费访问,外加使用自家生成模型的权限。所用资源会被保存在本地,从而避免在每个新项目中都重复搜索。
🔗 X 上的公告
ElevenLabs — 由 Sir Michael Caine 的 AI 配音讲述《奥德赛》
7 月 17 日 — ElevenLabs 推出荷马史诗《奥德赛》的完整朗读版,由演员 Sir Michael Caine 的完整授权 AI 声音进行配音,并可在 ElevenReader 应用中免费收听。这是又一个完全获授权的名人声音合作案例,延续了 ElevenLabs 通过官方授权的 AI 声音提供高级音频内容、而非单纯通用合成的策略。
🔗 X 上的公告
Runway Agent 2.0 在独立基准 Physion-Arc 1.0 中排名第一
7 月 16—17 日 — Runway 强调了独立基准 Physion-Arc 1.0 的结果。该基准由第三方评测机构 Physion Labs 于 7 月 16 日发布,它向 30 个电影提示词投喂了 6 个 AI 视频代理,并基于 16 项指标进行评估。Runway Agent(2.0 版本,6 月底发布)在所评估的三大支柱上均居首:叙事一致性、电影语言和制作质量。
Runway 还发布了一篇技术文章,详细阐述 Agent 背后的理念:一个以视觉而非聊天为中心的界面,一个编码了每个底层模型优缺点知识的系统,以及一个将这些能力组合成工作流的“skills”层。未来方向包括:会话间上下文记忆、批量创建,以及直接在 Agent 中进行任务规划。
🔗 X 上的公告
研究与开放模型
Sakana AI — “Diffusing Blame” 研究:将 Dale 原理应用于 RL
7 月 17 日 — Sakana AI 发布 “Diffusing Blame”,这项研究探讨神经网络能否在严格遵守 Dale 原理的同时进行竞争性学习——这一生物学约束规定,神经元对邻居只能是兴奋性或抑制性之一,不能兼具两者。该论文已被 #ALIFE2026 接收,并可在 arXiv 上获取。
在同一串帖子的第二条中,团队介绍了 ED-PPO,这是 PPO(Proximal Policy Optimization)强化学习算法的一个变体,加入了符合这一生物学约束的误差扩散机制,并在一项控制任务上进行了演示。该工作属于 Sakana AI 受生物学启发的架构研究路线,与其更偏商业化的产品公告有所不同。
🔗 X 上的公告
PerceptionBench:没有模型能超过 60% 的准确率(Kimi / Moonshot AI)
7 月 16 日 — Kimi 团队发布 PerceptionBench,这是一个将大规模多模态模型的视觉感知拆分为十项原子能力的基准:视觉关系、计数、属性、深度与 3D、定位、比较、细粒度识别、上下文整合、OCR 和幻觉。这些类别来自对 40 多个现有基准中前沿模型真实失败案例的分析。数据集包含 3,000 个经过验证的问题,每个问题都只需观察即可回答,无需推理或外部知识。
“No model we evaluate clears 60% accuracy, and models with nearly identical overall scores can exhibit very different perceptual strengths and weaknesses.”
🇨🇳 没有任何受评模型的准确率超过 60%,而且总分几乎相同的模型在感知能力上也可能呈现出非常不同的强项和弱项。 — Kimi 团队,PerceptionBench
这个基准也被同一天发布的 Kimi K3 技术说明中引用,作为内部多模态评估工具。
简报
- Built with Claude:生命科学黑客松落幕 — 由 Gladstone Institutes 和 Cerebral Valley 联合举办,获奖项目包括 Trialign(临床试验匹配)、NCypher(儿童癌症 DNA 分析)、Extremolith(耐受性蛋白设计)和 Lazarus(废弃科研代码重建代理)。🔗 来源
- Boris Cherny — 企业中的 AI 采用 — Claude Code 的创建者描述了他在团队采纳 AI 过程中观察到的四个阶段,属于编辑内容而非产品公告。🔗 来源
- Hugging Face — NVIDIA 的 NeMo AutoModel 支持 Diffusers — NVIDIA 的开源微调库此前已覆盖 Transformers,如今也支持 Hugging Face 的图像生成库 Diffusers。🔗 来源
- Antigravity 2.3.1 — 修复一个配置格式错误的 bug,该 bug 会阻止 Google 的代理式 IDE 启动,没有新功能。🔗 来源
- GitHub Mobile:PR 评论中的 Fix with Copilot 按钮 — 这一按钮此前已在网页端提供,如今也可从 pull request 的主视图以及每条评审评论中访问,适用于 iOS 和 Android。🔗 来源
- NVIDIA Nemotron 3 Embed 8B — 也在 LMEB 上拿到第 1 名 — 在 RTEB 上首次登顶后,这个 embeddings 模型也在 LMEB 排行榜上位列第一;该榜单用于评估长对话记忆,相关的 1B 模型位列第二。🔗 来源
- HeyGen HyperFrames — 第 12/30 天:动态字幕 — 逐词同步的动画字幕,以即用型组件形式随 HyperFrames 目录提供。🔗 来源
- Kling AI — 首尔 NextGen Awards 颁奖礼回顾 — 回顾这场表彰使用 Kling AI 进行视觉叙事创作的创作者的颁奖礼,其中包括凭借短片 The Well 获奖的 Jo Ryeongmi。🔗 来源
- Runway — R/GA 案例研究:“Forever Founder” AI 头像 — R/GA 借助 Runway Characters API 为其创始人打造了一个实时 AI 头像,用于 50 周年纪念;该头像在 20 次对话中回答了 145 个问题,且无技术事故。🔗 来源
- ZCode:浏览器与电脑使用能力正在准备中 — Z.ai 预告了其开发环境 ZCode 未来将具备 browser use 和 computer use 能力,但尚无细节或发布时间。🔗 来源
- AI 时代的评分卡(OpenAI) — CFO Sarah Friar 关于衡量企业 AI 投资回报的文章(“每美元的有用智能”),以 ChatGPT Work 为例说明,并未宣布新产品。🔗 来源
这意味着什么
Amp 转向订阅制,再加上 Claude Code 新增的护栏(WebSearch 限制和子代理限制)以及 Amp 代理彼此生成更多代理的能力,共同勾勒出代理式编码工具的一条相同轨迹:在经历一段按量付费、增长无约束的阶段之后,行业正进入经济结构化与治理化阶段。用可预期的订阅费定价,同时限制一次会话可生成的子代理数量,本质上是在从两端解决同一个问题:让一种能够级联触发其他代理的计算方式,对厂商和用户都变得可持续。
Perplexity Projects、Gemini Enterprise 与 Parallel Web Systems 的结合,以及 Grok 的 Automations,都在企业场景中趋向同一种模式:持久上下文、与现有业务工具的连接器,以及按计划或触发器自主执行。Ascendea 的案例研究则展示了这套逻辑在小型组织中的落点:10 名员工通过 Manus 在生产环境中管理 28 到 33 条 AI 工作流——这是一个极端案例,也预示着更大组织将不得不面对的问题。
在媒体生成领域,HeyGen 正在加强其生产基础设施(Batch APIs、集成进 HyperFrames 的媒体库),ElevenLabs 则押注于完全授权的名人声音合作,而 Runway 则通过第三方独立基准验证其设计选择。由此,行业正从演示逻辑转向生产基础设施逻辑,在这一阶段,规模、授权和外部评测本身都成为卖点。
最后,开放研究提醒我们,基础能力仍有待完善:Sakana AI 的“Diffusing Blame”探索了一种前所未有的生物学约束来训练神经网络,而 Kimi 的 PerceptionBench 则显示,当前没有任何多模态模型在基础视觉感知任务上的准确率能超过 60%。这也提醒我们,尽管当天产品公告不断,模型在感知与架构层面的能力依然存在自动化功能竞赛无法轻易弥补的盲区。
来源
- Amp 订阅制,终于来了
- @sqs 在 X 上 — Amp 订阅制
- CHANGELOG Claude Code — v2.1.212
- Amp — 从代理到代理
- @thorstenball 在 X 上 — “从代理到代理”预告
- Manus — Ascendea 案例研究
- Perplexity — Projects 发布
- xAI — Grok 中的 Automations
- Google Developers Blog — Conductor Plugin
- Google Developers Blog — Gemini Enterprise Agent Platform 与 Parallel Web Systems
- @HeyGen 在 X 上 — Batch APIs
- HeyGen — Batch APIs 文档
- @HeyGen 在 X 上 — HyperFrames 媒体库
- @ElevenLabs 在 X 上 — 由 Michael Caine 讲述的《奥德赛》
- @runwayml 在 X 上 — Physion-Arc 1.0
- Runway — 我们构建 Runway Agent 的方法
- @SakanaAILabs 在 X 上 — Diffusing Blame
- arXiv 上的 Diffusing Blame
- Kimi — PerceptionBench
- @claudeai 在 X 上 — 生命科学黑客松落幕
- @bcherny 在 X 上 — 企业中的 AI 采用
- @NVIDIAAI 在 X 上 — NeMo AutoModel 与 Diffusers
- Antigravity — 更新日志
- GitHub Changelog — GitHub Mobile 上的 Fix with Copilot
- @NVIDIAAI 在 X 上 — Nemotron 3 Embed 8B 在 LMEB 上
- @HeyGen 在 X 上 — HyperFrames 第 12/30 天
- @Kling_ai 在 X 上 — 首尔 NextGen Awards
- Runway — R/GA 案例研究
- @zcode_ai 在 X 上 — ZCode browser/computer use
- OpenAI — AI 时代的评分卡