搜索

Google Cloud 推出面向工作的 Gemini 智能体、HeyGen Voice 及 Claude Managed Agents 动态工作流

ai-powered-markdown-translator

文章由 gpt-6.1-sol 从法语翻译成中文。

在 GitHub 上查看项目 ↗

Google Cloud 于 10 月 8 日在 Gemini at Work 2026 上发布了 Gemini 智能体:一个处理企业全部工作的智能体,在云端持续运行,同时编排 Gemini 和 Claude 模型。HeyGen 则推出了首款自研语音模型 HeyGen Voice,并登顶 Artificial Analysis 的 Controlled Voice 排行榜;与此同时,Anthropic 在 Claude Managed Agents 中开放了单次执行最多可启动 1 000 个智能体的工作流。在编程方面,Codex 开始预测用户的下一条消息,并在 Windows 上采用基于 Microsoft Execution Containers 的新沙箱。


Google Cloud 推出 Gemini 智能体,用一个智能体处理全部工作

10 月 8 日 — Google Cloud 在 Gemini at Work 2026 上发布了 Gemini 智能体,将其描述为统一、通用的工作智能体。通过一个输入框和一个 API,它就能回答问题、处理知识工作、创作图像和媒体内容,以及编写和执行代码。Google Cloud 首席执行官托马斯·库里安主张的理念是:交给它一个目标,而非一连串指令。

该智能体在云端持续运行,共享一套记忆,并可在各处使用:网页、iOS、Android、Windows、Mac、命令行、Google Workspace、Microsoft 365 和 Slack,也可在第三方应用中以无界面(headless)方式运行。耗时数小时或数天的任务,即使关闭电脑也能继续。处理长期任务时,它会创建各自拥有身份的临时子智能体,也能成为承担固定职责的同事智能体(coworker agent),拥有自己的 @agents.company.com 地址和存储空间。模型选择由此成为独立的一环:据 Google 称,该智能体已经能够编排 Gemini 模型和 Anthropic 的 Claude 模型,之后还将支持其他专有及开放模型。面向金融和法律领域的版本将进入预览阶段,其中金融版本提供超过 50 项基础技能,已被 CME Group 和 Deutsche Bank 使用。

公布的控制组件Google 描述的作用
每个智能体的身份通过密码学认证的身份、按角色分配的权限、以该身份记录的审计日志
Agent Sandbox隔离执行,拥有独立的网络边界
Agent Gateway面向人工智能的网络防火墙,智能体的全部流量均通过该组件
实时支出上限在 Cloud Billing 中,项目智能体会暂停,可一键恢复

Google Cloud 还公布了一些数据:近 500 家客户各自在一年内处理了超过 1 万亿 tokens,近 90 % 的 Fortune 100 企业使用 Gemini Enterprise。不过,博文没有给出智能体本身的上线日期或价格;Google Cloud 仅列举了提前试用的大型客户,例如运动品牌 On 曾用它动态选择模型。

🔗 Gemini at Work 2026(Google Cloud 博客)

Gemini Enterprise 为 Antigravity 工具开放 Claude Opus 5.5 和 Claude Sonnet 5.5

10 月 8 日 — 同一天,Gemini Enterprise 的版本说明宣布,管理员可以在 Antigravity 2.0、Antigravity CLI 和面向 IDE 的 Antigravity 扩展中启用 Claude Opus 5.5 和 Claude Sonnet 5.5。管理员可直接在 Google Cloud 控制台接受其使用条款,无需单独注册 Anthropic 账户。

启用设置Google 公布的值
默认状态第三方模型默认禁用,由管理员启用
计费方式按用量计费,计入项目支出上限
推理位置global、us 和 eu
思考级别Low、Medium(默认)、High 或 Max

开发者继续使用原有的 Gemini Enterprise 许可证,并在模型选择器中选择 Claude。开放第三方模型之前,必须启用超额用量(overages);其费用会计入所有模型共用的支出上限。同一页面还宣布 Gemini 3.8 Flash 在新加坡正式推出。

🔗 Gemini Enterprise 版本说明


语音:HeyGen Voice 登顶 Controlled Voice 排行榜,Mistral 发布两款阿拉伯语模型

10 月 9 日 — HeyGen 推出 HeyGen Voice,约书亚·徐称其为公司首款内部开发的语音模型;该公司此前以数字人闻名。该模型可在 HeyGen 中或通过 API 使用,价格为每百万字符 30 美元;截至 10 月 31 日,API 用户只需支付 15 美元,折扣自动生效。

其表现依据来自 Artificial Analysis,该机构在 HeyGen 发布消息前一分半钟公布了评测结果。在 Controlled Voice 排行榜中,所有模型都使用相同的 8 个克隆声音,分别讲美式和英式英语;HeyGen Voice 以 1 201 的 Elo 和 1 468 次参评登上第一名。它还在助手、客户服务及英式英语类别中排名第一。

HeyGen Voice takes the #1 spot on the Artificial Analysis Controlled Voice TTS Arena Leaderboard, ahead of Alibaba’s Qwen-Audio-3.1-TTS-Plus and ElevenLabs’ Eleven v4 Turbo

🇨🇳 HeyGen Voice 登顶 Artificial Analysis 的 Controlled Voice TTS Arena 排行榜,领先于 Alibaba 的 Qwen-Audio-3.1-TTS-Plus 和 ElevenLabs 的 Eleven v4 Turbo。 — @ArtificialAnlys 在 X 上

参评模型Controlled Voice Elo(10 月 9 日)API 每百万字符价格
HeyGen Voice1 20130 美元(截至 10 月 31 日为 15 美元)
Qwen-Audio-3.1-TTS-Plus1 18219,3 美元
Eleven v4 Turbo1 16640 美元
Eleven v41 16280 美元

这一第一名有明确的适用范围:仅针对声音克隆。在各供应商使用自家声音的 Provider Voice 排行榜上,截至 10 月 9 日晚,Eleven v4 Turbo 和 Eleven v4 仍居榜首,HeyGen Voice 未进入前八名。在发音稳健性方面,HeyGen Voice 得分为 83,1 %,在 29 个模型中排名第 10。

在 API 方面,声音克隆可即时完成:只需一段录音,仅使用前三分钟,就能在数秒内生成可用声音,无需训练。语音合成可一次性生成完整文件(44,1 kHz 的 WAV 文件),也可流式输出;Artificial Analysis 评测使用的是 API 默认设置。

🔗 HeyGen 公告

Voxtral Mini 4B Realtime Arabic 和 LIDstral Arabic:Mistral 的两款阿拉伯语模型

10 月 8 日 — Mistral 未发布公告,直接在 Hugging Face 上上线了两款采用 Apache 2.0 许可证的阿拉伯语开放模型。Voxtral Mini 4B Realtime Arabic 可流式转写阿拉伯语方言和现代标准阿拉伯语,也能处理说话者在对话中切换语言(code-switching)的情况。它基于 Voxtral Mini 4B Realtime 微调,约有 44 亿个参数。据模型说明,该模型由 Mistral 与摩洛哥数字转型和行政改革部共同开发,属于 Mistral 与摩洛哥于 2026 年 1 月签署的合作项目;该项目还推出了 ISMA 和 Darija in the Wild 两项新基准测试。

发布的模型模型功能模型说明中的结果
Voxtral Mini 4B Realtime Arabic阿拉伯语流式转写在 480 ms 延迟下,7 项基准测试的平均字符错误率为 8,82 %,Voxtral Transcribe Arabic 则为 7,91 %
LIDstral Arabic在处理器上识别语言和方言,共 51 个类别摩洛哥阿拉伯语方言的 F1 为 88,67 %,GlotLID v3 则为 71,28 %

🔗 Hugging Face 上的 Voxtral Mini 4B Realtime Arabic · Hugging Face 上的 LIDstral Arabic


Claude Managed Agents:动态工作流单次执行最多可启动 1 000 个智能体

10 月 9 日 — Anthropic 为 Claude Managed Agents 的动态工作流(dynamic workflows)开放公开测试,这是一种新的多智能体编排方式。主导会话的智能体自行编写程序,由服务器在后台执行,分阶段启动大量智能体,然后合并结果。启用 multiagent_20261001 类型后,是否启动一次执行由智能体自行决定。

单次执行最多可启动 1 000 个智能体,其中 64 个可同时运行;默认存续 24 小时,一个会话最多可保留 10 个正在运行的执行。其 tokens 按会话的相同方式计费,并计入会话预算;Anthropic 提醒,消耗量可能很大,并引用了一项内部测试:在包含 116 000 行代码的代码库中植入了 70 个错误。

Anthropic 的测试配置3 次试验中发现的错误数
单个智能体14、15 和 27
动态工作流每次均为 66

🔗 @ClaudeDevs 的公告 · 工作流执行文档


编程智能体:Codex 的消息预测与 MXC 沙箱、Claude Code 2.1.296、Vibe CLI 2.26.1

Codex 在同一天迎来两项新功能,Anthropic 和 Mistral 则发布了各自命令行智能体的新版本。

Codex 预测用户的下一条消息,面向 Pro 订阅用户开放测试

10 月 9 日 — OpenAI 在 Codex 桌面应用中开放输入框预测(composer predictions)测试。Codex 完成回复后,输入框可能会显示下一条消息建议;建议根据当前对话生成,不会查阅记忆或已连接的应用。按 Tab 键即可插入;文本仍可编辑,且绝不会自动发送。建议针对完整的一条消息,而非逐词补全。

测试条件OpenAI 公布的值
套餐与年龄个人 ChatGPT Pro,年满 18 岁
对话与模型本地及 SSH 对话,使用 GPT-6 Astra 或 GPT-6.1 Sol
默认设置已启用,可在 General > Composer > Show predictions 中关闭
测试期间费用不计入 Codex 使用限额,不消耗额度

已发送的消息仍按正常方式计入用量,包括接受预测后发送的消息。Chat 中没有此功能。

🔗 @OpenAIDevs 的公告 · OpenAI 帮助文章

Windows 上的 Codex:基于 Microsoft Execution Containers 的沙箱

10 月 9 日 — OpenAI 为 Windows 上的 Codex 添加了基于 Microsoft Execution Containers(MXC)的沙箱模式,Microsoft 已于 10 月 7 日正式推出该技术。它要求使用兼容的 Windows 11 设备(24H2 build 26100.9278 或 25H2 build 26200.9278),并承诺提供更快的配置、更严格的网络控制,以及更精细的文件访问设置。

据文档说明,MXC 成为推荐实现:它原生隔离进程,无需管理员批准配置,也无需额外的 Windows 账户或本地防火墙规则。elevated 和 unelevated 模式成为传统备用方案。桌面应用会自动为个人账户选择 MXC;在 CLI 或企业环境中,可通过 config.toml 中的 prefer_mxc = true 启用,管理员也可以用 allow_mxc = false 阻止启用。文档列出两项限制:受管理网络要求 allow_local_binding = true,且前台命令结束时,仍在运行的子进程会被终止。

🔗 @OpenAIDevs 的公告 · Windows 沙箱文档

Claude Code 2.1.296:子智能体专用压缩,以及工作流智能体统一模型

10 月 9 日 — Claude Code 2.1.296 包含 79 项更新,其中 56 项为修复,没有配套推文。该版本主要增强了对子智能体的控制。

版本新功能带来的变化
autoCompactWindow(子智能体,--agents)子智能体可以比主对话更早压缩上下文
CLAUDE_CODE_WORKFLOW_SUBAGENT_MODEL工作流中的所有智能体使用同一模型,其他子智能体保留各自的模型
Read 的 allow_large 选项上下文容量允许时,可一次调用读取大型文本文件
CLAUDE_CODE_OVERLOADED_RETRY_MAX_DELAY_MS遇到 529 错误后,两次重试之间允许更长的最大等待时间
提前发送 MCP 工具描述默认长度上限从 2 048 提高到 4 096 个字符

/cost 和状态栏现在按每百万 tokens 0,10 美元计算 Sonnet 5.5 的缓存读取费用。在安全方面,该版本修复了受管理的 PreToolUse hooks 拒绝调用却未结束回合的问题、Bash 检查自动批准某些使用 BASH_ARGV0 的命令的问题,以及云端会话对 Claude in Chrome 操作跳过自动模式检查的问题;此外,过去会替换非 UTF-8 文件中所有非 ASCII 字符的 Edit 和 NotebookEdit 修改操作,现在会被拒绝。

🔗 GitHub 上的 Claude Code 2.1.296

Vibe CLI 2.26.1:移除本地 Devstral 模型,非交互模式更加完善

10 月 9 日 — 在 2.26.0 发布三天后,Mistral 未发推文便发布了 Vibe CLI 2.26.1。虽然版本号属于补丁更新,这一版却包含 85 项条目(23 项新增、24 项变更、36 项修复、2 项移除),其中 37 项涉及新的 Rust 界面。它移除了此前内置的本地 Devstral 模型:仍固定使用该模型的配置会显示警告,并回退到默认托管模型。后者现在仅提供 off 和 high 两个推理等级,并声明了 256k 的上下文窗口,自动压缩也以此为依据。

非交互模式 vibe -p 新增时间限制、从文件或标准输入读取提示词、每次退出时写入 export.json 报告,以及不同的退出码:1 表示使用方式或配置错误,2 表示基础设施故障,3 表示达到限制或模型拒绝执行。Rust CLI 新增 /proxy-setup、朗读每轮摘要的播报器、/plugins 和 /whoami。新增设置可禁止智能体启动后台进程或子智能体,Document Library 连接器仍默认禁用。

🔗 Vibe CLI 2.26.1 版本说明


生成式图像、视频与游戏:Qwen-Image-2.1-Turbo、Midjourney 的 Thinking 模式、Synthesia 的 Syren、Google 的 Playground

更快、更便宜的图像模型,会自行检查结果的生成器,剪辑视频的智能体,以及无需编程的游戏平台。

Qwen-Image-2.1-Turbo:8 步去噪,每张图像 0,016 美元

10 月 9 日 — Qwen 发布 Qwen-Image-2.1-Turbo,这是 Qwen-Image-2.1 的加速模型检查点(加速检查点),沿用相同的 70 亿参数架构,以 8 步去噪生成和编辑图像。Qwen 表示,它仍可生成 2K 图像,并接受自然语言编辑指令,但尚未公布这一版本具体的质量或速度数据。权重已在 Hugging Face 和 ModelScope 上发布,采用 Qwen 研究许可证(Qwen Research License)。该检查点内置 8 步采样调度方案,默认 CFG 为 1。

同日,Qwen 正式开放 Qwen-Image-2.1 Pro 和 Turbo 的 API;QwenCloud 为 Turbo 提供每分钟 120 次请求的额度。

API 提供的模型(Model Studio)每张图像价格免费图像数量
qwen-image-2.1-turbo0,016 美元10
qwen-image-2.1-pro0,04 美元10
qwen-image-2.0-pro0,075 美元100

🔗 Qwen 公告 · Hugging Face 模型介绍

Midjourney 测试 Thinking 模式,并在其早期测试网站开放共享文件夹

10 月 8 日 — Midjourney 当晚发布的早期测试版更新日志介绍了两项初期功能,目前仅在 alpha.midjourney.com 上提供。第一项是测试功能:对于使用 V8.2 生成或编辑的图像,Rerun (Thinking) 按钮会让模型检查结果,找出与提示词不符的地方(物体、布局、解剖结构、文字),然后重新生成。Midjourney 表示,提示词遵循程度、文字排版和一致性均有所改善,并考虑将其发展为通用模式。

第二项是文件夹共享:可以邀请能直接在文件夹中生成内容的协作者,或仅能查看的阅读者,也可以通过链接共享,甚至向所有 Midjourney 成员开放文件夹。Midjourney 强调,共享不会改变图像的可见性:如果未启用隐身模式,图像仍可能出现在 Explore 和个人主页上。

🔗 Midjourney 早期测试版更新日志 · Thinking 模式测试(Midjourney)

Syren:Synthesia 将视频创作交给智能体,现已进入测试阶段

10 月 9 日 — Synthesia 向所有客户推出 Syren 测试版,包括免费账户。用户描述想要的视频,或提供文档、图像、视频、PowerPoint 演示文稿或 YouTube 链接,Syren 就会交付包含图形动画(动态图形)、虚拟人物、旁白、音乐和补充镜头(辅助画面)的完整视频,之后可通过对话修改。Synthesia 首席技术官彼得·希尔表示,智能体会将整个视频编写成代码,再由内部开发的渲染引擎实时播放;该引擎自 6 月起已用于 Synthesia 的动画。

视频最长可达 3 分钟,支持横屏或竖屏格式,并在浏览器中渲染。费用按点数计算,尚未公布详细价格,Enterprise 管理员可以禁用该工具。博文还预告,即将支持从现有视频中自动学习品牌形象。Syren 的推出比 HeyGen 的 HyperFrames Studio 晚四天,比 Anthropic 的 Claude Motion 晚一天;后两者也都由智能体制作视频。

🔗 Syren 介绍(Synthesia)

Playground:Google 开放无需编程即可制作游戏的平台

10 月 7 日 — Google 推出 Playground,这是一款实验性游戏平台,用户只需用几条提示词描述游戏,就能创建、游玩和分享,无需编写代码。在对话界面中,用户可以从零开始、改编示例,或接受引导,再按需调整物理效果、规则、角色或场景。

游戏可在手机和电脑的浏览器中运行,可以保持私密、通过链接分享,或加入 Explore 展示库;部分游戏类型支持排行榜和多人模式,每款发布的游戏都会经过安全检查。Playground 向美国 18 岁及以上用户开放,创建权限取决于 Google AI 订阅。Google 还预告,即将推出与 Unity Spark 的集成封闭测试,用于制作规模更大的 3D 游戏。Google 未说明平台由哪个模型驱动。

🔗 Playground 介绍(Google 博客)


医疗健康:AMIE 临床研究发表于 The Lancet

10 月 8 日 — Google 和贝斯以色列女执事医疗中心(BIDMC)在 The Lancet 上发表了一项针对 AMIE(Articulate Medical Intelligence Explorer)的前瞻性可行性研究。AMIE 是 Google 的对话式诊断人工智能;Google 表示,这是它首次在 The Lancet 主刊发表论文。患者最早在紧急就诊前五天与 AMIE 交流,医生随后会收到对话记录和摘要。

研究指标公布结果
纳入患者(2025 年 4 月至 11 月),随后接受随访的人数114,随后 98
因安全原因终止的次数0
发现的幻觉1
医生认为 AMIE 有助于就诊准备的病例44 例中的 33 例(75 %)
与最终诊断一致的诊断比例(Google)90 %

这项研究仅在一个中心开展,没有对照组,并由 Alphabet 资助;它既不代表获批,也不意味着部署,作者呼吁开展更大规模的试验。

🔗 Google 博文 · The Lancet 论文


OpenAI 的研究工作:回应被公司解聘的三名研究人员的公开信

10 月 9 日 — OpenAI 在 @OpenAINewsroom 上以研究负责人的名义发布说明,回应三名研究人员的公开信;OpenAI 称,上一周已与这三人终止雇佣关系。OpenAI 表示,内部调查认定他们违反了处理敏感信息的明确规定,造成的信任破裂超出了信中披露的范围,因此公司维持原决定。它强调,这些决定与他们提出安全担忧或公开发言无关,公司不会因员工表达担忧而将其解雇。

说明还宣布:

We are actively finalizing contracts with third-party safety assessors and will announce details in the coming weeks.

🇨🇳 我们正在积极敲定与第三方安全评估机构的合同,并将在未来几周公布详情。 — @OpenAINewsroom 在 X 上

OpenAI 表示,在一点上认同这封信:维持前沿模型的可监测性(监测能力)需要整个行业共同投入,包括 OpenAI。本篇报道转述的是 OpenAI 的说法,尚未查阅研究人员的公开信。


制作开放模型:ML Intern 以约 103 美元完成六个模型,Ai2 介绍 GPU 调度器

两则模型制作经验分享:一则来自智能体,另一则来自计算集群。

ML Intern:约 103 美元计算成本,完成六个开放模型

10 月 8 日 — 本刊已于 10 月 1 日和 8 日从其他角度介绍过 HuggingChat 的 ML Intern 模式,如今 Hugging Face 博客首次公布量化总结:六个从头到尾完成的项目,总计算成本约 103 美元。每个项目都从一条消息开始,最终在 Hub 上发布公开模型,并完成评估。智能体制定计划,在执行任何收费计算任务前请求授权,先运行简短测试,再使用 Hugging Face 的硬件训练、评估和发布。

ML Intern 制作的模型公布结果计算成本
Pocket Rewriter (0.8B)99,7 % 的输出有效,词元数量约为 Qwen-Image 2.1 的 9B 重写模型的四分之一约 16 美元
Citrus Doctor (Qwen3.5-2B)柑橘疾病诊断正确率从 14,9 % 提升至 52,8 %约 1,90 美元
两个用于 Qwen-Image 2.1 的 LoRA改变观察角度,将涂鸦替换为指定物体约 16 和 24,30 美元
Huggy LoRA (FLUX.2 klein)角色 LoRA约 7,60 美元
Agate 4 步蒸馏小型图像模型,将 50 步(使用引导时为 100 次计算)降至 4 步约 37 美元

🔗 Hugging Face 博文

Ai2 的 GPU 调度器:等待时间中位数从 5 分钟降至 24 秒

10 月 9 日 — Ai2 在杰里米·特里巴署名的博文中详细介绍了其 GPU 集群的新调度器。数千块 NVIDIA H100、B200 和 B300 GPU 分布在规模为 88 至 1 024 块 GPU 的集群中,由约 150 名研究人员共享,需求达到供给的两到三倍。旧的优先级系统使 GPU 被空任务“占着不放”,所有工作负载最终都被设为最高优先级。

新系统依靠沿研究组织层级分配的 GPU 时间预算、按滚动七天计算的分层公平共享(公平份额),以及一份“调度合约”:每个工作负载声明最长 8 小时的受保护运行时间,之后便可能被抢占并重新排队。未分配的时间仍可免费使用,但始终可能被抢占。

Ai2 测量的指标旧调度器新调度器
最大 H100 集群的等待时间中位数5 分钟24 秒
调试工作负载的 p90 等待时间2 小时30 秒
30 天内应分配 GPU 小时的实际交付率—98 %

需要人工介入的修复减少了 74 %。Ai2 承认存在局限,例如交互会话在 8 小时后就可能被抢占,而此前可以持续一周;公司也未公布任何代码。

🔗 Ai2 博文


决策模型:pplx-decider-v1.1-27b 领跑 Decision Bench,与另外九个模型在统计上并列

10 月 9 日 — 本刊已于 10 月 6 日和 8 日报道过的 Perplexity 决策模型,如今获得了外部评测结果。在 Atlan Frontier Labs 的开源基准 Decision Bench 上(1 071 道封闭式问题、36 个数据集、15 个模型参与排名),pplx-decider-v1.1-27b 取得最高原始得分 94,5 %,同时成本最低,每 1 000 次决策仅需 0,017 美元。不过,该网站将 95 % 置信区间重叠的模型列为同一名次,因此共有十个模型并列第一。

在 Decision Bench 上评测的模型实测准确率每 1 000 行成本
pplx-decider-v1.1-27b94,5 %0,017 美元
DeepSeek V4.1 Flash94,2 %0,683 美元
Gemini 3.5 Flash94,2 %3,32 美元
Jev 1.1393,8 %0,044 美元

Perplexity 还发布了浏览智能体的实用指南(操作手册),其中点击操作始终由代码决定,模型不会决定点击;API 中的 v1 也已被 v1.1 替代。

🔗 @perplexitydevs 帖子串 · Decision Bench 排行榜


Grok Bot 获得专属电子邮箱地址

10 月 9 日 — SpaceXAI 的智能体 Grok Bot 现已拥有自己的电子邮箱地址。它可以用这个邮箱注册服务、代表用户联系企业,或与他人预约见面。该功能当天开始推出:只需向机器人索要地址,或在 X 上提及 @bot;团队使用时,管理员须先启用功能。

公告仅以 @bot 账户的帖子串形式发布,并由 @grok 转发,x.ai 上没有相关博文。公告未说明地址格式、域名或适用套餐。继 9 月底为 Team Bots 提供专属 Slack 标识后,该智能体如今又获得了用于对外行动的独立身份。

🔗 Grok Bot 公告


ElevenLabs 进驻新加坡,设立东南亚枢纽

10 月 8 日 — ElevenLabs 正式宣布进驻新加坡,开设办公室作为东南亚乃至整个亚太地区的枢纽。博文强调了已经建成的基础设施:自 7 月起,企业便可将数据托管在新加坡,并选择零留存选项,同时享受更低的区域延迟。

ElevenLabs 主要列举了当地客户:在五个市场通过对话式人工智能筛选潜在客户的 Funding Societies、马来西亚的 Boost Bank、菲律宾的 Salmon Group、印度尼西亚的 MNC Group,以及新加坡 60 % 公立医院使用的医疗平台 Rezonate。公告未披露员工人数。此次落地紧随 9 月底和 10 月初在布鲁塞尔与阿姆斯特丹的设点。

🔗 ElevenLabs 博文


简讯

  • Claude Code 中的 Projects — Anthropic 已向所有登记候补名单的 Pro 和 Max 订阅用户开放访问。Projects 仍处于测试阶段:候补名单继续开放,后续将根据容量逐步开放更多访问权限;据文档说明,该功能尚未向 Team 和 Enterprise 提供。🔗 来源
  • 智能体自动化指南 — claude.dev 的一份指南介绍了基于 Claude Managed Agents 的参考实现:定时读取 Slack 频道和 GitHub 拉取请求,再将摘要发布到 Slack。指南详细说明了六个组件及其应对常见故障的措施,例如避免将无法读取的数据源误判为当天没有动态,或将支出上限设为一次正常运行成本的 3 至 5 倍。🔗 来源
  • Block 与 Claude Fable — 在 Anthropic 发布的一次访谈中,Block 介绍,Claude Fable 负责规划其大型代码迁移,并指挥多达数十个 Opus 或 Sonnet 模型,单次迁移最多可合并一千个拉取请求;合并和上线仍由人类负责,部署需要双重审批。🔗 来源
  • Claude Enterprise 的 Compliance API — 其对话端点(endpoints)现已在测试阶段支持使用现有密钥返回统一 Claude 体验中的对话:在云端会话中继续进行的对话会作为同一段对话返回,Claude 的工作内容以 tool_use 和 tool_result 块呈现。🔗 来源
  • Codex CLI 0.162.1 — 这一针对 0.162.0 的修补版本修复了多行异步提问导致的 TUI 崩溃,以及已运行的后台服务器与 CLI 的功能设置不一致时导致的启动失败。🔗 来源
  • ChatGPT Enterprise 和 Edu 中按角色配置插件 — 启用基于角色的访问控制(RBAC)后,所有者和管理员可以逐个角色设置插件访问权限:工作区设置可选 Available、Install 或 Disabled,自定义角色选择 Default 即可继承该设置。🔗 来源
  • Sophos 与 OpenAI Daybreak — 据这家网络安全厂商称,其使用 Daybreak 构建的智能体将所处理案件的平均响应时间从约 38 分钟缩短至约 89 秒,且 52 % 的 MDR 案件由人工智能全程解决;破坏性操作仍接受人类监督。🔗 来源
  • Asana 与 StackAI 的浏览智能体 — 据 Asana 称,Codex 中的 GPT-6 Astra 用约一周时间优化了该智能体:在 GPT-6.1 Sol 上,一次测试运行成本为 0,47 美元,耗时约四分钟,相比原生产配置,成本降至约 1/76,速度提升至 5 倍。🔗 来源
  • LegalOn 与 Codex — LegalOn Technologies 表示,通过从无限制快速模式下的 GPT-5.5,改为在 GPT-6 Luna、GPT-6.1 Sol 和 GPT-6 Astra 之间分配任务,并按需启用快速模式、按服务和个人设置上限,其估算的 Codex 日均成本降低了约 65 %。🔗 来源
  • Gemini CLI v0.64.0-preview.1 — 这一预览版消除了无害 shell 命令触发“不可信命令标志检测”警告的误报:只读选项获豁免,shell 变量得到保留,每个子命令都有对应 ALLOW 规则时允许执行循环。10 月 9 日未发布每日构建版本,稳定版仍为 v0.63.0。🔗 来源
  • Antigravity 2.22.0 — 插件可以在侧边面板中显示自己的界面(UI Extensions),对话可以通过拖放在侧边栏的不同分区之间移动,时间戳也会显示月份名称。🔗 来源
  • Gemini 3.7 Flash 弃用 — 在 Gemini API 中,对 gemini-3.7-flash 的调用会重定向至 gemini-3.8-flash,旧版智能体 deep-research-pro-preview-12-2025 将于 10 月 23 日停用,替代选项为 deep-research-preview-04-2026 或 deep-research-max-preview-04-2026。🔗 来源
  • Google Flow Music 的 VST3 和 AU 插件 — 补报 10 月 6 日消息:通过自然语言创建的乐器和效果器 Spaces,可以导出为数字音频工作站(Digital Audio Workstations)使用的插件,例如制作人克里斯·里迪克-泰恩斯的 No Chaser 插件。🔗 来源
  • Google Earth AI 与公共卫生 — 补报 10 月 6 日消息:在刚果民主共和国埃博拉疫情期间,一个地理空间推理智能体原型帮助世界卫生组织非洲区域办事处在几分钟内识别出 48 个存在暴露风险的居民点和超过 45 500 名风险人群;PDFM 模型还能提前最多 8 周识别霍乱风险区域。🔗 来源
  • Copilot code review 计费 — 如果已启用 AI Credits 付费使用,组织所有者可以将持有许可证的成员所请求的代码审查费用计入仓库所属组织,而不消耗成员个人配额;还可以将触发审查的权限限定为持有组织或企业提供的许可证的用户。🔗 来源
  • Copilot CLI 1.0.95 — 该版本已转为稳定版,在 macOS 上通过 Microsoft Entra 原生身份验证代理进行认证,失败时回退到浏览器;预览版 1.0.96-0 会在时间线上注明每项权限由谁作出决定:用户、Assisted Permissions、策略,或无人值守回退机制。🔗 来源
  • GitHub MCP Server 2.0 — 补报 10 月 6 日消息:GitHub 官方 MCP 服务器为采用 Code Mode 或 Programmatic Tool Calling 的智能体返回带类型的输出,并用输出模式(output schemas)描述这些输出;它们仅向使用 MCP 2026-07-28 或更新规范的客户端声明。🔗 来源
  • Genspark 中的 Claude Haiku 5.5 — Genspark 已在 AI Chat、Code Agent 和 Claw 中上线该模型,并沿用 Anthropic 的宣传说法,称其运行成本比 Haiku 4.5 低约 75 %,未推出专属套餐或价格。🔗 来源
  • 用于 v0 的 Meta VR 模板 — Meta 与 Vercel 联合发布了一个基于 Immersive Web SDK 的 v0 模板:描述想要的体验后,v0 会编写代码并提供预览,点击一次即可部署到 Vercel,再通过 Quest 的浏览器打开;该模板已支持预计于 2027 年春季推出的 Meta VR Glasses 的视线和手部交互。🔗 来源
  • v0 for teams — v0 通过视频介绍了这种查看队友工作、加入他们的对话并共同构建的协作方式;这条推文重点展示了自 9 月起分批推出的功能,未公布新价格。🔗 来源
  • DeepSeek Harness 0.2.1-alpha.2 — 这是第 26 个预览版,仍无稳定版:插件目录可按需安装 Claude Code 和 Codex 软件包,新增两个实验性插件(Git Worktrees、推理翻译),全局指令也可以来自共享的 AGENTS.md。🔗 来源
  • OGX 1.5.0 — 原 Llama Stack 于 4 月更名并移出 meta-llama 组织,此次新增面向 DeepSeek 和 Fireworks AI 的 /v1/messages API 原生透传、Text-Embeddings-Inference 提供方、Exa 和 Serply 网页搜索,以及 MCP 2.x 客户端,并包含四项破坏性变更。🔗 来源
  • GenIA — Meta 未作公告,便以非商业许可 CC BY-NC 4.0 上线了与图宾根人工智能中心合作开展的这项工作的代码:它可从一张图像、少量视图或一段视频重建 3D 对象,方法是在推理时对齐 SAM 3D Objects 的冻结先验,无需重新训练。🔗 来源
  • Hub 上的 decision-model 标签 — Hugging Face 为决策模型提供了专属标签,并在 Models 页面加入图标和筛选器;决策模型的 GGUF 文件会根据其 llama.cpp 元数据自动打上标签。🔗 来源
  • Darwin-27B-ZTC-v2 — VIDRAFT 宣布,其采用 Apache-2.0 许可的新版本评判模型以 89,58 的 Borda 得分登上 System One Mosaic Benchmark(137 项基准测试)榜首,领先于 OpenJev-27B(87,50)和 Jev 1.13(85,05);这一排名由作者公布,他们将其描述为公开排行榜的一个快照。🔗 来源
  • 决策模型的置信度 — 斯蒂芬·索尔卡在一篇社区文章中展示,通过 OpenRouter 查询的 GPT-6 Luna Decisions 对 600 次 SHA-256 校验均回答“不匹配”,准确率为 50 %,平均置信度为 99,8 %;在因果推理任务中,99 % 的阈值筛选出的 49 个回答有 47 个正确,但仅覆盖 8,2 % 的案例。🔗 来源
  • 将 openai-math 转为强化学习环境 — FineEnvs 将 openai/math 发布的 405 项以 Lean 形式化的结果中的 369 项移植为 Harbor 环境:智能体必须在 Lean 4 沙箱中证明一个定理,Comparator 仅在完整证明精确对应题目陈述时给予奖励;这是采用 Apache-2.0 许可的实验性数据集。🔗 来源
  • JOSIE-2 — 格克德尼兹·居尔梅兹发布了这一模型系列的技术报告:2B、4B 和 9B 模型以 Qwen3.5 为基础,在两台 Mac M4 上使用约 3 000 个筛选出的样例进行后训练;在推理模式下,JOSIE-2-4B 在 ARC-Challenge 上达到 95,5(+12,1),在 TruthfulQA 上达到 69,2(+20,3),仅测试了这两个基准。🔗 来源
  • Gradio 6.30 — gr.Workflow 新增应用视图,“运行此节点”命令会复用仍然有效的上游结果,而无需重新执行整个子图;gr.ImageEditor 会保留加载图像的透明度通道。🔗 来源
  • tokenizers 0.23.3 — 这一仅针对 Python 软件包的修补版本支持 huggingface_hub v2,据版本说明,这解决了 Transformers 的安装阻碍;同时撤销了 0.23.1 中与截断有关的一项破坏性变更。🔗 来源
  • 人工智能科学审稿 — Sakana AI 介绍了一篇被 TMLR 接收的论文:其中的基准测试会在论文中插入相互矛盾的论断,以检验人工智能审稿者能否发现;据 Sakana AI 的公告,其 Multi-Layered Review 系统发现的矛盾比其他受测系统更多,但公告未提供任何具体数字。🔗 来源
  • Suno Studio — 音频片段能更准确地对齐第一拍,并通过拉伸跟随项目节奏;淡入淡出可采用指数或对数曲线,合成器、键盘和插件视图也可弹出为独立窗口,甚至移至第二块屏幕;Premier 订阅包含 Studio。🔗 来源
  • World Models’ Last Exam in Physics — 在 Einsia 面向视频模型的这项物理考试中(40 项任务、9 个类别、八个模型),Seedance 2.5 以 57,76 分位列榜首,满分为 100 分,领先于 MiniMax H3(54,89)和 NVIDIA 的 Cosmos 3 Super(42,46);MiniMax 称 MiniMax H3 是最佳开放模型,这是一项第三方基准测试。🔗 来源
  • 由智能体构建的 Omniverse 仿真 — NVIDIA 博客展示了公司内部团队如何让 GPT-6 Astra,以及其中一个案例中的 Claude Fable 5,使用 ovphysx、ovstage、ovrtx 和 ovui 库组装仿真,其中包括在约三天内创建或改进的数字孪生;未推出新产品。🔗 来源
  • 管理 Shopify 店铺 — 连接店铺后,Grok Bot 可以检查订单、跟踪库存并更新商品信息;未说明套餐或使用限制。🔗 来源
  • 在 X 上搜索 — 补报 10 月 7 日消息:所有用户均可让 Grok Bot 搜索、阅读和监测 X,无需配置 X 连接器,例如跟踪产品反馈或接收所属行业的每周摘要;截至 8 月底,使用这项功能仍需连接自己的账户。🔗 来源
  • Grokipedia v0.3 — 据其官方账户称,这部由 Grok 撰写的百科全书在一周内发布了超过 4 400 篇读者请求的文章,每天进行超过 2 200 次修改,每篇新文章平均引用 78 个来源;如今已有一个页面实时展示其修改动态。🔗 来源
  • mistral CLI 0.8.0 — mistral apps deploy 现在也能部署工作流工作进程,并一次性部署所有模块;在持续集成环境中也只需一个 API 密钥即可使用。mistral apps dev 则可在 Docker 中启动本地 Postgres 数据库;与此同时,当前目录中的 .env 不再被读取。🔗 来源
  • Mistral Python SDK 3.2.0 — 聊天和智能体调用支持对响应及提示词返回对数概率(logprobs),还支持 top_k、重复惩罚和最小词元数量;该版本由自动生成流程产出,未发布公告。🔗 来源
  • Qwen Code v0.25.1-preview.1 — 这是三天内发布的第二个 v0.25.1 预览版,新增 16 项功能和 27 项修复,其中包括以会话为中心的多智能体协作,以及可修改工具输入并执行完整重新验证的 PreToolUse 钩子;稳定版尚未发布。🔗 来源
  • Perplexity Agent API 中的 Claude Haiku 5.5 — 补报 10 月 7 日消息:Agent API 支持 anthropic/claude-haiku-5-5,并按 Anthropic 的价格收费;输入不超过 100 000 个词元时,每百万输入词元收费 0,10 美元,每百万输出词元收费 0,50 美元,超过该输入长度后分别为 0,50 和 2,50 美元。🔗 来源
  • 共享或专用推理 — Cohere 面向 Embed 和 Rerank 的一份指南指出,请求的形式比数量更重要,并以配置一块 NVIDIA A10 GPU 的专用实例为对照,计算了示例性的盈亏平衡阈值:长文档约为每分钟 4 次请求,目录约为 20 次,重排序(reranking)约为 29 次。🔗 来源
  • 智能体与 MCP — Perplexity 发布了一份指南,区分负责决策的智能体与负责将其连接到工具的 MCP,并提供选择对照表、网店示例,以及四类风险和对应防护措施;据指南介绍,Claude、ChatGPT 或 Cursor 可以通过 Perplexity 的 MCP 服务器将任务交给 Computer。🔗 来源

这意味着什么

如今,一个智能体可以编排众多其他智能体,而每个智能体都有自己的身份。Gemini 智能体启动各自拥有身份的子智能体,也可以成为拥有独立地址的智能体同事;Claude Managed Agents 允许智能体编写一个最多可启动 1 000 个智能体的程序;Grok Bot 获得了一个电子邮件地址,以便在外部开展工作;Block 则让 Claude Fable 指挥数十个模型完成同一次迁移。越来越受关注的问题不再是智能体是否有能力完成任务,而是如何管控它。Google 的回应是 Agent Gateway、Agent Sandbox、以每个智能体的身份记录的审计日志,以及实时支出上限;Anthropic 的回应是会话预算,一旦达到上限就暂停所有执行;OpenAI 的回应则是对网络和文件施加更严格限制的 Windows 沙箱。

平台本身也开始采用多模型。开发 Gemini 的 Google 让自己的智能体编排 Claude 模型,明确将模型选择与智能体选择分开,并在 Antigravity 中开放 Claude Opus 5.5 和 Sonnet 5.5,其费用计入与自家模型相同的支出上限。Genspark 和 Perplexity 的 Agent API 在 Claude Haiku 5.5 发布后的几天内就加入了该模型;LegalOn 根据任务性质,将编码工作分配给三个 OpenAI 模型;Block 则在构建自动模型选择器。

单位成本持续下降,每项公告都给出了具体数字:Qwen-Image-2.1-Turbo 每张图像 0.016 美元,成本为 Pro 版本的 1/2.5;HeyGen Voice 在 10 月 31 日前每百万字符 15 美元,之后为 30 美元,低于 Eleven v4 Turbo;pplx-decider-v1.1-27b 每 1 000 次决策 0.017 美元;使用 ML Intern,仅花费约 103 美元的计算成本,就在 Hub 上发布了六个模型。不过,榜首成绩需要仔细解读:HeyGen Voice 仅在控制音色的排行榜中位列第一,而 pplx-decider 与另外九个模型并列,它们的置信区间相互重叠。

在医疗领域,仍需保持谨慎。发表于 The Lancet 的 AMIE 研究是一项可行性研究,仅在一个地点开展,没有对照组,并由 Alphabet 资助:共纳入 98 名患者,没有任何对话因安全原因被中止,发现了一次幻觉。这是迈向更大规模试验的一步,作者也明确呼吁开展此类试验,并不意味着获得批准或已向患者部署。


来源