ai-powered-markdown-translator使用 gpt-5.6-sol 将文章从法语翻译成中文。
本周二,Google 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,这两款实时语音对话模型能够在不中断对话的情况下于后台调用工具。Anthropic 发布三个 Claude Code 版本,并将 Salesforce 引入 Claude;与此同时,OpenAI 确定将于 10 月 14 日从 ChatGPT 和 Codex 中移除 GPT-5.5。智能体也开始进入现有分发渠道:从 HP 预装 Perplexity,到 Devin 登陆 AWS Marketplace;NVIDIA 还详细介绍了其 Vera Rubin 平台的两个组件。
Gemini 3.8 Live 和 3.8 Live Extended Thinking:两款边说边行动的语音模型
9 月 15 日 — Google 发布两款实时语音对话模型,由 Gemini Audio 团队推出。Gemini 3.8 Live 着眼于规模、速度和成本:它可接收近实时视觉输入,并在对话过程中自动切换 97 种语言。Gemini 3.8 Live Extended Thinking 面向需要多步推理的任务:它可同时思考和说话,以简短的口头回应表示已收到请求,并说明后台任务的进展;其思考深度可在 API 中调整。两款模型都会在音频回复持续进行时,于后台执行工具和 API 调用(异步函数调用)。
The models talk, think, and handle tasks in the background without breaking your flow.
🇨🇳 这些模型可以说话、思考并处理后台任务,同时不会打断您的对话进程。 — @GoogleDeepMind 在 X 上
Google 还强调了模型对口述字母数字数据的识别准确性,例如确认码或档案编号,并将这些模型定位为级联架构的更简洁替代方案;后者需要依次进行转录、文本处理和语音合成。根据 Gemini 3.8 Audio 模型说明,它们基于 Gemini 3 Pro,可在 128K tokens 的上下文中接收音频、图像、视频和文本,最多输出 64K tokens,并使用截至 2025 年 1 月的知识。
| 排名或 benchmark | 评测模型 | Google 公布的分数 |
|---|---|---|
| 语音到语音质量指数(Artificial Analysis) | 3.8 Live Extended Thinking | 82,6(第 1 名) |
| τ-Voice | 3.8 Live Extended Thinking | 68,6 % |
| τ-Voice-banking(Sierra) | 3.8 Live Extended Thinking | 35,1 % |
| Big Bench Audio | 3.8 Live Extended Thinking | 97,7 % |
| Speech Agent Arena(Artificial Analysis) | 3.8 Live | 第 2 名 |
这些排名由第三方维护,但所引分数均由 Google 公布。在 Live API 中,Google 估算两款模型的音频输入成本均为每分钟 0.005 美元,音频输出成本为每分钟 0.018 美元,其依据是每百万输入 tokens 3 美元、每百万输出 tokens 12 美元;Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 和 Vision Agents 被列为集成商。
| 发布渠道 | Gemini 3.8 Live | Gemini 3.8 Live Extended Thinking |
|---|---|---|
| Gemini API 和 Google AI Studio | 9 月 15 日起 | 9 月 15 日起 |
| Gemini Enterprise | 私人预览版 | 私人预览版 |
| 普通用户 | Search Live | Gemini Live、Docs Live(Google AI Pro 和 Ultra 订阅者)、Gmail Live 和 Keep Live(所有 Google AI 订阅者) |
在 Search Live 中,该模型会实时逐步指导用户排查故障。所有生成的音频均带有不可见的 SynthID 水印。
🔗 Gemini 3.8 Live 与 3.8 Live Extended Thinking 简介 🔗 关于 Live API 的开发者文章 🔗 Gemini 3.8 Audio 模型说明
Claude Code 2.1.271 至 2.1.273:Remote 快速模式、按命令联网与更严格的权限
9 月 15 日 — Anthropic 在略超过 22 小时内发布了三个 Claude Code 版本,其中第一个版本于巴黎时间午夜刚过发布。
| 发布版本 | 日期和时间(UTC) | 更新说明内容 |
|---|---|---|
| 2.1.271 | 9 月 14 日 22:12 | 96 行:Remote 快速模式、按命令设置 allowed_domains、omitClaudeMd、--accept-command |
| 2.1.272 | 9 月 15 日 0:42 | 一行:错误修复和可靠性改进 |
| 2.1.273 | 9 月 15 日 20:23 | 64 行:LLM 网关标头、Remote Control 会话复制、Bedrock、Vertex 和 Foundry 上的本地分类器 |
2.1.271 将快速模式(fast mode)开放给 Claude Code Remote 会话,包括云端和自托管运行器(self-hosted runners),前提是组织允许使用该功能。在启用沙箱的自动模式下,Bash、PowerShell 和 Monitor 可为每条命令接收一个 allowed_domains 列表:系统会连同命令一起检查必要主机,并仅为该命令开放这些主机,其他主机则会被拒绝。智能体 frontmatter 中的 omitClaudeMd 字段可启动一个不加载用户、项目及本地 CLAUDE.md 文件的子智能体,但仍会加载托管策略文件;claude plugin install --accept-command <sha256> 只接受此前以 --json 方式运行时显示的确切命令,而不是 -y。2.1.273 支持从 Claude 应用中复制(fork)通过 claude --remote-control 启动的会话,复制后的会话会在计算机后台运行。该版本还会在 MCP 服务器断开连接且自动重连放弃时发出警告,并新增用于 LLM 网关的请求标头,可通过 CLAUDE_CODE_GATEWAY_HINT_HEADERS=1 启用。
| 修改项目 | 新行为 |
|---|---|
| 自动模式下子智能体的返回 | 使用由安全分类器审查的专用返回调用(hand-back call),而非在其最后一条消息后进行检查 |
自动模式下 skills 的 ! 命令和 slash 命令 | 使用默认模式的权限规则,而非分类器 |
| Monitor 监控 | 必须设置最长 30 分钟的超时时间(-p 执行时为 10 分钟),并提醒 Claude 重新启用 |
| 动态 workflows | 达到用量限制时暂停,并在配额重置后自动恢复,而非放弃智能体 |
| Bedrock、Vertex 和 Foundry 上的自动模式(2.1.273) | 暂时默认使用本地分类器,通过 CLAUDE_CODE_AUTO_MODE_SERVER=1 使用平台分类器 |
这两个版本还修复了多项权限控制问题。带有子 shell、两次目录切换或 cd + git 链的命令会绕过 permissions.blockReadsOutsideWorkingDirectories 下的提示,而子 shell 在权限绕过模式(bypass)下可以隐藏危险的 rm。一旦存在服务器端托管设置,由 MDM 或 managed-settings.json 强制实施的 MCP 设置就会被忽略。/resume 和 /teleport 会保留前一次对话中已读取文件的跟踪记录,导致 Claude 可以修改恢复后的对话从未读取过的文件。最后,上下文计量器将 advisor 工具的轮次按实际大小的约两倍计算,从而在上下文窗口使用到一半左右时就触发自动压缩。
三个版本的说明均未提及 9 月 14 日发布的 Claude Mods;不过,在 issue #91870 上,社区测试人员认为 2.1.272 已经影响到了相关功能范围。
🔗 Claude Code 2.1.271 版本说明 🔗 Claude Code 2.1.273 版本说明
Salesforce in Claude:面向获批组织的销售插件测试版
9 月 15 日 — Anthropic 推出 Salesforce in Claude 测试版,将销售人员的客户、商机和销售管道引入 Claude。官方文章称该插件与 Salesforce 共同设计,而帮助中心则表示其 37 项销售 skills 由 Salesforce 构建,涵盖客户搜索、通话准备、销售管道审查和 CRM 更新。另有两个连接器与其配套:支持读写的 Salesforce 连接器,以及用于业务频道和团队讨论串的 Slack 连接器。
Salesforce 仍是记录系统:每位销售人员使用自己的凭据登录,Claude 只能读取其 Salesforce 权限允许的内容,而且默认情况下每次写入都必须获得批准。该插件可在聊天和 Claude Cowork(网页端与桌面端)中使用。测试版面向付费套餐,但仅限经 Salesforce 测试版注册流程批准、且使用最新版 Sales Cloud 企业版的组织;其 Salesforce 管理员需在 AgentExchange 上申请访问权限。GitLab、Siemens 和 Legora 已部署该插件,Salesforce 内部也有 7,000 名销售人员正在使用。
🔗 将 Salesforce 引入 Claude 🔗 为组织配置 Salesforce in Claude
GPT-5.5 将于 10 月 14 日退出 ChatGPT、ChatGPT Work 和 Codex,但仍保留在 API 中
9 月 15 日 — OpenAI 在 X 上宣布 GPT-5.5 将从其应用中退出,此事已于 9 月 14 日记入 ChatGPT 和 Codex 的 changelog。10 月 14 日,该模型将从所有套餐的 ChatGPT、ChatGPT Work 和 Codex 中移除,包括普通用户、Business、Enterprise 和 Edu。
| 涉及的平台 | 10 月 14 日的情况 |
|---|---|
| ChatGPT 和 ChatGPT Work | 所有套餐均移除 GPT-5.5 |
| 使用 ChatGPT 登录的 Codex | 移除 GPT-5.5,并要求切换到 gpt-5.6-sol |
| 使用 API 密钥的 Codex | GPT-5.5 仍然可用 |
| OpenAI API | GPT-5.5 仍然可用 |
对于使用 ChatGPT 登录的 Codex,文档要求在所有明确选择 gpt-5.5 的位置进行替换:工作区默认参数、已保存设置、托管配置、自定义智能体、计划任务和脚本。@ChatGPT 账号发布的消息还将 GPT-6 Astra 列为 Codex 中的替代模型。管理员指南警告,修改默认模型并不会自动授予模型访问权限:必须逐一检查客户端,确认相关用户可以使用替代模型。OpenAI 延续了适用于 GPT-5.4 和 GPT-5.4 mini 的一个月预告期;这两款模型在 7 月 31 日发布公告后,于 8 月 31 日从使用 ChatGPT 登录的用户所用 Codex 中移除。
🔗 ChatGPT 和 Codex changelog 🔗 @ChatGPT 在 X 上发布的消息
HP 在其 Windows 电脑上预装 Perplexity,并提供 Autodesk Revit 连接
9 月 15 日 — Perplexity 和 HP 宣布,将 Perplexity Windows 应用预装到 HP 电脑的任务栏中,首款设备为搭载 AMD Ryzen AI Max PRO 400 系列处理器的 ZBook Ultra G3a 移动工作站;未来几个月还将有其他型号跟进,但未公布清单、价格或日期。文章称,ZBook Ultra G3a 的本地 AI 能力可通过 Portable Computer 执行日常任务;这是可在不消耗云端额度且离线的情况下工作的本地版智能体,但能否使用取决于设备配置。文章未列出兼容配置,而前一天发布的 Windows 版本要求至少配备 24 GB 显存的 NVIDIA RTX GPU。
Portable Computer 还可通过 Revit 2027 的 MCP 服务器连接 Autodesk Revit;后者是一款建筑信息模型(Building Information Modeling)软件,而该服务器以技术预览版(Tech Preview)形式作为独立模块提供。访问权限为只读:智能体可以回答关于模型的问题,例如某楼层的门数量或其防火等级,并可导出视图、PDF 和明细表,但不会修改模型。Personal Computer for Windows 面向 Pro、Max 和 Enterprise 订阅者开放,支持 Windows 10 和 11。
🔗 Perplexity 携手 HP 登陆更多 Windows 电脑
Cognition 与 AWS 签约,并在 Devin Cloud 中推出 macOS
9 月 15 日 — Cognition 在同一天发布两项由基础设施关联起来的公告:Devin 如今用于构建 Apple 应用的 Mac 均为 AWS EC2 Mac 主机。
与 AWS 达成战略合作协议
Cognition 与 Amazon Web Services 达成一项多年期战略合作协议(Strategic Collaboration Agreement),文章未说明金额或确切期限。目前已有两项安排落地:Devin 可通过 AWS Marketplace 购买,Agent Toolkit for AWS 可直接在 Devin 中使用。双方还在研究与客户 AWS 环境的进一步集成,但尚无时间表。Devin 部署在客户所选 AWS 区域内的单租户(single-tenant)环境中,数据存储在专用 VPC 内,每个会话使用一台虚拟机,并在工作结束后删除。
| Cognition 提及的客户 | 公布的成果 |
|---|---|
| Mercedes-Benz | 分析了超过 200 000 行 COBOL,原本预计耗时八个月的项目缩短至八天 |
| 未具名汽车制造商 | 将 25 000 行 COBOL 工作流从大型机(mainframe)迁移至 AWS Lambda,预计成本降低 73 % |
macOS 登陆 Devin Cloud
7 月 31 日,Cognition 已展示过在 macOS 上运行并配备 Xcode 和 iOS Simulator 的 Devin 云端智能体。9 月 15 日,相关功能在 Devin Cloud 中上线,用于构建和验证 iPhone、iPad 和 Mac 应用,并带来多项新功能:Devin 会将测试过程的屏幕录像发送到 Slack,提供 TestFlight 链接以安装应用,新的 iOS Simulator 面板则会显示正在运行的应用。该智能体还通过应用的无障碍树操控应用,该树会暴露给其计算机操作(computer use)工具:它根据控件的角色和名称查询控件,对其执行操作,然后重新读取无障碍树,而屏幕截图仍用于判断渲染效果。这一层基于 Dioxus 的开源 accessibility-cli,其团队已于 9 月 10 日加入 Cognition。
macOS 虚拟机通过 Apple 的 Virtualization.framework 运行在 AWS EC2 Mac 实体 Mac 上,快照(snapshots)系统还加入了 NBD(Network Block Device)接口,以便在无需保持机器开机的情况下恢复会话。用户空间中的 Ethernet 网关取代了 Apple 管理的 NAT,以对每个会话应用网络策略。价格及适用套餐均未说明。
NVIDIA 详解 Vera Rubin 的两项关键技术:Groq 3 LPX 与 NVLink 6
9 月 15 日 — NVIDIA 技术博客的两篇文章解释了 Vera Rubin 平台如何在推理过程中节省能源,以及如何应对其网络故障。以下数据均来自 NVIDIA。
Groq 3 LPX:通过确定性执行缩小电压裕量
Groq 3 LPX 投入生产的消息已于 8 月 24 日在此报道;这篇文章则解释了其运行机制。在执行前,LPU 芯片的编译器会精确到时钟周期,确定机架内 256 枚芯片上每次计算和数据传输的时刻,从而预测电流需求。两项技术利用了这一点:Preemptive Power(PEP)会在需求峰值到来前要求供电网络提高电压,Clock Period Synthesis(CPS)则会延长电流上升最快时的时钟周期。其目标是缩小所有电路都会保留的电压裕量(voltage guardband);这种裕量成本高昂,因为功率随电压的平方增长:电压增加 10 %,功率便会增加 21 %。
内部测试显示,电压下降幅度降低了 60 % 以上。NVIDIA 估计,在相同负载下,与类似的非确定性系统相比,所需功率可能降低“较低的两位数百分比”(low-double-digit)。这些控制技术将于 2026 年下半年登陆 Vera Rubin。
🔗 NVIDIA 关于 Groq 3 LPX 确定性执行的文章
NVLink 6:从芯片到软件的韧性技术栈
NVLink 6 将一台 Vera Rubin NVL72 机架中的 72 个 Rubin GPU 连接成一个统一域;NVIDIA 声称,其数据包吞吐量是通用 Ethernet 替代方案的 10 倍,这一点已于 7 月 21 日在此提及。此次文章逐层详解了其容错能力。
| 技术栈层级 | NVIDIA 描述的机制 |
|---|---|
| 物理层 | 轻量级纠错,辅以物理层重传(Physical Layer Retry) |
| 链路层 | 基于信用的流量控制(credit-based flow control),从设计上避免数据包丢失 |
| 链路管理 | 通过 NMX Controller,在约 1.5 秒内完成软件恢复 |
| 推理服务 | Shadow Engine Recovery(NVIDIA Dynamo):在 B200 GPU 上将中断时间从 283 秒缩短至 7.3 秒 |
| 多节点检查点 | NCCL 已以原型形式支持 cuda-checkpoint,预计年底前正式发布 |
基于信用的流量控制仅在下一跳有空间接收数据包时才会发送,而 Ethernet 依赖 PFC 和 ECN。Shadow Engine Recovery 则会保留一份已使用其自身 NCCL 通信器完成初始化的推理引擎副本。
Gemini Notebook 宣布推出笔记本语音对话与录音工具
9 月 15 日 — 新学年开学之际,Gemini Notebook 更新了外观,并宣布推出一系列学习工具,其中大多数仍将在未来上线。
| 已宣布的学习工具 | 公布的可用时间 |
|---|---|
| 在移动端以近 100 种语言与笔记本进行实时语音对话 | 本周向成年的 Google AI Ultra 订阅用户开放,不久后将面向 Google AI Pro 用户及其他用户推出 |
| 移动应用内的录音工具 | 从下周开始 |
| Reports 中的交互式学习概览 | 未来几周内面向所有用户推出 |
| 简答题、选择题或填空题 | 未来几周内面向所有用户推出 |
| 支持 80 多种语言且可分享的 Short Video Overviews | 现已推出,9 月 1 日时支持 70 多种语言 |
语音对话将依据笔记本中的来源作答,并可通过语音打断;录音工具则可直接在笔记本中录制课程或思考内容,并与来源并列保存。学习概览将整合摘要、信息图、测验和复习卡片(flashcards)。关于已于 8 月公布的学生优惠,Google 说明,向美国学生赠送一年的 Google AI Pro 可将 Gemini Notebook 的使用限额提高至四倍,而在其他 140 多个市场提供的一年 Google AI Plus 则可将限额提高至两倍。
🔗 借助 Gemini Notebook 新工具优化你的学习安排
Antigravity 2.14.0 向 Enterprise 和 Business 账户开放集成终端与 Git
9 月 15 日 — Antigravity 2.14.0 包含 10 项改进和 18 项修复,并向 Enterprise 和 Business 账户开放侧边栏中的集成终端与 Git 版本控制;其他账户已于 8 月 24 日发布的 2.10.0 版本中获得这些功能。历史记录极长的对话现在加载更快、内存占用更少,同时取消了每条消息都会重新触发的对 skills、规则和自定义文件的重复分析。
在各项修复中,暂时性服务错误不再导致会话终止:系统会以逐渐延长的间隔重试,持续约十二分钟。已结束的子智能体不再错误显示为活跃状态,也不会再阻塞后续消息直至重启;与终端命令输出有关的内存泄漏也已修复。版本标题提到了一套新的权限系统,但发行说明在这方面仅提到将通用设置部分重命名为“全局权限”,并将项目设置继承选项重命名为“继承全局设置”。
IBM Research 借助 ALTK-Evolve 将智能体的一致性差距减半
9 月 15 日 — IBM Research 在 Hugging Face 博客发布其 ALTK-Evolve 系列的第三篇文章,此次聚焦智能体的执行一致性。在 AppWorld 的 168 项任务中,一个温度设为 0、基于 GPT-4.1 的 ReAct 智能体在五次尝试中平均有 77.4 % 的执行成功(Mean@5),但仅有 53.0 % 的任务能在五次尝试中全部成功(Pass^5)。IBM 将这 24.4 个百分点的差异称为一致性差距(consistency gap)。
Consistency Analyzer 可从单条已记录轨迹中识别不稳定决策:它会离线重放每个步骤,并要求生成五次补全,无需真实标签、无需重新运行任务,也无需访问 logits。脆弱步骤会转化为一致性指引(consistency guidelines),并在推理时注入。
| 智能体配置 | Mean@5 分数 | Pass^5 分数 | 一致性差距 |
|---|---|---|---|
| 无指引的 ReAct GPT-4.1 | 77.4 % | 53.0 % | 24.4 个百分点 |
| 配备一致性指引的 ReAct GPT-4.1 | 81.0 % | 69.0 % | 12.0 个百分点 |
在 gpt-oss-120b 上,Pass^5 从 10.1 % 提升至 16.1 %。Analyzer 和指引生成功能已集成到 ALTK-Evolve 的开源代码库中。
🔗 IBM Research 在 Hugging Face 博客上的文章
Aillis 为 Evidence Finder 采用 Sakana Namazu,日本国家医师考试得分率达 96.4 %
9 月 14 日 — 日本机器学习医疗设备公司 Aillis 在其面向医生的循证检索工具 Evidence Finder 中采用了 Sakana Namazu;这是 Sakana AI 于 8 月初推出的日语专用 LLM。该公告于东京时间 11 时发布,Sakana AI 随后于同日太平洋时间 15 时 30 分在 X 上转发,晚于我们 9 月 14 日的信息采集时间。Evidence Finder 根据医学文献撰写回答并引用参考资料,其 Verify 功能会核验这些资料是否确实存在;两家公司还将共同研究医疗用途。
基于 Sakana Namazu 的 Evidence Finder 版本在 2026 年 2 月举行的第 120 届日本国家医师考试中获得 96.4 % 的得分率(500 分中得 482 分)。根据 Aillis 截至 9 月 1 日的统计,这是日本经济产业省 GENIAC 项目指定的本土基础模型中的最高分。公告提出两点保留意见:为进行此次测试,产品限制已被解除,包括拒绝含图片问题的限制,而商业服务仅处理文本问题;此外,Evidence Finder 并非医疗器械。
🔗 Aillis 在 PR Times 上的公告 🔗 Sakana AI 在 X 上的转发
Google 量化人工智能的使用情况及其社会影响
9 月 15 日 — Google 同日发布两组文章,分别聚焦人工智能的实际使用情况及其社会影响。
AI & Economy ATLAS 向公众开放,并发布一项关于科学家的研究
Google 首席经济学家办公室推出的研究项目 AI & Economy ATLAS,此前曾提供 9 月 9 日在此引用的行政手续相关数据,如今已成为可自由访问的交互式体验:用户可按职业、家庭场景和国家比较人工智能的使用情况。
| 重点展示的 ATLAS 指标 | Google 公布的数值 |
|---|---|
| 印度:艺术、设计和媒体职业在人工智能专业用途中的占比 | 19 %,为全球平均水平的 1.6 倍 |
| 美国:计算机与数学领域的占比 | 30 %,是世界其他地区的两倍 |
| 巴西和德国:设备诊断等手工任务的占比 | 7 %,日本为 4 % |
Google、Google DeepMind 和 MIT FutureTech 开展的一项研究分析了 2 600 个专用人工智能模型,并调查了 600 多名美国和英国科学家。结果显示,近半数科学家每天使用人工智能,并表示每周可节省略少于 7 小时。作者也指出了负面影响:验证人工智能输出需要耗费时间,而等待物理实验与临床验证的未检验假设也越积越多。
🔗 Google AI & Economy ATLAS 的最新洞察
面向社会影响的 AI:语言、Google.org 获奖者与 FireSat
据 Google 称,该集团的技术支持 300 多种语言,覆盖超过 70 亿使用者,其中多个数据集与当地合作伙伴共同构建。Google 还推出了 Language Explorer,这是一款用于可视化开放数据库 LinguaMeta 的交互式工具。
| Google 提及的项目 | 公布的数据 |
|---|---|
| WAXAL,开放语音语料库 | 27 种撒哈拉以南非洲语言 |
| Project Vaani | 109 种语言、超过 30,000 小时的语音 |
| Google.org Impact Challenge: AI for Government Innovation | 15 个获奖组织、3,000 万美元、超过 2,600 份申请 |
| FireSat | 首批运行卫星已进入轨道,目标是在 2030 年左右达到约 50 颗,每 20 分钟获取一次图像 |
| 8 月底发布的 Planetary Prediction Engine | 据 Google 称,提前识别出刚果民主共和国 83% 的新发埃博拉疫情点 |
Google.org 的获奖组织包括帮助申报所得税的 Code for America,以及致力于道路安全的 Johns Hopkins University。它们获得 Google 工程师的志愿辅导,并将其项目设计为可重复使用的开源模型。
🔗 让每个人都能以每种语言使用 AI 🔗 15 个利用 AI 改变公共服务的组织 🔗 构建 AI,加速科学发展并改善生活 🔗 利用 AI 检测森林火灾
简讯
- Anthropic 发布在销售团队中部署 Claude 的指南——该指南与 Salesforce in Claude 同日发布,题为《构建 AI 原生营收组织》。相关博文提到了两个客户:Cox Communications 表示,其第一年获得了 7 倍投资回报,潜在客户验证与信息补充成本降低了 86%,准确率从 18% 提升至 97%;Cyera 约 1,500 名员工中有 88% 每周使用 Claude。🔗 来源
- Perplexity 发布影子 AI 指南(shadow AI)——该博文没有提供自有数据,而是汇总了第三方调查:约一半员工表示曾因使用 AI 而违反所在组织的规定(KPMG);Cloud Security Alliance 的一项调查中,82% 的受访者报告其组织系统中存在未知智能体。文章最后转为对 Perplexity Enterprise 和 Comet for Enterprise 的宣传,没有发布新功能。🔗 来源
- v0 转为模型无关架构(model-agnostic)——根据一则简单的推文,Vercel 的应用创建工具现可通过 Vercel AI Gateway 使用前沿、低价、开放和高速模型,包括 Claude、GPT、Kimi、GLM、Grok 和 DeepSeek;但完整模型列表、价格以及适用套餐均未说明。🔗 来源
- Warp 公布其内部软件工厂数据——Warp 首席执行官 Zach Lloyd 在一篇介绍采用软件工厂(software factory)三阶段方法(crawl, walk, run)的博文中表示,该公司的工厂已自动完成其营销网站 warp.dev 约 75% 的变更;Warp Factories 仍处于抢先体验阶段,符合条件的企业可获赠价值 10,000 美元的使用额度。🔗 来源
- Kimi Code 0.43.1 修复子智能体集群问题——在 0.43.0 发布不到 19 小时后,Moonshot AI 发布了七项修复,包括在子智能体结束时释放内存、减轻大型集群中的渲染与事件循环负担,以及使 Ctrl+C 仅中断子智能体而不再关闭整个 CLI。🔗 来源
- Gemini CLI v0.60.0 转为稳定版——该版本原样纳入了 9 月 8 日预览版中的十一项加固改动;v0.61.0-preview.0 则开启了下一版本系列,包含三项已在 nightly 版本发布的修复,以及一项智能体循环修复。🔗 来源
- Copilot 为代码仓库自定义属性推荐允许值——在创建企业或组织的自定义属性(custom property)时,Copilot 会推荐可一键采纳的值;该功能正面向 Copilot Business 和 Enterprise 进行公开预览,并受“Repository custom property suggestions”策略控制。🔗 来源
- Grok Imagine 测试版支持修改图像文字——SpaceXAI 的图像与视频生成工具现在可以编辑任何图像中的文字,例如邀请函、海报或广告;公告没有说明适用套餐、平台或所用模型。🔗 来源
- MiniMax H3 的去噪速度超过实时速度两倍——在我们完成当天的数据采集后,MiniMax 于 9 月 14 日太平洋时间 16 时 34 分发布推文称,借助 SGLang-Diffusion 和 VDN-H3,H3 可在 8 块 B200 GPU 上用 9.0 秒生成 14.4 秒的 768p 视频,且测得的质量没有下降。这延续了 9 月 14 日所盘点的 H3 生态系统进展。🔗 来源
- Retrieve-for-Train 将强化学习蒸馏至小型扩散模型——这项出自 ICML 2026 论文的 Google Research 工作,首先以强化学习(Reinforcement Learning)离线一次性训练一个 4B 参数模型,使其生成多样化的子查询;随后将该行为蒸馏至一个 5,390 万参数的扩散模型,使其能单次生成整个集合,并实现 12 至 20 倍加速。🔗 来源
- NVIDIA 量化比较稠密模型与混合专家模型的选择(Mixture-of-Experts, MoE)——这篇教学博文依据 8 月 31 日采集的 Artificial Analysis 数据,对 Gemma 4 31B、Qwen3.8-27B、Nemotron 3.5 Lightning 和 Mistral Small 4 进行比较:Lightning 共有 30B 参数,其中 3B 为活跃参数;其速度是 Qwen3.8-27B 的 4 至 5 倍,价格仅为后者的十四分之一,但能力得分不到后者的一半。🔗 来源
- NVIDIA FLARE 2.9 新增 Slurm 支持——该联邦学习(federated learning)框架自 2.8 版起已支持 Docker 和 Kubernetes,如今可让这三种环境共存于同一个联邦中,并引入可在不同作业间移植的资源描述方式。🔗 来源
- Sakana Marlin 新增交互式阅读与 PowerPoint 导出功能——借助交互式阅读(Interactive Reading),Sakana AI 的自主研究助手允许用户针对报告向智能体提问,并直接打开支撑相关论断的引用来源;它还可以导出可编辑的 PowerPoint 演示文稿,其中附有来源 URL。🔗 来源
- ShadowPEFT 并入 PEFT 库——社区博文:该方法在冻结模型上附加一个可拆卸的小型“影子”网络,现已合并至 PEFT 主分支,并将在下一版本中发布;在 Llama-3.2-3B 上,作者测得其 GSM8K 得分为 48.1%,高于 LoRA 的 46.9%,但峰值内存占用为 28.2 GB,高于后者的 22.3 GB。🔗 来源
- RiverRider 评估文件定位相较随机方法的效果——个人贡献项目:在 SWE-bench Verified 上,一个本地运行的 3,300 万参数编码器有 45.8% 的概率将正确文件排在首位;但由打乱查询构成的基线已有 24.4% 的概率在前 50 个结果中找到该文件,使信号相对于随机性的比值从 45.8 降至 3.9。🔗 来源
- EcoHash 将 RTX PRO 6000 运行 Qwen3.8-27B 时的并发能力提升一倍——这是一家推理服务商基于自有服务测量后发布的博文,该服务商曾于 9 月 14 日因另一话题被引用:在 vLLM 0.27.1 中启用该模型的多词元预测头(multi-token prediction, MTP)后,每个词元的处理时间从 22 毫秒降至 13 毫秒,可稳定维持的并发请求数从 32 增至 64;四次重复测试中有两次达到这一上限,代价是占用 23% 的 KV 缓存容量。🔗 来源
- DINO-X 发布肝血管研究模型及其失败结果——这是仅限研究用途的社区模型:该 8,600 万参数的 ViT-Base 在 17,639 张 CT 切片的外部测试中达到 0.9413 的 AUROC;作者也公布了负面结果,包括一个未发布的结肠专用模型,其得分仅为 0.6529。🔗 来源
这意味着什么
语音正成为一种完整的智能体交互界面。Gemini 3.8 Live 及其 Extended Thinking 变体能够在持续输出回复的同时在后台调用工具,并提高对口述代码和数字的识别准确性,其成本按每分钟音频估算。Google 随即将会播报后台任务进度的 Extended Thinking 变体引入工作工具,包括 Docs Live、Gmail Live 和 Keep Live;Gemini Notebook 则宣布支持以每个笔记本中的来源为依据进行语音对话。关注重点正从语音质量转向模型在说话期间能够完成什么任务。
第二条主线是分发:智能体正通过现有渠道进入业务工具。Salesforce in Claude 带来了销售技能、连接 CRM 与 Slack 的连接器,以及对每次写入操作的审批机制;HP 将 Perplexity 预装到其个人电脑的任务栏中,并以只读方式连接 Revit 模型;Devin 可通过 AWS Marketplace 购买,并部署在专用 VPC 中。每种情况下,智能体都会进入企业已经使用的工具,同时遵循相应防护措施:销售人员的 Salesforce 权限、对 Revit 的只读访问,以及 AWS 中的专用 VPC。
第三条主线是可靠性与控制。Claude Code 2.1.271 和 2.1.273 会让分类器检查子智能体的返回内容,逐条命令开放网络访问,并修复通过子 shell 或被忽略的 MDM 设置绕过权限的问题。IBM Research 表明,一个温度设为 0 的智能体平均可在 77.4% 的运行中成功,但在同一任务的五次运行中全部成功的任务仅占 53.0%,因此建议在平均值旁同时公布 Pass^k。NVIDIA 对硬件提出了同样的要求:NVLink 6 可在约 1.5 秒内恢复链路,而 Shadow Engine Recovery 可将推理中断时间从 283 秒缩短至 7.3 秒。问题不再只是智能体能否成功,而是它能否每次都在可验证的边界内成功。
最后一条主线是节奏。OpenAI 将在公告发布一个月后从其应用中移除 GPT-5.5,正如此前处理 GPT-5.4 一样,并要求在所有明确选择该模型的位置替换其标识符,包括计划任务和脚本。在工具方面,Claude Code 在 22 小时内发布三个版本,Kimi Code 在上一版本发布不到 19 小时后推出修复版本,而 Gemini CLI 则在一周后将 9 月 8 日的预览版转为稳定版。与此同时,此前一直逐个向模型选择器添加模型的 v0 宣布转向模型无关架构,并依托 Vercel AI Gateway:模型由此成为可互换的组件。
来源
- Google,Gemini 3.8 Live 与 3.8 Live Extended Thinking
- Google,关于 Live API 的开发者博文
- Google DeepMind,Gemini 3.8 Audio 模型说明
- Google DeepMind 在 X 上发布 Gemini 3.8 Live 公告
- Claude Code,2.1.271 版本说明
- Claude Code,2.1.273 版本说明
- Claude,将 Salesforce 引入 Claude
- Claude 帮助中心,配置 Salesforce in Claude
- OpenAI,ChatGPT 与 Codex 更新日志中关于移除 GPT-5.5 的说明
- ChatGPT 在 X 上宣布 GPT-5.5 将退出 ChatGPT、ChatGPT Work 和 Codex
- Perplexity,Perplexity 随 HP 登陆更多 Windows 个人电脑
- Cognition,与 AWS 达成合作
- Devin,将 macOS 引入 Devin
- NVIDIA,Groq 3 LPX 的确定性执行
- NVIDIA,NVLink 6 的弹性能力
- Google,Gemini Notebook 的新学习工具
- Google Antigravity,更新日志
- Hugging Face,IBM Research 使用 ALTK-Evolve 研究智能体一致性
- PR Times,Aillis 新闻稿
- Sakana AI 在 X 上转发 Aillis 新闻稿
- Google,AI & Economy ATLAS
- Google,让每个人都能以每种语言使用 AI
- Google.org,AI for Government Innovation 获奖组织
- Google,构建 AI,加速科学发展并改善生活
- Google,利用 AI 检测森林火灾
- Claude,构建 AI 原生营收组织
- Perplexity,影子 AI
- v0 在 X 上宣布通过 Vercel AI Gateway 提供可选模型
- Warp,采用软件工厂模式
- Kimi Code,0.43.1 版本说明
- Gemini CLI,v0.60.0 版本说明
- GitHub Changelog,Copilot 自定义属性建议
- Grok Imagine 在 X 上宣布图像文字编辑功能
- MiniMax 在 X 上介绍结合 SGLang-Diffusion 与 VDN-H3 的 H3
- Google Research,Retrieve-for-Train
- NVIDIA,稠密模型还是 MoE
- NVIDIA,FLARE 支持 Docker、Kubernetes 和 Slurm
- Sakana AI,Marlin 更新
- Hugging Face,PEFT 中的 ShadowPEFT
- Hugging Face,RiverRider 与文件定位
- Hugging Face,EcoHash 与推测解码
- Hugging Face,DINO-X