搜索

OpenAI 将为欧盟用户的 ChatGPT 和 Codex 文本添加水印,Devin 可跨会话记忆,GitHub 推出 ReviewBench

ai-powered-markdown-translator

使用 gpt-6.1-sol 将文章从法语翻译成中文。

在 GitHub 上查看项目 ↗

OpenAI 将在未来几周内为欧盟用户的 ChatGPT 和 Codex 文本添加不可见水印,以回应《人工智能法案》关于生成文本须可被机器识别的要求,并从今天起向全球 API 客户提供可选的水印功能。在智能体方面,记忆功能正在普及:Cognition 为 Devin 加入跨会话记忆,并将其格式作为开放标准发布;Cohere 推出 North 2,其记忆功能可以在不同会话之间保留上下文;GitHub 则发布了 ReviewBench,这是一个用于人工智能代码审查的开放基准测试。在开放模型方面,Reflection AI 推出了拥有 5010 亿参数的 Beam,并承诺在 10 月晚些时候发布模型权重。


OpenAI 的不可见水印:欧盟的 ChatGPT 和 Codex 文本将被标记,全球 API 客户可选择启用

10 月 5 日 — OpenAI 公布了针对欧洲文本来源规则的应对措施。《人工智能法案》要求生成式人工智能提供商让其生成的文本能够以机器可读的方式被识别;OpenAI 将分阶段落实这一要求,同时一开始就提醒,当前的文本水印技术存在重大局限(显著局限)。

适用对象变化公布的时间安排
欧盟的 ChatGPT 和 Codex 用户,涵盖所有套餐为符合条件的文本添加不可见水印未来几周内
全球 API 客户在部分未公布名称的模型上提供可选水印(主动启用),默认关闭自 10 月 5 日起
获准的研究人员和专业组织提交申请后,逐案开放检测器访问权限10 月 5 日开放申请

OpenAI 没有将其设为全球默认配置,并正在与云服务合作伙伴协作,计划在未来几周内,为这些合作伙伴提供的 OpenAI 模型加入同样的水印。该技术名为 textGrain,会在模型选词时加入不可见的统计信号,不产生可见标记或特殊字符;据 OpenAI 称,其表现与其他受测方法相当或更好,其中包括文本版 SynthID。OpenAI 已发布技术报告,并计划开放其代码。检测器在推出时不会向公众开放,原因是存在水印漏检和误报的风险:访问权限将遵循欧盟委员会的《良好实践准则》(行为准则)。

公布的数据主要揭示了检测的局限:

测量条件公布的检出率
200 tokens 的文本段落,心理学类内容,目标误报率为 1 %约 80 %
400 tokens 的文本段落,心理学类内容,目标误报率为 1 %约 95 %
数学类内容,同样采用 1 % 的阈值明显更低(数值仅在图表中给出)
400 tokens 的英文文本段落(ELI5 数据集),未经修改约 92 %
相同文本段落,10 % 的词语被替换为同义词66 %
相同文本段落,25 % 的词语被替换17 %

Watermarks have limits. They’re often undetectable, especially in short passages. Rewriting or translating text can completely remove the watermark.

🇨🇳 水印存在局限。它们往往无法被检测到,尤其是在较短的文本段落中。改写或翻译文本可能会完全去除水印。 — @OpenAI 在 X 上

在质量方面,OpenAI 在 GPT-6 Astra 的八项基准测试中,未测得添加水印前后存在显著差异(GPQA Diamond 为 94,44 % 对 93,94 %,Terminal-Bench 4.0 为 53,90 % 对 56,06 %)。文章还明确了水印无法说明哪些事情:它不能表明人类参与工作的比例、文本的所有权或责任归属、用户身份,也不能证明内容准确;而没有水印也不能证明文本由人类撰写。图像和音频方面没有变化:openai.com/verify 和 Content Provenance API 仍向组织开放,生成图像自 5 月 19 日起在 C2PA 元数据之外还加入了 SynthID。

🔗 OpenAI 关于欧盟文本来源的文章


10 月 5 日 — Cognition 为 Devin 引入了两项相互关联的功能:Memory,即跨会话持久保存的记忆;以及 Dreaming,即每天重新整理记忆的“梦境”。Memory 会保留智能体在与每位用户合作时学到的内容:偏好、纠正,以及从项目或工作流程中获得的经验。这些内容不是会话摘要,而是简短笔记,每条笔记都关联到学得相应经验的会话;这些记忆仍属于个人,不会变成整个组织共享的指令。

这些笔记存放在 Memory Drive 中,这是一个持久保存的 Git 仓库,内含按代码仓库、项目或主题分类的 Markdown 文件。一个刻意保持简短的 MEMORY.md 文件汇总了通用偏好和其余内容的索引:Devin 在每次会话开始时接收该文件,然后使用浏览代码的工具查找有用的笔记,无需将全部档案载入 prompt。每次会话都使用自己的 Git 副本:Devin 合并其他会话的更新,版本检查会拒绝过时的写入,冲突会被报告,而不会被悄悄覆盖。

Dreaming 是每天一次的后台会话(Cognition 的帖子说明在夜间进行):Devin 结合已有记忆重读过去的对话,合并内容重叠的笔记,移除临时性细节,寻找此前未记录的经验,并删除从未被任何会话使用过的记忆。用户可在 devin.ai 的 Customize → Memory 菜单中访问该功能;文章没有提及 Devin Desktop 或 Devin CLI,也没有公布任何价格。

Cognition 还以 MIT 许可证将这一格式作为开放标准 Agent Memory Repo 发布。该规范接受外部贡献,描述了每次会话的循环流程(克隆记忆、查找、无需人工参与地更新、每次修改后推送),以及如何在同一次会话中组合多个记忆仓库,每份记忆都有独立的仓库、权限和历史记录。文中列举的用途包括团队记忆和智能体群(智能体集群):

In early experimentation we saw a swarm of Devins using the memory as a way to coordinate at large scale without us prompting them to (we promise they didn’t hack anyone)

🇨🇳 在早期实验中,我们看到一群 Devin 使用记忆进行大规模协调,而我们并没有要求它们这样做(保证,它们没有入侵任何人)。 — @cognition 在 X 上

通过“梦境”重新整理智能体记忆的机制,此前已出现在 Anthropic(5 月的 Claude Managed Agents)和 OpenAI(6 月的 ChatGPT 记忆功能)中;这里的新变化在于,记忆以文件形式保存并由 Git 管理版本,而且作为规范发布,供其他智能体采用。

🔗 记忆与梦境:Cognition 的文章 🔗 Agent Memory Repo 规范

Cursor:在运行过程中引导其 SDK 智能体

10 月 5 日 — Cursor 扩展了其 SDK,该 SDK 用于从 TypeScript 或 Python 代码中启动智能体。run.steer() 方法可以向智能体当前进行的轮次插入一条消息;如果此时有子智能体正在工作,它会转入后台并继续运行。后台子智能体也会报告结果:其结果作为同一次执行中的额外轮次返回父智能体,而不会在父智能体轮次结束时丢失。

SDK 新功能更新日志中注明的适用范围
run.steer(),运行过程中引导智能体TypeScript 本地智能体;对于云端智能体,消息会作为常规后续请求发送
返回后台子智能体的结果TypeScript 和 Python 本地智能体
自定义工具的 MCP 注解(readOnlyHint、destructiveHint…)TypeScript;仅提供提示,SDK 不会强制执行
可替换系统 prompt,仍会加载规则与技能TypeScript 本地智能体;按账户启用访问权限

这些变化未附带任何价格信息。

🔗 Cursor 在 X 上的帖子串 🔗 Cursor SDK 更新日志

Qwen Code v0.25.0:工作区智能体、电子邮件渠道与 Mem0 记忆

10 月 5 日 — Qwen 发布了命令行编程智能体 Qwen Code 的 v0.25.0,这是自 9 月 29 日 v0.24.7 以来的首个稳定版本:包含 42 项功能,其中 23 项面向 Managed Agent,另有 79 项修复,没有已知的破坏性变更。其中三项新增功能尤为突出,且都需要显式启用。工作区智能体现在可以在本地协作:守护进程负责启动和恢复它们的轮次,Web Shell 则可以管理智能体和任务,并允许在对话中通过 @agent 调用某个智能体。这些持久运行的智能体通过可到期、可撤销的共享机制接入 A2A 1.0 协议。此外,Mem0 记忆可以直接接入 CLI:只需提供端点和密钥,Qwen Code 就会自行注册相应的 MCP 服务器。电子邮件渠道还为智能体提供了自己的邮箱,支持 IMAP 和 SMTP;Code Mode 则会并行执行模型归为一组的 Bash 调用。TypeScript SDK v0.1.18 和 Desktop 应用 v0.25.0 也在同一天上午发布,Qwen 未发布相关推文。

🔗 Qwen Code v0.25.0 版本说明

Together Link:让 Claude Code、Codex、OpenCode 和 Pi 使用开放模型

10 月 5 日 — Together AI 推出了 Together Link 的测试版,让已安装的编程智能体使用平台托管的开放模型运行。一条安装命令(适用于 macOS 或 Linux)即可使用账户密钥,将 Claude Code、Claude Desktop、Codex、OpenCode 和 Pi 接入其 API;文档还列出了 ChatGPT Desktop,并提醒命令、路由和模型列表仍可能变化。除 Auto 模式外,还提供四款模型,均拥有 1M tokens 的上下文:

提供的模型在 Claude Code 的 /model 菜单中的对应项
Kimi K3Opus
GLM 5.3Fable
GLM 5.3 FlashSonnet
DeepSeek V4.1 FlashHaiku

默认选择的 Auto 模式,在用户提供 Anthropic 密钥时,可以将困难任务交给 Opus 5.5,但文章和文档对这种路由的描述并不一致:文章称每次会话只选择一次,以保留 prompt 缓存;文档则称逐个请求分流,且仅适用于 Claude Code 和 Claude Desktop。Together AI 宣称支出可降低超过 50 %,但未公布测算方法,并会在每次会话结束后,将实际成本与使用 Opus 5.5 时的预估成本并列显示。

🔗 Together AI 的文章 🔗 Together Link 文档

自托管的 IBM Bob 采用 NVIDIA 的 Nemotron 3 Ultra

10 月 5 日 — IBM 解释了为何其智能体式开发助手 Bob 的自托管(自行托管)版本采用 NVIDIA 的 Nemotron 3 Ultra,并搭配 Poolside Laguna S 2.1。这一选项在前一周正式开放,让助手运行在客户的基础设施上,甚至支持断网隔离环境(物理隔离)。团队按四项标准评估模型(硬件占用、代码准确性、延迟、权重开放程度),使用 Bob 的智能体运行框架进行测试,并以 Anthropic、OpenAI 和 Google 的闭源模型作为参照。Nemotron 起初过于冗长,团队与 NVIDIA 协作进行了调整,涉及 prompt、采样参数、推理设置以及运行框架修复。据 IBM 内部测试,Nemotron 3 Ultra 在 Blackwell GPU 上的延迟最低可降至通过网络调用的领先 SaaS 模型的约四分之一,并严格遵守工具格式规范;Laguna S 2.1 则因性能与资源占用之间的比例而被选中。文章未公布任何准确性分数。

🔗 IBM 关于自托管 Bob 的文章


ReviewBench:GitHub 推出开放的人工智能代码审查基准

10月5日 — GitHub 推出 ReviewBench 的研究预览版(研究预览),这是一个面向人工智能代码审查智能体的开放基准。专门网站公布了完整数据集、排行榜、方法、提示词和评审模型配置,以及可自行运行的执行工具。博文由米歇尔·周和亚历杭德罗·卡德雷拉·德迭戈署名,致谢部分提及 GitHub 和 Microsoft 对项目的参与。

语料包含来自 187 个公开开源仓库的 219 条拉取请求,覆盖 19 种语言。其语言和仓库规模分布参照了基于 1.039 亿条拉取请求统计的 GitHub 分布,同时有意提高了中等和大型变更的权重。真值集(黄金集)结合了人工审查、从后续提交中推断的问题、确定性分析工具以及多个先进 LLM;发现的问题再由 LLM 评审模型验证,据博文介绍,该模型为 Claude Sonnet 5。未参与数据集构建的资深工程师重新标注了每个问题:他们的判断在 96,6 % 的情况下与 ReviewBench 一致。“基于真值”的召回率(有据召回率)仅在真值集上计算,是主要比较指标。

根据 GitHub 的初始排行榜,Copilot code review 位居首位:

受评智能体(配置)基于真值的 F1基于真值的精确率基于真值的召回率运行日期
Copilot Code Review (Balanced)40,1 %87,8 %26,0 %2026年10月1日
Devin AI37,0 %84,0 %23,8 %2026年9月28日
Qodo35,1 %85,3 %22,1 %2026年9月28日
Codex (GPT-5.6 Sol · Ultra)32,3 %87,0 %19,9 %2026年7月19日
Cubic27,3 %85,5 %16,3 %2026年6月29日
Greptile27,2 %86,1 %16,2 %2026年6月16日
Cursor17,3 %87,7 %9,6 %2026年9月27日

网站说明,这些初始结果由 ReviewBench 团队在所示日期运行各厂商的公开产品生成,厂商并未执行或核验。现在,任何人都可以提交自己的智能体:提交者提供容器镜像和模型密钥,GitHub 提供评审模型,先在 25 条拉取请求上试运行,再完整运行三轮;分数须经维护者验证后才会发布,而且仅限于智能体首次上榜或分数超过其此前成绩的情况。

GitHub 也用它来改进 Copilot code review。在 A/B 测试中,Lite 级别的多模型审查结合了多次独立运行,使召回率提高了 13,6 %,每次审查的成本降低了 8,0 %,变化方向与离线测试的预测一致。博文对评论数量的描述存在矛盾:正文称增加了 61 %,图表则显示增加了 25,0 %。

🔗 GitHub 关于 ReviewBench 的博文 🔗 ReviewBench 网站和排行榜


Cohere 推出 North 2,并与 PwC 建立全球联盟

10月5日 — Cohere 推出 North 2,这是其企业人工智能智能体平台 North 的新版本,曾于 9月9日宣布“即将推出”,随后承诺在 10月发布。发布帖串声称新增了 15 项以上功能(15+ 项新功能),但博文没有沿用这一统计。此次版本的核心是一套全新的智能体运行框架(智能体运行框架),为多步骤自动化和智能体重新设计;平台仍不绑定特定模型,可使用 Cohere 的模型或客户自有模型。

功能领域Cohere 提及的新功能
智能体可重复使用的智能体和自动化流程,通过提示词创建并在组织内共享;多智能体编排;可跨会话保留上下文的记忆
生产力技能(Skills)、库(Libraries)和可生成演示文稿、仪表盘及文档的应用;7月底推出的 Automations,提供现成模板和可视化编辑器
连接器Slack、SharePoint、OneDrive、Outlook、Exchange、Jira、Linear、Notion 和 GitHub;金融数据供应商连接器(PitchBook、FactSet 等)尚处于计划阶段
部署与安全自托管、VPC、混合部署、本地部署或完全断网部署;SOC 2 Type 2、ISO 27001 和 ISO 42001;自主运行策略,关键决策须经人工审批
治理North Admin 控制台,按用户或群组设置请求和 tokens 用量档位,在达到上限前发出提醒

Cohere 提及两家客户:韩国的 LG CNS 和加拿大的 Bell Cyber,并强调其模型在 NVIDIA Blackwell 和 Hopper GPU 上的吞吐量更高,但没有提供数字,同时引用了 NVIDIA 生成式人工智能负责人卡丽·布里斯基的话。博文未给出价格或部署时间表,而是引导读者向销售团队预约演示。

🔗 North 2 发布博文 🔗 X 上的 North 2 发布帖串

从加拿大起步的 PwC 全球联盟

10月5日 — 同一天,PwC 和 Cohere 宣布建立从加拿大起步的全球联盟(全球联盟)。消息来自 PwC 加拿大发布的一份署地为多伦多的新闻稿,Cohere 的一篇短博文也转述了该消息。双方分工明确:Cohere 提供 North、企业模型和信息检索工具;PwC 提供行业、监管、风险管理和转型方面的专业能力,涵盖从选择应用场景到将人工智能接入企业数据和系统的全过程。公布的用途包括企业搜索、知识获取、深入研究、决策支持和任务自动化,可部署在私有云、本地或断网环境中,主要面向受监管行业。新闻稿引用了 PwC 加拿大的多梅尼克·马里诺和安妮·韦耶,以及 Cohere 的艾丹·戈麦斯的话;未披露金额、客户,也未给出加拿大以外的推进时间表。Cohere 此前已于 9月16日与 OpenText 建立联盟。

🔗 Cohere 关于 PwC 联盟的博文 🔗 PwC 加拿大新闻稿


开放模型:Beam、MetaEncoder-30B,以及用于植物基因组学的 Gemma 4

三个开放模型成为当天的新闻焦点,但所处阶段各不相同:一个尚待发布,一个未发公告便已上线,另一个则在发布一个月后受到重点介绍。

Beam:Reflection AI 的 5010 亿参数开放模型

10月5日 — Reflection AI 介绍了其首款开放权重模型 Beam:这是一个拥有 5010 亿参数、其中 230 亿参数处于激活状态的稀疏 MoE 模型,面向编程、推理和智能体任务,从零开始完成端到端训练。预训练使用了 23.8 万亿个词元;强化学习阶段使用 10 500 块 NVIDIA GB300 GPU,历时四周,生成了超过 1 亿条轨迹(展开轨迹)。

根据 Reflection AI 的表格:

受评基准BeamNemotron 3 UltraGLM 5.3Kimi K3Qwen 3.8 MaxDeepSeek V4.1 Flash
SWE-bench Verified80,970,7————
SWE Bench Pro v165,546,4——67,7—
Terminal Bench v2.180,156,488,288,386,690,6
DeepSWE v1.144,4—61,068,051,074,2

破折号表示博文未报告该项分数。Reflection AI 声称,Beam 的推理成绩可与 GLM-5.2 相当,而推理计算量仅为其三分之一至四分之一,并承认 Kimi K3 在绝对能力上仍然领先。目前尚无任何内容可供下载:Beam 正在接受最终评估和对抗测试(红队测试),提前访问需要登记,权重、技术报告、模型卡和开发者工具承诺于 10月稍晚发布。

🔗 Reflection AI 关于 Beam 的博文

MetaEncoder-30B:Meta 未发公告便上线的决策编码器

10月5日 — Meta 已在 Hugging Face 的 facebook 组织下上线 MetaEncoder-30B,但尚未找到相关公告:该仓库创建于 9月30日,并于 10月5日修改,截至我们统计时仅有两次下载。模型卡将其描述为“System One”多模态编码器,采用 Jev 决策模型的形式:输入以自然语言描述的任务(问题、指令、状态描述、标准)及候选项列表,以文本为主,辅以图像和视频,模型为每个候选项评分。任务和候选项分别编码后,比较只需计算点积,最近邻索引便可覆盖数百万个候选项,无须重新运行模型。MetaEncoder 通过对比式微调得到,其基础模型为 Meta 于 8月发布的开放权重智能体模型 Muse Glimmer 30B,并沿用 Apache 2.0 许可证;下载前须接受相关条款,vLLM 可为其提供文本和图像推理服务。

评测基准模型卡给出的分数使用的指标
JEVBench(原版 / 简单 / 困难)0,9444 / 1,0000 / 0,7387准确率
ImaJEV-Bench0,8958准确率
NanoBEIR0,6632NDCG_linear@10
MMEB-V3(图像 / 视频 / 视觉文档)0,7897 / 0,6046 / 0,8138Hit@1 / Hit@1 / NDCG@5

🔗 Hugging Face 上的 MetaEncoder-30B 模型卡

Living Models 结合 Gemma 4 和 BOTANIC-1 解码植物 DNA

10月5日 — Google 在 @GoogleAI 发布的 X Article 和 Gemmaverse 展示页面上,重点介绍了位于巴黎的人工智能生物学实验室 Living Models 的工作。Gemma 4 E4B 负责协调分析(终端处理流水线、数据筛选、工具调用),通过 Ollama 在单块 NVIDIA L4 GPU 上本地运行;与此同时,基于 320 种植物预训练的基因组基础模型 BOTANIC-1 评估突变的影响,专有基因组数据保留在本地。案例研究重现了阿德南·布阿莱姆在 INRAE 开展的一项发现:甜瓜 CmEIN3 基因中仅一个字母的变化,就会让花从雌花变成两性花。根据 X Article,在 2 494 个候选点突变中,经过验证的突变在不到四分钟内独占首位,没有并列结果。

测试配置(20 次运行)Recall@1
无引导0,00
专家引导0,15
使用 BOTANIC-1 评分0,90

Botanic1 模型(参数规模为 3 亿至 20 亿)和 bioRxiv 预印本都发布于 9月初:此次的新进展是 Google 的重点介绍,以及详细结果的披露。

🔗 Google AI 的 X Article 🔗 Google DeepMind 的 Gemmaverse 页面


ChatGPT 广告:测试视觉格式,扩展效果衡量

10月5日 — OpenAI 正在为 ChatGPT 准备一种视觉广告格式:图片将展示围绕产品的灵感、产品用法或产品带来的体验。首轮测试将在图像生成过程中进行,广告会明确标注,并与正在生成的图像分开显示;测试将于本月晚些时候在美国启动,由首批广告主参与。OpenAI 重申,广告不会影响 ChatGPT 的回答,据该公司称,ChatGPT 每周覆盖 12 亿人。

此次公告主要涉及效果衡量:通过 Hightouch、Tealium 和 LiveRamp 发送转化数据,公布十家归因合作伙伴(包括 AppsFlyer、Adjust 和 Triple Whale),与 Haus、Measured 和 WorkMagic 开展地域增量效果实验,在报告中提供一天的展示后转化窗口,以及信号质量指标(Event Quality Score)。在品牌安全方面,符合条件的广告主可以排除特定词句(Negative Phrases),与 DoubleVerify 和 Integral Ad Science 开展的评估试点也正在筹备中。像素追踪工具和 Conversions API 则从 5月5日起就已提供。

OpenAI 公布的结果公布数值衡量方
WeightWatchers 相对于其付费搜索基准的获客成本−15,3 %DV Rockerbox
Dose 品牌增量购买中由新客户完成的比例67 %WorkMagic
来自 ChatGPT Ads 且首次接触 Portland Leather 品牌的访客比例93 %Triple Whale

🔗 OpenAI 关于新广告格式的博文 🔗 Ads 博客关于效果衡量的博文


Perplexity 10 月 5 日更新日志:Computer 浏览器扩展、Wiley 与 Stripe Projects

10 月 5 日 — Perplexity 发布了一份包含 18 项内容的产品更新日志,截至我们记录时尚未在 X 上发布相关消息。其中八项重述了此前已报道的公告(Automations、Claude Opus 5.5、视频生成、American Express Skills、AMD 上的 Portable Computer、Fast Search、Agent API 的 Profiles、Claude Fable 5.1),第九项为 10 月 1 日的图表功能增添了交互式 3D 讲解,另有九项首次公布的新功能:

首次公布的新功能平台或版本适用用户
Chrome、Edge 或 Brave 扩展,让 Computer 能够使用浏览器(Comet 仍为默认浏览器)Perplexity Mac 版 26.38.0 及以上版本未说明
在独立标签页和窗口中运行 Computer 任务Perplexity Mac 版 26.37.1 及以上版本未说明
移动端的任务投入程度模式(Light、Standard、High、Ultra)iOS 26.38.0 和 Android 2.100.0 及以上版本Pro、Max、Enterprise Pro、Enterprise Max
无需另行订阅 Wiley 即可访问其期刊和图书Perplexity 和 Computer所有套餐,高级内容配额各不相同
GPT-6.1 Sol,同时取代 GPT-6 Sol,为 Computer 的 Light 模式提供支持Perplexity 和 Computer符合条件的付费订阅用户
通过引导式对话启动首个 Computer 任务网页端新注册的免费账户
从输入区域连接应用(连接应用)网页端 Computer未说明
用于投资交易资料室(交易资料室)的 DocSend 连接器Computer符合条件的 DocSend 账户
Stripe Projects:从 Stripe CLI 创建 Perplexity API 密钥Stripe CLIPerplexity API 开发者

借助 Stripe Projects,一条命令即可创建或关联项目、生成密钥,并将其写入 .env 文件;Perplexity 建议将这项配置工作交给 Claude Code、Cursor 或 Codex。

🔗 Perplexity 10 月 5 日更新日志


生成式创作:Suno Albums 与 HeyGen 的 HyperFrames Studio

Suno 新增专辑功能

10 月 5 日 — Suno 新增了此前平台上没有的专辑功能。根据随公告发布的博文,这项功能可将用户最出色的曲目整合成完整作品(完整作品),此前用作专辑的播放列表(播放列表)现在也可以转换为 Album。Suno 介绍了首批五张专辑及其创作者:naenia(Oakwood///diskrot)、Old Soul(Isaiah Wallace)、phenomenal(KakerMix///diskrot)、Lost In a Dream(Dream Relic)和 VOID(ECHLO)。该公司未说明适用套餐、每张专辑的曲目数量或确切上线日期。早在 6 月,Suno 就已向社区征询播放列表、专辑和电台等方面的收听体验。

🔗 Suno 在 X 上的公告 🔗 五张不容错过的专辑,Suno 博客

HyperFrames Studio:HeyGen 专为智能体打造的视频编辑器

10 月 5 日 — HeyGen 的开源框架 HyperFrames 可将 HTML 代码转化为视频,如今推出了桌面应用。HyperFrames Studio 将自己定位为从零开始为智能体打造的视频编辑器:用户描述想要的视频,智能体(Claude Code、Codex 或自行开发的智能体)交付初剪版本,随后人与智能体在同一条时间轴(时间轴)上共同工作。用户通过操作来指导编辑,而非仅靠提示词:圈出画面中的元素、将评论固定到某个词上,或亲自剪切。该应用支持导出 4K 视频,并宣称提供数百种灵感素材和模板;据 HyperFrames 的 X 账户介绍,应用免费,目前仅提供 macOS 版本下载。它延续了 7 月推出的 Studio Preview 预览版,后者已支持通过可视化操作编辑由代码生成的视频。

🔗 HyperFrames Studio 公告 🔗 HeyGen 转发的消息


简讯

  • Warp Factories 迈向正式开放 — Warp 在 10 月 3 日介绍秋季研讨会的博文中表示,其智能体基础设施 Warp Factories 正从抢先体验转向正式开放,但未公布日期或价格;团队称,在过去一个月中,借助该基础设施,每个 PR 的成本降低了 70 %。🔗 来源
  • Devin 10 月 2 日版本说明 — Microsoft Teams 的访问设置现已生效,单击即可选中同一严重级别的所有安全问题(包括 API v3),推荐插件会在安装前展示其技能、MCP、钩子和规则;大型 Perforce 仓库的环境构建时限延长至 3 小时,不再在 10 分钟后因超时失败。🔗 来源
  • Replit 中的 TikTok Ads MCP — Replit 将 TikTok Ads 加入其包含 450 多项集成的目录:连接账户后,其 Agent 可在工作区中创建和管理 TikTok 广告、触达受众并衡量效果,连接操作不消耗额度。🔗 来源
  • Replit 上的 Cockle Finance — Replit 置顶了一段介绍 Cockle Finance 的视频;丹与父亲史蒂夫使用 Replit 构建了该工具,以追踪不断增加的客户。据 Replit 称,丹的业务在三个月内增长了 15 %,但未说明具体衡量指标。🔗 来源
  • Copilot CLI 1.0.92 稳定版 — 该版本汇集了 1.0.92-0 至 -5 预发布版本的新功能;唯一首次出现的改动是,用户通过 Microsoft Entra 登录后可选择要使用的账户,/logout 可关闭这些 OAuth 会话,而受 Entra 保护的 MCP 服务器会自动更新凭据,无需人工干预。🔗 来源
  • Codex CLI 0.160.1 — 这个针对 0.160.0 的修补版本仅包含一项回移修复:启动显式配置了远程环境的远程 MCP stdio 服务器时,保留 Windows 的 SYSTEMROOT、TEMP 和 TMP 变量;这是最新稳定版,尚未发布 0.161.0 稳定版。🔗 来源
  • Gemini CLI 10 月 5 日每夜构建版 — 该版本没有任何改动:与 10 月 3 日的版本基于同一提交构建,仅版本号不同,稳定版(v0.62.0)和预发布版(v0.63.0-preview.0)渠道均保持不变。🔗 来源
  • SpaceXAI TypeScript SDK 0.2.1 — 该版本于 10 月 2 日发布,新增 toJson(schema),可使用 Standard Schema 验证器(Zod、Valibot 或 ArkType)验证结构化输出;还新增 retryBeforeOutput 选项,可重试在产生任何输出之前失败的流式请求(流式传输)。对于没有 Retry-After 标头的 429 响应,重试等待时间现在从一秒开始,最长为 30 秒,而非此前的 250 毫秒。🔗 来源
  • 基于 Claude Agent SDK 的 Cresta Conductor — 在 Anthropic 介绍使用 Claude 构建产品的初创公司的系列内容中,Cresta 展示了 Conductor:一款基于 Claude Agent SDK、通过自然语言构建客户服务智能体的工具。据 Cresta 称,在首批应用场景中,它将初次部署时间缩短了约一半,但未公布开放日期或价格。🔗 来源
  • npm:可信发布配置到期机制 — 自 10 月 2 日起,从未用于发布的可信发布(可信发布)配置会在创建 48 小时后到期,npm 也会拒绝来自 GitHub Actions 的 issue_comment 事件的令牌,与 pull_request_target 的处理方式相同。🔗 来源
  • npm:待发布流程可创建软件包 — 自 10 月 2 日起,npm stage publish 可通过本地会话或细粒度令牌创建尚不存在的软件包,包括权限仅限暂存(仅暂存)的令牌;首个版本必须等待维护者将其提升为正式发布状态后才能安装。🔗 来源
  • Perplexity Agent API 采用 Fast Search — Agent API 的 low、medium 和 high 预设现在为 web_search 工具使用 Fast Search,每 1 000 次调用的费用从 2.50 美元降至 1 美元,速度约快 800 ms;xhigh 预设仍使用标准搜索。🔗 来源
  • Perplexity RAG 指南 — Perplexity 发布了一份指南,包含九个检索增强生成(检索增强生成,RAG)示例和七种架构,在介绍 Zendesk、GitHub Copilot 等第三方示例的同时,也引用了自身的网页索引和 Instant Buy 功能;没有产品新功能发布。🔗 来源
  • Cohere 员工规模 — 据 Cohere 在一则招聘消息中披露,公司员工人数从 2026 年初的约 400 人增至目前的 800 多人。🔗 来源
  • Meta 的 IsoVGRBench 与 Logbook — facebookresearch 未发布公告,直接公开了 IsoVGRBench 的代码;该项目使用 16 000 对仅在一个方面存在差异的视频评估视频奖励模型(面对同一片段的画面顺序被打乱的版本时,这些模型的回答几乎等同于随机猜测)。同时公开的还有 Logbook 代码,该项目聚焦超长音频录音中的事件。🔗 来源
  • FiftyOne 支持读取 LeRobot v3 数据集 — 据哈普里特·萨霍塔的一篇社区博文介绍,开源工具集 FiftyOne 现已原生支持读取 LeRobot v3 格式,无需转换器或复制视频;演示使用了 LeRobot 社区数据集中来自 50 种机器人类型的 497 个片段。🔗 来源
  • Ai2 的 FetchMan-data — 该数据集于 10 月 1 日发布,未附公告,包含 Unitree G1 人形机器人抓取物体的 352 696 个模拟片段(5 200 万帧、902 条指令),由 MolmoSpaces 生成,采用 LeRobot v3 格式,以 ODC-BY 许可发布。🔗 来源
  • Hugging Face 个人资料中的 P(doom) — Hub 用户可在个人资料中展示自己的 P(doom),即对人工智能引发生存性灾难概率的估计;回答将用于一项调查,两周后仅发布经过汇总和匿名化处理的结果。🔗 来源
  • hf-image 扩展 — Hugging Face 未发布公告,直接开放了一款 CLI 扩展,可在其 cr.hf.co 容器镜像仓库中构建、推送、拉取和运行容器镜像;未压缩的镜像层通过 Xet 去重,因此据 README 介绍,一个 2 GB 的镜像层若修改了 100 MB 内容,只需发送约 100 MB 数据。🔗 来源
  • 米洛什·科特拉尔的三项实验 — 在三篇社区博文中,米洛什·科特拉尔将一个小型 Transformer 的 KV 缓存压缩至原来的约 1/2.71,同时保持下一词元预测 97.85 % 的一致率;他还将 MoE 路由中未分配到专家的词元比例从 13.84 % 降至 8.09 %,但没有带来任何速度提升。🔗 来源
  • 斯蒂芬·余对 LLM 评判器的审计 — 斯蒂芬·余使用 38 400 个样本,审计了用于其 12B 改写模型 GRPO 奖励中评估事实忠实度的 GLM-5.3 评判器:它能可靠地识别事实是否发生变化,但对变化严重程度的判断噪声较大;按有错误的输出数量统计,发现错误减少了 39 %,此前的统计方式掩盖了这一下降。🔗 来源
  • Sakana AI 东京研讨会 — Sakana AI 开放了一场免费研讨会的报名,活动将于 10 月 26 日在东京一桥讲堂举行,使用英语,包括于尔根·施米德胡伯的演讲,以及对 Sakana AI 首席执行官大卫·哈的访谈。🔗 来源
  • NVIDIA Inception 初创公司与乳腺癌 — NVIDIA 介绍了其 Inception 计划中将人工智能应用于诊疗流程的四家初创公司,包括 iSono Health 及其获 FDA 授权的 3D 超声设备 ATUSA(每侧乳房检查约需两分钟,而手动检查最长可达 45 分钟)、Whiterabbit.ai、Ataraxis AI 和 SimBioSys;其中部分技术尚未获 FDA 批准。🔗 来源

这意味着什么

文本来源正在成为一项监管义务。此前,生成内容的可追溯性主要集中在图像和音频,通过水印和可验证的元数据实现;《人工智能法案》将这一要求扩展到文本,OpenAI 则分阶段响应:在欧盟,ChatGPT 和 Codex 的文本默认添加水印,API 中仅作为可选功能,检测器则仅向获准的组织开放。公布的数据解释了这种谨慎:对于心理学类内容,在目标误报率为 1 % 的条件下,约 95 % 的 400 词元段落可被检测出来;但对于 400 词元的英语段落,将 10 % 的单词替换为同义词,会使检出率从约 92 % 降至 66 %,改写或翻译也可能抹去水印。水印提供的是来源线索,而非证据;没有水印也无法说明作者是谁。

智能体记忆正在落地,并开始走向标准化。Devin 将积累的经验保存在由 Markdown 文件组成的 Git 仓库中,由 Dreaming 每天重新整理;Cognition 以 MIT 许可公开了这一格式,供其他智能体采用。North 2 在不同会话间保留上下文;Qwen Code 则将 Mem0 直接接入其 CLI。这些方案各不相同,既有人类可读、带版本记录的文件,也有外部记忆服务和平台内置功能,但都回应了同一个需求:让智能体不必在每次会话中从零开始。Cognition 的选择有一个实际优势:每条笔记都链接到获得该经验的会话,可在界面中查阅,并保留 Git 历史记录,因此用户能够阅读和修正智能体记住的内容。

开放模型正通过多种途径进入编程工具。Together Link 将它们接入现有智能体,包括 Claude Code 和 Codex,并宣称支出可减少一半以上;IBM 让自托管版 Bob 运行在 Nemotron 3 Ultra 上,服务于将开发工作保留在自有基础设施上的企业,甚至支持断网环境;Reflection AI 将 Beam 定位为专为编程和智能体任务打造的开放模型,据其自行公布的表格,SWE-bench Verified 得分为 80.9。它们共同强调的重点并非单纯的分数——Reflection AI 也承认 Kimi K3 仍然领先——而是成本、延迟和数据控制权。

当天的许多数字都来自发布者自身。GitHub 设计了 ReviewBench,并给出了 Copilot 代码审查排名第一的初始榜单,其他厂商尚未运行或验证这一评测;Nemotron 3 Ultra 的延迟数据来自 IBM 内部测试;Together Link 的成本节省和 ChatGPT 的广告效果则分别由 Together AI 和 OpenAI 自行公布。不过,GitHub 公开了数据集、评判器和评测方法,并开放提交:每家厂商都可以使用自己的智能体重新测量。这将有助于判断这份初始排名是否经得起验证。


来源