搜索

ChatGPT中的健康功能、FLUX 3 统一图像与视频、ChatGPT Voice 登陆桌面端

ChatGPT中的健康功能、FLUX 3 统一图像与视频、ChatGPT Voice 登陆桌面端

ai-powered-markdown-translator

使用 gpt-5.4-mini 将文章从法语翻译成中文。

在 GitHub 上查看项目 ↗

2026年7月23日集中迎来七项重大公告:OpenAI 将 Health in ChatGPT 推向美国用户,并让 ChatGPT Voice 登陆桌面应用;Black Forest Labs 在 FLUX 3 中统一图像、视频、音频和动作预测;GitHub 首次为其代理在 Issues 中自行修改的内容设置边界;HeyGen 将其 HyperFrames 框架升级为完整的视频创作代理;Cognition 则通过收购 Poke 以及与美国能源部签署谅解备忘录扩大版图。这七个主题之外,还伴随着十八项值得注意的新内容——从 Claude 的语音模式到代码工具(Cursor、Replit、Zed、v0、Amp),以及 Gemini 和 Hugging Face 在网络安全方面的动作。


Health in ChatGPT 登陆美国

7月23日——OpenAI 面向已登录的美国用户推出 Health in ChatGPT,适用于 18 岁及以上人群,覆盖 web 和 iOS,支持 Free、Go、Plus 和 Pro 套餐。该功能可安全连接 Apple Health 以及受支持的医疗记录(美国医院系统、One Medical、Function Health),让 ChatGPT 获得用户健康上下文——例如将某项化验结果与既往检测对比、总结自上次就诊以来的变化,或将睡眠与活动数据同日常作息交叉分析。

OpenAI 强调了一个数字:每周有超过 3 亿人向 ChatGPT 提出与健康相关的问题。公司表示正与数百名医生合作,以衡量并提升准确性、安全性,以及对需要专业照护情形的识别能力。在模型方面,GPT-5.5 Instant(免费计划)为所有用户提供通用基础,而 GPT-5.6 Sol(付费计划)在复杂问题上更进一步;在由医生共同开发的 HealthBench Professional 评测中,所有 GPT-5.6 模型都优于 GPT-5.5。

在隐私方面,OpenAI 强调:已连接的医疗记录和 Apple Health 数据,以及使用这些数据的对话,绝不会用于训练模型或投放广告,无论用户另外选择了何种训练设置。默认情况下,ChatGPT 会在每次使用这些数据前请求许可;注销账户后,已同步数据会在 30 天内删除。值得注意的是:Health 在 Codex 中不可用。今年早些时候的一个初版仅将这些交流限制在专用空间中——但与健康相关的对话有 70% 以上发生在其他地方,因此最终将其原生整合进全部对话之中。

🔗 官方公告 — OpenAI


FLUX 3:Black Forest Labs 统一图像、视频、音频和动作预测

7月23日——Black Forest Labs(BFL),也就是图像模型 FLUX 的创造者,宣布推出 FLUX 3,其定位是一款在统一架构上训练的单一多模态模型,而不是将多个分离模型事后拼接而成。公司强调,与前几代相比,它在“所有风格下都更接近现实”。

覆盖模态截至7月23日的状态
图像已可用
视频(FLUX 3 Video)提前访问,今日起可用
音频已集成到统一架构中
动作预测与 mimic 和 Audi 合作进行机器人工作

这次发布有两个亮点。首先,FLUX 3 Video 将 BFL 的历史重心——静态图像——扩展到视频领域,而这一领域此前主要由 Runway、Luma、Kling 或 Wan 主导。其次,BFL 表示该模型的统一架构可以扩展用于预测物理动作,并与 mimic(远程操控与机器人学习专家)及 Audi 合作开展相关工作——这一方向让 BFL 更接近物理 AI 赛道,而 NVIDIA 正在通过 Cosmos 和 Isaac 大举投入这一领域。

公告发布帖在几小时内收获了超过 39.3 万次浏览,后续帖子还展示了首批 FLUX 3 图像样本。就生成媒体领域而言,这无疑是该时间窗口内最引人注目的模型发布,无论是其雄心——一个模型覆盖四种模态——还是其向机器人领域的延伸。

🔗 X 上的公告


ChatGPT Voice 用语音操控 Chat、Work 和 Codex

7月23日(21:43)——OpenAI 宣布 ChatGPT Voice 将登陆桌面应用(macOS 和 Windows),面向 Plus、Pro、Business、Edu 和 Enterprise 套餐,自今日起全球部署。该功能由 GPT-Live 驱动,可仅凭语音控制电脑并指挥多个代理——ChatGPT Work 或 Codex:模型会说话、倾听,并同时在应用内协调工作。

ChatGPT Voice is now in the desktop app. Control your computer and direct multiple agents running in ChatGPT Work or Codex, using just your voice. It’s powered by GPT-Live, so it can speak, listen, and coordinate work in the app at the same time. Rolling out globally today on macOS and Windows to Plus, Pro, Business, Edu, and Enterprise plans.

🇨🇳 ChatGPT Voice 现已在桌面应用中可用。仅用你的声音,就能控制电脑并指挥在 ChatGPT Work 或 Codex 中运行的多个代理。它由 GPT-Live 提供支持,因此可以同时在应用内说话、倾听并协调工作。自今日起在 macOS 和 Windows 上全球部署,适用于 Plus、Pro、Business、Edu 和 Enterprise 套餐。@OpenAI 在 X 上

Codex 官方更新日志(26.715 版)补充了推文中没有提到的一点:在 macOS 上,“Screen context” 选项可在语音对话期间将前台窗口截图分享给 ChatGPT,让助手在你口述操作时看到你正在查看的内容。一则后续推文还说明,ChatGPT Voice 也可在 iOS 应用中的 Codex 内使用,通过已配对的远程访问实现——Android 支持则标注为“即将推出”,但未给出日期。

🔗 Codex 更新日志 — 26.715 版


Claude 的语音模式也在升级

7月23日——Anthropic 更新了 Claude 的语音模式,所有套餐均可使用。它现在基于更强大的模型——Opus 和 Sonnet——而不再依赖一个更轻量的专用模型,从而带来更深入的口语交流。

Voice mode now runs on Claude’s more capable models and reaches the tools you’ve connected mid-conversation. Talk through the hard problems out loud, in many more languages.

🇨🇳 语音模式现在由 Claude 最强大的模型提供支持,并且可以在对话过程中访问你已连接的工具。以更高的语言覆盖范围,对复杂问题进行大声思考。@claudeai 在 X 上

Claude 现在也可以在对话中访问已经连接到账户的工具(如消息、日历),而不会中断对话。语音模式新增西班牙语、法语、印地语和日语,自今日起在移动端、桌面端和网页端进入公开测试。

🔗 相关博客文章


Codex:跨多个文件夹的项目

7月23日(22:31)——在与 ChatGPT Voice 同一次发布中(Codex 更新日志 26.715),Codex 为桌面版 ChatGPT 引入了 多文件夹本地项目。现在,一个本地项目可以将分散在多个文件夹中的代码、文档和参考文件整合起来;Codex 可跨整个集合进行读写,而一个 primary 文件夹仍保持为 Git 根目录。

在项目菜单中,“Edit project” 选项可用于添加文件夹并指定 primary 文件夹。新的聊天、Git 操作、AGENTS.md 的自动发现、skills 以及 config.toml 文件都会使用 primary 文件夹;secondary 文件夹仍可用于文件搜索,并支持读写访问。

🔗 X 上的公告


GitHub 为修改 Issues 的代理设限

7月23日——GitHub 已以公开预览的形式推出一组控制项,用于约束 GitHub Issues 上的代理自动化行为。起点是这样的现实:代理(GitHub Agentic Workflows、Copilot cloud agent)越来越多地自动为 issues 添加标签、设定类型、指派和关闭,而团队往往无法清楚知道原因,也难以轻松保持控制权。

新增能力它的作用
审批自动化先“建议”而非直接应用;变更需逐项或批量等待验证
置信度评分每个动作都会获得高 / 中 / 低置信度;只有高置信度会自动应用
理由每个动作都会记录其理由,无论已应用还是待处理——可供审计追踪

搜索 has:suggestions 可找到带有待审查变更的 issues;管理员可以配置置信度阈值,决定哪些内容会自动应用。这些控制项既适用于 GitHub Agentic Workflows(通过在工作流 frontmatter 中添加 issue-intents: true),也适用于 Copilot cloud agent(无需更新)。发布时覆盖的动作包括:标签、自定义字段、类型、关闭和指派,均通过 REST 和 GraphQL API 实现。

GitHub 自己也提醒了一个重点:审批被定位为“工作流便利功能,而非安全控制”——它们并不会在服务端形成强制屏障,拥有必要权限的代理仍然可以直接应用变更,而不是先建议。GitHub 强调的使用场景包括:自动分流、元数据补全,以及带理由的垃圾信息检测。

🔗 GitHub 更新日志


GitHub Mobile 用 Copilot 修复你的 CI 失败

7月23日——GitHub 将此前仅在 pull request 评论中可用的 Fix with Copilot 功能扩展到了移动应用(iOS 和 Android)。现在,当某个 GitHub Actions 检查在 pull request 上失败时,GitHub Mobile 会直接在失败的检查项上显示 Fix with Copilot 按钮。

只需一步,Copilot coding agent 就会分析失败原因,在现有 pull request 之上创建一个带有建议修复的新 pull request,然后通知用户进行审查。其目标是让用户在路上也能快速应对 CI 失败,而无需回到工作站,从而即使离开键盘也能让 pull request 持续推进。

🔗 GitHub 更新日志


Runway 自动选择生成模型

7月23日——Runway 推出 Media Router,并将其描述为首个“按偏好优化”的媒体生成路由器。用户不必为每次请求手动选择模型,而是只需定义一次“更好”意味着什么——成本、质量或延迟——路由器就会自动挑选合适的视频、图像或音频模型。

该功能现已在同步推出的 Runway Dev 开发者平台中可用。它更像一块基础设施,而不是一个新模型:面向那些编排多个第三方生成模型、并希望自动化成本/质量/延迟权衡的产品团队——其思路类似 LLM 路由器(OpenRouter 等),但应用于生成媒体领域。

🔗 X 上的公告


HeyGen 将 HyperFrames 变成视频创作代理

7月23日——HeyGen 将 HyperFrames——此前因其每日创意系列而更多被大众熟知——从一个单纯的 HTML 渲染引擎提升为其核心产品:直接集成在 HeyGen 中的 Video Agent。其原理是:用户描述自己想要的内容,代理就会从头到尾构建完整视频——头像、图形、字幕和音乐,全部被描述为“无限可定制”。

这次发布伴随着一次病毒式增长活动(通过与帖子互动可获得一个月免费 HeyGen),在几小时内带来了超过 110 万次浏览、810 条回复和 788 次转发——远远超过此次扫描窗口内生成媒体赛道的所有帖子。

对开发者来说尤其值得注意的是:除了面向大众的产品外,HeyGen 还在 GitHub 上 开源了 HyperFrames 本身(仓库 heygen-com/hyperframes,描述为“写 HTML。生成视频。为代理而生。”),这使第三方代理甚至可以在 HeyGen 应用之外,直接从 HTML 生成视频。同一条帖子还宣布了一项新的大规模视频翻译 API(见简讯)。因此,对 HeyGen 来说,这一天同时是产品推进与开发者平台推进的双重动作。

🔗 主公告


Cognition 收购 Poke,这个住在你消息里的代理

7月23日——Cognition(Devin)宣布收购 The Interaction Company of California,后者是 Poke 的开发商。Poke 是一个直接住在用户消息里的个人对话代理。根据 Cognition 首席执行官兼联合创始人 Scott Wu 署名的博文,他本人和 Cognition 联合创始人 Walden 早期就是 Interaction 的天使投资人,而两支团队早已押注同一个技术方向:始终在线的云端代理。

Poke is a personal agent that lives in your texts. It messages you first, follows up with you, and feels less like software and more like a friend. People have exchanged more than 100 million messages with it in just the last three months, and it’s the only AI agent approved to text natively on Apple Messages.

🇨🇳 Poke 是一个住在你消息里的个人代理。它会先给你发消息,主动推进对话,感觉更像朋友,而不像软件。仅在过去三个月里,就有超过 1 亿条消息与它进行交流,而且它还是唯一被授权可在 Apple Messages 中原生发送消息的 AI 代理。Scott Wu 在 Cognition 博客上

对用户而言,短期内不会有任何变化——Poke 仍将按原方式运行——但 Cognition 表示希望引入自己的模型和基础设施,让它“更快、更可靠”。这次合并将 Cognition 的定位从其历史核心业务(自主软件工程师 Devin)扩展到了面向大众的个人代理,这是公司一个新的战略方向。

🔗 X 上的公告


Cognition 加入能源部的 Genesis Mission

7月22日 — Cognition 已与美国能源部(DOE)签署谅解备忘录(MOU),加入 Genesis Mission。该计划由总统令于 2025 年 11 月启动,被称为“美国的 AI 曼哈顿计划”。它动员美国的 17 个国家实验室、产业界和学术界,将全国最强大的超级计算机与最大的联邦科学数据集连接起来,目标是在十年内将美国科学研究生产率翻倍。由此,Cognition 加入了 Google DeepMind、OpenAI 和 Arcee AI;这些公司加入同一使命的消息已在前一天、即 7 月 22 日被报道。

承诺方向Devin(Cognition)的贡献
软件与数据安全发现并修复科学代码库中的漏洞
遗留代码现代化旧代码(Fortran、C++、COBOL)的文档、测试与翻译
研究能力扩展委派数据流水线、基础设施和部署任务
云现代化将遗留应用迁移到云原生平台

文章还指出,Cognition 平台正在进行 FedRAMP Class D(High) 认证,Devin Desktop 和 Devin CLI 已经获得该级别认证并符合 ITAR/IL4-IL6 要求,而 Devin 也已被美国陆军、美国海军以及 NASA 的喷气推进实验室使用。作为加入的一部分,Cognition 为各国家实验室提供代码安全扫描和补救报告作为实物支持,并为通过 Genesis Mission 项目征集入选的团队提供额外算力。

🔗 Cognition 博客公告


编码工具加速前进

本周,面向 AI 辅助开发的工具共有五项值得注意的更新,涉及定价、功能与事件自动化。

Cursor 将使用限额翻倍

7月21日 — Cursor 将所有个人版和 Teams 套餐中包含的使用限额翻倍(Enterprise 未提及)。该措施适用于 Grok(xAI)和 Composer(Cursor 自研模型),以及未来任何 Cursor 模型,除“翻倍”之外未宣布其他定价变化。该帖子在数小时内获得了大量互动——约 1,000 次转发和 10,000 个赞——显示社区反响非常积极。此公告与前一天发布的 Cursor Router 不同。

🔗 X 上的公告

Replit 将托管价格砍半以上

7月23日 — Replit 宣布对大规模发布应用的托管价格进行大幅下调——超过 50%——并于 2026 年 8 月 1 日起生效。任何已发布应用都运行在 Replit Cloud 上,包含基于使用量的自动扩缩、身份验证和安全数据库,以及内置分析和 SEO。新价格会在所有用户的下一次月度账单周期自动生效,无需用户采取任何操作。

🔗 X 上的公告

Zed 1.12:Git 面板与多选

7月22日 — Zed 发布稳定版 1.12:Git 面板现在提供独立的 “Staged” 与 “Unstaged” 区块,点击任一分组中的条目会打开对应的 multibuffer。File Finder 和 Text Finder 也支持多选(macOS 上 cmd-click,Linux/Windows 上 ctrl-click,或 tab),可一次打开多个文件。线程中最初提到的 CSV 过滤功能后来被 Zed 更正移除,因为该功能实际上尚未公开。

🔗 X 上的公告

v0:斜杠命令、Shopify 全面开放、Snowflake 可靠性提升

7月21日 — v0(Vercel)新增 斜杠命令:在 composer 中输入 / 会打开一个菜单,可通过 skills.sh 附加一个技能(skill),无需离开键盘。Shopify 集成可生成电商店面,实时读取商品、价格和库存,如今已向所有用户开放。对 Snowflake 的可靠性改进会检测自上次部署以来的代码变更,并将生成结果引导到已连接账户,而不是虚假数据。

🔗 v0 更新日志

Amp:orb 可响应外部事件

7月23日 — Amp 的 “orbs”(面向远程 agent 的云沙箱)现在可以通过新的 Webhook API (amp.createWebhook) 响应外部事件:GitHub CI 失败、Linear 新 issue、监控告警、Discord 消息。Amp 会验证提供方签名并对投递去重;外部事件仍被视为不可信数据,绝不会被解释为对 agent 的直接指令。文中举出的使用示例包括:在主分支上每次 CI 失败时进行调查并将结果发布到 Slack,或监控依赖项的新版本并自动打开更新 pull request。

🔗 Amp 公告


网络安全:Gemini 与 Hugging Face 为防御方赋能

这一区间内的两项独立公告都指向同一个需求:更好地为软件漏洞防御提供工具。

Gemini 3.5 Flash Cyber 可检测 72% 的漏洞

7月23日 — 在 7 月 21 日的成组发布(Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber)之后,Google DeepMind 发布了一篇专门线程,并附上 Gemini 3.5 Flash Cyber 的量化基准。这是一款专门用于发现和修复漏洞的轻量模型。

测试模型检测率
Gemini 3.5 Flash Cyber72 %
Gemini 3.5 Flash(标准版)55 %
Claude Opus 4.6(Anthropic)54 %

这项测试——名为“Chrome Production Commit Scanning Pipeline”——是在 ChromeAndroid 的真实代码库上进行的,模型发现了标准模型遗漏的复杂漏洞。当前可用性仍为受限访问试点,仅向政府和可信合作伙伴开放,Google 将其描述为“负责任部署”的一部分。

🔗 @GoogleDeepMind 线程

The Stack v3:网络安全防御的开源燃料

7月23日 — Hugging Face 研究负责人 Leandro von Werra 宣布推出 The Stack v3,这是该组织代码数据集 HuggingFaceCode(StarCoder 模型的来源)的新一代版本:可直接用于训练的 5,0000 亿 token,120 TB 原始数据,覆盖 700 多种编程语言,采用 ODC-BY 许可。其传播角度明确偏向防御——von Werra 将发布此数据集的理由归结为对“用于网络安全防御的优秀开放代码模型”的迫切需求,并呼应了 Sakana AI 前一天发布的 Fugu-Cyber。

🔗 X 上的公告


Together AI 与 NVIDIA 为推理和 fine-tuning 提供工具

Together AI 推出新一代推理平台

7月23日 — Together AI 宣布 Together Dedicated Model Inference,这是其面向 open-weight 模型的推理平台重构。功能包括:在稳定 endpoint 后支持多个部署、受保护的 rollout(canary、blue-green、带自动回滚的 rolling)、A/B 测试以及对真实流量的 “shadow traffic”;借助新的缓存层,启动速度约快 4 倍(边缘 MoE 模型如 Kimi K2.7、MiniMax M3 或 GLM 5.2 的部署时间为 7 到 14 分钟);以及封闭 beta 的定制 fine-tuning(RL full-weight、LoRA、SFT),并支持将 checkpoint 直接部署到生产环境。相关介绍网络研讨会定于 8 月 6 日举行。

🔗 X 上的公告

NVIDIA:不到 5 美元的 RL fine-tuning

7月23日 — NVIDIA 展示了一项在 Nemotron 3 Nano 上托管的强化学习 fine-tuning 演示,由 Prime Intellect Lab 完成:在一道数学题任务上,准确率从 22% 提升到 91%,成本低于 $5。完整流程——基线、训练至奖励收敛、再次验证测试——最后生成一个可下载的 LoRA 适配器,只需修改一行配置即可迁移到 Nemotron 3 Super 和 Ultra。

🔗 X 上的公告


Gemini Notebook 用 Collections 整理你的笔记本

7月20日 — Gemini Notebook(原 NotebookLM)推出 Collections,这是一个新标签页,用于像相册或播放列表那样组织笔记本,而不是按传统文件夹树结构:没有僵硬层级,同一个笔记本可以属于任意多个 collection,也可以不属于任何 collection。

这是一个已交付的功能——产品中已经可见的新标签页——而不是简单预告。虽然这条推文的日期早于本次严格扫描窗口一天,但它回应的是用户长期以来反复提出、至今仍未得到回答的需求。

🔗 置顶推文 @Gemini_Notebook


xAI 与 Qwen 扩展其产品线

Grok 4.5 已覆盖所有面向大众的入口

7月22日 — xAI 宣布 Grok 4.5 现已在其全部面向大众的入口中驱动 Grok:grok.com、X,以及 iOS 和 Android 应用。该模型也仍可通过 xAI 的 Microsoft 365 附加组件在 Word、Excel、PowerPoint 和 Outlook 中使用。它并不是全新模型:其旗舰发布已于 7 月 8 日报道,7 月 16 日又报道了其在欧洲的全面可用性——这次公告是部署过程的最后一环,标志着其正式切换到移动端和面向大众的网站。

🔗 官方公告

Grok 登陆 Microsoft Outlook

7月21日 — xAI 通过 Grok for Outlook 将 Grok 集成进一步扩展到 Microsoft 365:这是一个可总结长邮件线程、按用户风格撰写回复、归档已完成对话并标记待回复内容的 agent——在得到明确确认前不会发送任何内容。该模块今天起可通过 Microsoft Marketplace 向 X 和 SuperGrok 的付费订阅用户开放,并加入已提供给 Word、Excel 和 PowerPoint 的模块行列。

🔗 官方公告

Qwen Cloud 推出 Token Plan Individual

7月21日 — Qwen Cloud 推出 Token Plan Individual,这是一项每月从 $6 起的订阅服务,提供面向 Qwen 系列以及 GLM 和 DeepSeek 的统一 credit 池,并可提前使用 Qwen3.8-Max-Preview(该模型已于 7 月 19 日报道)。宣传信息图详细列出了三个价格档位(Lite / Standard / Pro)、低峰时段折扣,以及最多可同时供 8 个 agent 使用的 token 池。

🔗 X 上的公告


Anthropic 向 AI 的经济未来投资 2 亿美元

7月22日 — Anthropic 公布其 Economic Futures Research Fund 的研究议程,该基金拥有 2 亿美元,用于资助围绕如何通过干预帮助社会为 AI 的经济影响做好准备的外部前沿研究。五个优先方向分别是:对劳动者的影响、职业转型支持、收入保障机制现代化、与 AI 相关增长的共享机制(预分配资本账户),以及公共投资的新数据。

Anthropic 计划主要资助 500 万到 3,000 万美元之间的项目,面向大学、独立研究机构和非营利组织开放——不面向个人研究者。该基金推动了更早启动的 “Economic Futures” 计划转型,将重点收缩到更少数量但更具雄心的资助项目,而不是许多小额资助。

🔗 官方公告


简讯

  • Anthropic 将对 Public First Action 的支持翻倍(额外 2,000 万美元) — 对这一非党派公众 AI 教育组织的总支持提高到 4,000 万美元;这些捐款仅用于教育和公共政策使命,不可用于任何选举支持。 🔗 来源
  • Claude Code:基于 skills 构建验证循环的指南 — 如何把手动检查转化为 Claude Code skills,让 Claude 自己完成自我验证闭环。 🔗 来源
  • Outtake 案例研究:基于 Claude 构建的网络安全调查 agent — Outtake 如何运行数小时会话来绘制攻击网络图谱。 🔗 来源
  • Cognition — DeepWiki 索引仓库突破 500,000 个 — 一个免费的 AI 生成代码文档工具;并宣布将于 7 月 28 日在旧金山与 LangChain 举办 meetup。 🔗 来源
  • Replit 强调 Firecrawl 集成 — 为应用提供一键式网页上下文,早期用户可获得 10,000 点 credit。 🔗 来源
  • Hugging Face 在 Diffusers 中原生集成 Nunchaku(SVDQuant) — 4-bit 量化 checkpoint(权重与激活)现在可通过 from_pretrained() 加载,无需单独的推理库。 🔗 来源
  • Together AI 将在 7 月 27 日发布时托管 Kimi K3(Moonshot AI) — “day zero” 即可推理,benchmark 将在正式发布后公布。 🔗 来源
  • Gemini CLI v0.52.0 — 分诊与 egress 服务,绕过 write_file/replace 中 JSON/IPYNB 的 LLM 修正,google-auth-library 更新至 10.9.0 版本。 🔗 来源
  • GitHub — Projects 和 Issues 支持多选字段 — 一个自定义字段现在可以同时包含多个值(团队、模块、类别)。 🔗 来源
  • HeyGen — 面向大规模的视频翻译 API — 在不到 24 小时内将整条视频链路复制为 10 个本地化版本,并支持批处理。 🔗 来源
  • Codex Sites Analytics 进入公测 — 为使用 Codex 发布的网站提供基础性能指标。 🔗 来源
  • OpenAI 启动“面向小企业的 ChatGPT”计划 — ChatGPT Work 网络研讨会、美国 AI academies,以及与 Dropbox、Shopify、Intuit、Slack、Atlassian 和 Wix 的合作。 🔗 来源
  • David Vélez(Nubank)与 Robin Vince(BNY)加入 OpenAI 董事会 — OpenAI Foundation 和 OpenAI Group PBC 迎来这两位高管。 🔗 来源
  • Cohere 宣布与 HUMAIN 合作推进阿拉伯语 AI — 这是 Cohere Transcribe Arabic 取得成功后的延续,但目前尚未公布具体产品或日期。 🔗 来源

这意味着什么

语音正作为完整的控制界面落地,而且是在同一天、两家不同的厂商那里。ChatGPT Voice 登陆桌面端,可在无需键盘的情况下操控 Chat、Work 和 Codex,由 GPT-Live 驱动;另一方面,Claude 则让其语音模式在最强模型上运行,并在对话过程中开放对联网工具的访问。两项公告彼此独立,但发布日期的重合很可能并非巧合:它反映出同一个判断——口语对话正在成为完整的工作通道,能够通过代理或联网工具触发真实操作,而不再只是一个只能回答问题的助手玩具。

对代理进行约束正成为一个独立议题,不再只是让它们跑起来那么简单。GitHub 为其代理在 Issues 中自动应用的更改引入了审批、置信度分数和理由说明,同时它自己也明确表示,这“不是安全控制”,只是工作流上的便利。另一方面,Runway 为并行竞争的生成式模型增加了一层自动仲裁(成本、质量、延迟)。共同点在于:随着代理获得更高自治性,厂商添加的是治理与控制层,而不是单纯叠加能力——这一趋势也能在 Codex 的多仓库项目中看到,其设计目的在于让代理在更大的范围内工作,同时不丢失“真源根目录”这一概念,也就是主要的 Git 仓库目录。

网络防御正成为大型 AI 厂商之间明确的竞争轴。Gemini 3.5 Flash Cyber 宣称在 Chrome 和 Android 的真实代码库上,漏洞检测率达到 72%,而其标准模型仅为 55%,被 Google 点名提及的 Claude Opus 4.6 则为 54%——这种直接对比相当少见,因此值得注意。同一天,Hugging Face 发布 The Stack v3,这是一个包含 5,0000 亿 tokens 的代码数据集,并明确将发布理由归结为需要“用于网络防御的优质开源代码模型”。这两项独立公告勾勒出一种共同担忧:软件漏洞会被大规模利用;而回应方式也呈镜像式展开:一边是专门化的封闭模型,另一边是用于训练其他模型的开放数据。

Cognition 在一周之内从两个方向同时扩展了自己的战场。收购 Poke——一个生活在用户消息里的个人代理,三个月内已交换超过 1 亿条消息——把公司的重心从其自主软件工程师 Devin 延伸到面向大众的代理。与此同时,它与美国能源部就 Genesis Mission 达成的谅解备忘录,使其与 Google DeepMind、OpenAI 和 Arcee AI 一起参与这项自 7 月 22 日以来就已启动的计划——在美国公共科学研究领域展开一场如今已有四方参与的竞赛。两个动作,同一种逻辑:同时巩固大众市场与机构基础设施中的位置,而不是只停留在单一细分领域。


来源