ai-powered-markdown-translator使用 gpt-5.4-mini 将文章从法语翻译成中文。
7 月 15 日当天的主线是智能体面对攻击时的鲁棒性:OpenAI 公开 GPT-Red,这是一款自动化红队工具,用于强化 GPT-5.6 抵御提示注入;与此同时,Claude Code 加固了其 CLI,而 Warp 的代码审查智能体则刻意选择只读访问。当天其余内容还包括一波围绕编码智能体的公告(Chrome 中的 Codex、开源的 Grok Build、Slack 中的 Devin、GitHub Copilot)、开放模型(Meta AI、Hugging Face、Ai2、Together AI)以及 Google、媒体生成、Perplexity 和 Cohere 方面的多项新进展。
GPT-Red:OpenAI 强化 GPT-5.6 对提示注入的鲁棒性
7 月 15 日 — OpenAI 推出 GPT-Red,这是一款在内部训练的自动化 red teaming 模型,用于增强其模型对提示注入(prompt injection)的抵抗力——这类攻击会把恶意指令藏在文档、网页或工具输出中,从而诱导智能体偏离原始任务。OpenAI 不再仅依赖人工团队来构想攻击,而是把这一探索交给专门模型,使其能够持续、大规模地执行。
该模型通过自博弈(self-play)结合强化学习进行训练:当攻击者成功诱发不良行为时会获得奖励,而防御模型群体则学习在不影响原始任务的前提下抵御攻击。这种零和博弈产生了一个攻击者,它能够击败几乎所有被测试的模型,包括内部模型和公开模型,直到 GPT-5.6。
在 GPT-5.6 的训练中引入 GPT-Red 后,与四个月前最好的生产模型相比,该模型在面对最困难的直接注入时的失败率降低了 6 倍。在一个学术基准场景(Dziemian 等,2025)中,它的成功率达到 84%,而在相同案例上,人类 red teamer 的成功率只有 13%。
OpenAI 通过两个真实案例展示了其实际价值。在一个管理公司内部自动售货机的智能体上(由 Andon Labs 开发,延续了“Project Vend”项目思路),GPT-Red 成功把一件高价商品的价格压到 0.50 美元,诱导下单购买了一件 100 多美元的商品却按同样的低价转售,并取消了另一位客户的订单。在一个面对十种数据外泄场景的 Codex CLI 智能体上,它比使用简单提示词的基线方案更高效,也更节省 token。该模型仍然严格内部使用——从未公开部署——以避免其进攻能力落入恶意之手。详细说明该方法的预印本预计将在一周内发布。
| 测量指标 | 测量值 |
|---|---|
| GPT-Red 相比人类 red teamer 的成功率(学术场景) | 84% 对 13% |
| 面对直接注入时失败率的降低幅度(GPT-5.6 对比前一模型) | 失败次数减少 6 倍 |
| GPT-5.6 面对 GPT-Red 直接注入时的残余失败率 | 0.05% |
“Introducing GPT-Red. An internal automated red teamer on a mission to find our models’ prompt injection vulnerabilities at scale, helping us build stronger defenses before wider deployment.”
🇨🇳 GPT-Red 介绍。一个内部自动化 red teamer,其使命是在大规模范围内发现我们模型对提示注入的漏洞,以帮助我们在更大范围部署之前构建更强大的防御。 — @OpenAI 在 X 上
🔗 官方公告
Claude Code:连接到 MCP 的工件与 CLI v2.1.207 到 v2.1.210
工件现在可以调用 MCP 连接器
7 月 15 日 — Claude Code 的工件(Artifacts)现在可以调用 MCP(Model Context Protocol)连接器,用于构建仪表盘和应用,让每位访问者按需获取信息并执行操作。一个工件只需构建一次,随后在每次查看时都能实时取数,使用的是当前访问者自己的 MCP 连接器——而不是创建者的。这种按访问者而非按创建者的权限模型解决了企业场景中一个显而易见的安全问题:每个人只能看到自己有权访问的数据。
该功能适用于 Pro、Max、Team 和 Enterprise 套餐,但不适用于公开共享的工件——这很合理,因为数据访问取决于每位访问者各自的连接器。
🔗 X 上的公告
CLI v2.1.207 到 v2.1.210:屏幕阅读器、精简转录与更强安全性
7 月 15 日 — 自上次报道以来,Anthropic 已发布四个版本的 Claude Code CLI。最重要的是 v2.1.208:它增加了屏幕阅读器模式(--ax-screen-reader),修复了长会话中可能高达 64 MB 的内存泄漏,并将会话转录大小在高编辑活动会话中最多缩减到原来的 79 倍。它还加强了安全性:包含反引号的灾难性删除命令现在会触发确认,即使处于自动模式并启用了 --dangerously-skip-permissions 也一样。
v2.1.207 将自动模式扩展到 Bedrock、Vertex AI 和 Foundry,无需 opt-in,并将这些平台默认切换到 Claude Opus 4.8。v2.1.210 为长时间工具调用增加了实时计时器,并强化了 Agent 工具,以抵御通过子智能体读取内容引发的间接提示注入。
编码智能体:Codex、Grok Build、Warp、Devin 与 GitHub Copilot
Chrome 中的 Codex 展示了自动化上线计划
7 月 15 日 — OpenAI Developers 分享了一段演示:在 Chrome 中使用 Codex 将一个简单请求转化为上线计划。从一个表单开始,智能体构建清单,从 Google Drive、Slack 和本地文件中获取上下文,标记需要人工跟进的点,更新相关门户,然后撰写回复——而最终决定始终由用户在每一步掌握。该演示强调了由 Codex 驱动的网页导航,这一功能在产品 changelog 中已以“Browser use”之名进行文档说明。
🔗 X 上的演示
xAI 开源 Grok Build 源代码
7 月 15 日 — xAI 已将 Grok Build 源代码开源,这是其在 5 月底以早期 beta 形式发布的命令行编码智能体。此次发布涵盖四个组件:智能体循环、工具(读取、修改、代码搜索、命令执行)、终端界面以及扩展系统(skills、plugins、hooks、MCP 服务器、subagents)。对开发者而言,一个值得注意的点是:Grok Build 现在可以完全本地运行(local-first),连接到自身推理并通过一个 config.toml 文件进行驱动。
此外,自 7 月 12 日起,xAI 已为所有用户关闭默认数据保留,并删除此前保存的代码数据:
“In response to user questions about privacy: Since launch, Grok Build has fully respected zero data retention (ZDR). All users have always had the ability to disable data upload in the CLI. […] We disabled default retention for all Grok Build users starting on July 12th. Additionally, we are deleting all coding data that was previously retained, ensuring every user’s preferences are respected.”
🇨🇳 针对用户关于隐私的问题:自从发布以来,Grok Build 一直遵守零数据保留(ZDR)。所有用户始终都可以在 CLI 中关闭数据上传。[…] 我们已从 7 月 12 日起为所有 Grok Build 用户关闭默认数据保留。此外,我们正在删除所有此前保留的代码数据,以确保尊重每位用户的偏好。 — @SpaceXAI 在 X 上
🔗 官方公告
Warp 构建自我改进的代码审查智能体
7 月 15 日 — Warp 的 CEO Zach Lloyd 发布了他关于“cloud software factory”系列的第三篇文章:一个能够自动改进的代码审查智能体,延续了此前关于工单分流智能体和规格编写智能体的文章。其架构依赖一个审查技能,该技能会分析 pull request、diff 和规格说明,一个将输出转化为评论的 GitHub action,以及一个每天观察一次人工反馈、并自行提出审查技能更新的第二个“外循环”智能体。一个值得注意的设计选择是:该智能体仅拥有对 pull request 的只读访问权限,评论的发布则由 GitHub action 的代码负责——以降低提示注入风险。
Devin 进入 Slack
7 月 15 日 — Cognition 与 Slack 合作,将 Devin 直接集成到 Slack 中,让团队无需离开讨论频道即可调查问题、询问有关代码库的事项,并启动开发任务。这个集成加入了 Devin 现有的使用入口(CLI、通过 Windsurf 的 IDE、GitHub),也契合了这样一个观察:许多工程需求在成为正式工单之前,很早就已经在 Slack 消息中启动。
🔗 X 上的公告
GitHub Copilot:Visual Studio 更新与 JetBrains 的 BYOK 扩展
7 月 14 日 — GitHub 发布了 Copilot 在 Visual Studio 中的 6 月回顾:使用窗口配合超量前的主动提醒、MCP 服务器的信任验证(启动时与已知基准进行比较,默认启用),以及 C++ 现代化智能体进入正式可用。其他改进包括:更远距离的编辑建议、将 pull request 作为上下文加入 Copilot Chat,以及在 IDE 内直接审查 pull request——这些功能从 Free 到 Enterprise 均可使用。
在 JetBrains 方面,Copilot 将其 BYOK(Bring Your Own Key)支持扩展到兼容 OpenAI 的自定义终端,增加了一个 Claude 智能体提供方用于配置智能体和技能(公开预览,Pro 及以上),并为 Copilot CLI 引入了本地沙箱以及内置调试技能。
🔗 Visual Studio 更新 · 🔗 JetBrains BYOK 扩展
开放模型:Meta AI、Hugging Face、Ai2 与 Together AI
Meta AI 在亚洲物理奥林匹克中拿到满分
7 月 14 日 — Meta AI 在竞赛委员会授权下,向 2026 年亚洲物理奥林匹克(APhO 2026)的理论题进行了模型测试。结果是:满分 30/30,与三位最佳人类选手持平。Meta AI 并未说明这是否是 Muse Spark 1.1(其最近一次重大发布,7 月 9 日)或其他未公开的内部模型。
🔗 X 上的公告
Hugging Face 预告了一款新的开放权重模型
7 月 15 日 — Hugging Face 在当天晚些时候发起了一场直播,标题直白地写着(英文)“new open weights model”,但并未以书面形式透露模型名称——无论是在推文里、broadcast 标题中,还是在官方博客上都没有。该推文下的多个回复明确询问这是什么模型,以及它与标准基准相比如何,但截至撰写时仍未给出书面回复。等消息正式以文字形式公布后再来回看。
🔗 X 上的直播
Ai2 在 1,700 名用户后关闭 SciArena
7 月 15 日 — Ai2 关闭了 SciArena,这是一项开放评估平台,用于测试模型回答科学文献问题的能力,评分由研究人员而不是自动模型完成。收官数据:约 1,700 名用户,收集到近 3,900 张投票。完整方法和结果已在提交至 arXiv 的论文中详细说明。
🔗 X 上的总结
Together AI 从第 0 天起支持 Inkling,并推出 TogetherLink
7 月 15 日 — Together AI 在发布当天就提供了 Inkling,也就是 Thinking Machines Lab 的新模型:一个总参数量 9750 亿、每个 token 激活 400 亿参数的多模态 MoE(混合专家)模型,拥有 100 万 token 的上下文窗口,能够处理文本、图像和音频。Together AI 为这一架构优化了其 FlashAttention-4 内核,该架构结合了条件于查询的相对注意力和短因果卷积。
同一天,Together AI 还发布了 TogetherLink,这是一个开源 CLI,用于在最常用的开发环境中运行任意开放模型——演示中展示了 GLM 5.2 直接在 Codex 和 Claude Code 中运行。
| 测量指标 | 测量值 |
|---|---|
| 总参数量(Inkling) | 9750 亿 |
| 每个 token 激活参数 | 400 亿 |
| 上下文窗口 | 100 万 token |
🔗 Inkling day-0 支持 · 🔗 X 上的 TogetherLink
Google DeepMind 与 Gemini Spark
DeepMind 关注 AI 智能体的科研验证瓶颈
7 月 15 日 — Google DeepMind 发布了《Conjecture Machines》,这是一篇关于 AI 智能体如何改变科学研究的公共政策文章。开篇案例很有分量:微生物学家 José Penadés(伦敦帝国学院)向 Co-Scientist 提交了一个其团队近十年来一直在研究的问题;该智能体在两天内返回了五个按优先级排序的假设,而第一条正是其团队花了多年才证明的那个。
文章区分了两种范式:构思阶段,智能体进展很快(通过 Co-Scientist 或 AlphaEvolve);而验证阶段仍然缓慢且成本高昂——数学和计算机科学除外,因为在这些领域验证可以是形式化的(2 月“First Proof challenge”中的 10 道题里,工具 Aletheia 解出了 6 道)。文章向决策者提出四项优先事项:广泛访问智能体、利用国家数据、投资验证基础设施,以及推动同行评审演进。
🔗 X 上的串文 · 🔗 DeepMind 完整文章
Gemini Spark 扩大地理覆盖范围并获得四项改进
7月15日 — Google 正在把 Gemini Spark 的部署范围扩展到更多国家和语言,面向 Google AI Ultra 订阅用户。这个在后台为用户工作的个人代理从当天起开始推出四项改进:
| 带来的改进 | 说明 |
|---|---|
| Google Docs 编辑 | Spark 可以直接打开并修改文档 |
| 更深入的 Workspace 集成 | 可读取 Google Sheets 和 Slides 中的评论 |
| 速度 | 长任务执行得更快 |
| 改进的多来源检索 | 在复杂任务上并行获取和审查多个来源 |
🔗 X 上的完整帖子
媒体生成:Suno 和 Synthesia
Suno 加入 iMessage 键盘
7月15日 — Suno 推出了一款面向 iMessage 的键盘扩展,允许直接在 iOS 的 Messages 应用中生成并发送音乐片段,无需切换应用。需要将 Suno App 更新到最新版本才能使用。
🔗 X 上的公告
Synthesia 推出 Dubbing 2.0
7月15日 — Synthesia 发布 Dubbing 2.0,这是其基于全新基础设施的 AI 视频配音系统重构版:即使在复杂场景中,口型同步也明显改进,声音更具表现力,译文更好地贴合源视频节奏,并且无需重新完整渲染即可即时编辑转录内容。每位用户都可获得最多 450 分钟免费额度来测试该功能。
🔗 完整公告
Perplexity 与 Cohere:基础设施和社区研究
Perplexity 公布 SPACE,Perplexity Computer 的沙盒平台
7月15日 — Perplexity 发布 SPACE,这是支撑 Perplexity Computer 的安全执行层:为代码、文件和长时间运行的代理会话提供隔离环境,每个环境都实现为带有自身来宾内核的虚拟机。凭据绝不会进入沙盒;中央网络网关会强制执行出站策略。借助 btrfs(写时复制)文件系统,SPACE 自 6 月以来已承载 Perplexity Computer 100% 的生产流量,Perplexity 计划将其扩展到 Linux microVM、Windows 来宾以及用户本地机器。
| 测量指标 | SPACE 之前 | 使用 SPACE |
|---|---|---|
| 创建沙盒的中位延迟 | 185 ms | 60 ms (3,1x) |
| 创建的 P90 延迟 | 447 ms | 89 ms (5,0x) |
🔗 X 上的公告
Cohere 发布 Expedition Tiny Aya 的成果
7月15日 — Cohere Labs 公布了 Expedition Tiny Aya 的成果,这是一项带导师指导的研究计划,围绕 Tiny Aya 展开;它是一个开放、轻量但性能出色的模型,支持 70 多种语言,并且可以在本地运行,包括在手机上。社区项目涵盖教育(面向儿童的离线语音伙伴,并配有新的安全基准)、多语言安全(在一种语言中学到的不对齐会迁移到另一种语言)以及本地部署(语言感知压缩、4 位量化助手)。这些研究已被 COLM 2026 会议接收。
“Tiny Aya is Cohere Labs’ answer to a familiar problem: most AI is built for a handful of languages and needs serious hardware to run. Tiny Aya is open-weight, strong across 70+ languages, and light enough to run locally, even on a phone.”
🇨🇳 Tiny Aya 是 Cohere Labs 对一个熟悉问题的回应:大多数 AI 只为少数几种语言而设计,并且需要强大的硬件。Tiny Aya 是开放的,在 70 多种语言上表现出色,而且足够轻量,甚至可以在手机上本地运行。 — Cohere 博客
🔗 X 上的完整帖子
快讯
- Together AI 提升其 GPU Clusters 的可靠性 — 被动健康检查、节点引导式修复、重构的 Slurm 栈,以及面向生产 GPU 集群的外部 OIDC 支持。🔗 来源
- HeyGen 详解用“六个决策”来提示 HyperFrames 的方法 — 其每日视频生成 CLI 代理系列的第十集。🔗 来源
- Kling AI 发布其互动系列《Choose a door》的新一集 — 社区通过评论投票来引导恐怖短片《You Can Never Leave》的后续发展。🔗 来源
- Pika MCP 退出实验状态 — Pika 与第三方代理(Claude、Codex、OpenClaw、HermesAgent)的连接现已公开可用。🔗 来源
- OpenAI Developers 发布 kbd-1.0-codex-micro — 一款带摇杆的 macropad,与 @work_louder 合作设计,用于操控其 Codex 快捷方式,限量发售。🔗 来源
- Cohere 发布企业 AI 总拥有成本分析 — 根据 Gartner、IDC 和 McKinsey 的数据,部署生成式或代理式 AI 的 92% 到 96% 组织都面临高于预期的支出。🔗 来源
这意味着什么
代理的安全性正逐渐成为一个独立的工程课题,而不再只是事后补救。GPT-Red 通过自对弈自动化红队测试,并将其落到自动售货机和 Codex CLI 代理等真实案例上;Claude Code v2.1.208 CLI 加强了自身的破坏性命令和 Agent 工具,以抵御间接注入;Warp 的代码审查代理则明确选择只读访问,以限制同一类攻击。三项彼此独立的举措指向同一个方向:当代理越来越多地独立操作真实系统时,针对 prompt 注入的防御也必须变成持续、自动化的纪律,而不是一次性的检查清单。
编码代理生态系继续在各个方向同时加速扩张。xAI 开源 Grok Build 并允许完全本地使用,Devin 进入 Slack 以便在需求变成工单之前就捕捉到它们,Codex 被部署到 Chrome 中以端到端地驱动任务,而 GitHub Copilot 则同步扩展其 BYOK 方案和现代化代理。这些策略的多样性——代码开放、集成到沟通工具、自动网页浏览、模型供应商灵活性——表明竞争正在围绕开发者日常工作流的不同入口展开,而不是趋向单一的主导模型。
开放模型及其基础设施同步推进。Together AI 一方面在 Inkling 首发当天提供支持,另一方面同步发布 TogetherLink,让任意开放模型都能在 IDE 中运行,这体现了这场运动的两面;与此同时,Ai2 在收集了近 3,900 票研究者对 AI 生成科学回答可靠性的反馈后,关闭了 SciArena。作为背景,Google DeepMind 关于科学验证瓶颈的论文,以及 Perplexity 的 SPACE 沙盒平台,从两个不同角度提出了同一个问题:如何在大规模且安全的条件下验证越来越自主的代理所产出的结果。
在更面向大众的使用场景中,生成式 AI 继续渗透进越来越日常的入口——Suno 的 iMessage 键盘、Gemini Spark 的 Workspace 文档编辑、Synthesia 的视频配音。与此同时,企业侧也伴随着更为严峻的提醒:Cohere 对 AI 总拥有成本的分析指出,92% 到 96% 的组织实际支出高于预期,这提醒我们,代理的大规模普及并不意味着可以忽视底层基础设施的经济管理。
来源
- OpenAI — GPT-Red
- @OpenAI 在 X 上 — GPT-Red
- @ClaudeDevs 在 X 上 — MCP 工件
- Claude Code 更新日志
- @OpenAIDevs 在 X 上 — Chrome 中的 Codex
- xAI — Grok Build 开源
- @SpaceXAI 在 X 上 — Grok Build 隐私
- Warp — 自我改进的代码审查代理
- @cognition 在 X 上 — Devin 进入 Slack
- Visual Studio 中的 GitHub Copilot — 6 月更新
- GitHub Copilot for JetBrains — BYOK 扩展
- @AIatMeta 在 X 上 — 物理奥林匹克
- @huggingface 在 X 上 — 新模型直播
- @allen_ai 在 X 上 — SciArena 总结
- Together AI — Inkling day-0 支持
- @nutlope 在 X 上 — TogetherLink
- @GoogleDeepMind 在 X 上 — Conjecture Machines
- Google DeepMind — Conjecture Machines(完整论文)
- @GeminiApp 在 X 上 — Gemini Spark
- @suno 在 X 上 — iMessage 键盘
- Synthesia — Dubbing 2.0
- @perplexity_ai 在 X 上 — SPACE
- @cohere 在 X 上 — Expedition Tiny Aya
- Cohere 博客 — Tiny Aya in the wild
- Together AI — GPU Clusters 可靠性
- @HeyGen 在 X 上 — HyperFrames 第 10 天
- @Kling_ai 在 X 上 — Choose a door
- @pika_labs 在 X 上 — Pika MCP
- @OpenAIDevs 在 X 上 — kbd-1.0-codex-micro
- Cohere 博客 — AI 总拥有成本