ai-powered-markdown-translator使用 gpt-5.4-mini 从法语翻译成中文的文章。
2026年8月7日,Claude Code 从8月14日起在 Pro、Max 和 Team 套餐中将 Auto Mode 切换为默认权限模式,依据是一项内部研究:在被阻止的危险命令中,系统拦截了89%,而人工审查仅拦截了14%。同一天,OpenAI 首次将其一款未来模型 Astra 依据 Preparedness Framework 在网络安全方面评定为关键级;与此同时,NVIDIA 发布了 Cosmos 3,这是一个面向机器人与自动驾驶车辆的全新开放模型家族,已被 Doosan、LG、Samsung 和 Li Auto 采用。与此同时还包括 Claude Code 的跨会话消息、Claude Fable 5 生物防护的放宽、Seedance 2.5 在 Runway 和 Luma 上的正式可用,以及 GitHub Copilot、Gemini 和 agentic code 工具方面的十多项其他公告。
Claude Code:Auto Mode 将于8月14日成为默认权限模式
8月7日 — Anthropic 宣布,自 8月14日 起,Auto Mode 将成为 Claude Code 中 Pro、Max 和 Team 套餐用户的默认权限模式。它不再要求在每条 shell 命令或敏感操作前进行确认,而是依赖一个独立的分类器来分析每次工具调用,并自动阻止被判定为危险的命令,而无需在每一步都打断用户。
Anthropic 以一项内部研究为依据解释这一变化。该研究面向 1,053 名付费测试者,向他们展示了一个针对明确危险命令的权限请求提示(仅为文本,实际上并未执行任何操作)。人工测试者仅在 13.6% 的情况下识别出风险,而且在连续 50 次提示后,由于疲劳影响,这一比例降至约 5%。而 Auto Mode 则在 89% 的情况下阻止了同样的命令,而且无论会话持续多久,这一比例都保持稳定。
| 测量指标 | 人工批准 | Auto Mode |
|---|---|---|
| 初始识别率 | 13,6% | 89% |
| 50 次提示后识别率 | ~5% | 89%(稳定) |
另一个实际变化是:分类器带来的 token 额外开销如今不再计入 Pro、Max 和 Team 套餐的使用额度;一旦 Auto Mode 在全局范围内推广,计划也会扩展到 Enterprise 套餐和 API。应用内通知会提醒用户这一切换,管理员还可以通过管理设置固定 defaultMode 或禁用 Auto Mode。
The team and I use Auto mode exclusively, and have been for many months. I couldn’t imagine going back to permission prompts! Really excited to get this out to everyone.
🇨🇳 我们团队几个月来一直只使用 Auto Mode。我简直无法想象再回到权限提示!非常高兴能把它推广给所有人。 — @bcherny 在 X 上
OpenAI 将 Astra 列为网络安全关键级
8月7日 — OpenAI 宣布,其未来模型 Astra 是首个在网络安全方面被评定为 关键级(Critical)的模型,依据是其 Preparedness Framework,该框架于 2023年12月首次发布。此前的模型,包括 GPT-5.6 Sol,在这一维度上仅被评定为高等级(High)。
根据该框架,如果一个模型能够在没有人工干预的情况下,识别并开发针对多个加固关键系统的可用 zero-day 漏洞利用,或仅凭一个高层目标就端到端设计出全新的网络攻击策略,那么它就达到了网络安全关键级。最近几天对 Astra 进行的内部评估,结合外部专家审查,使 OpenAI 得出结论:它不能排除这种能力水平——因此,这份透明度说明在完整测试活动尚未结束前就已发布。公司还表示,Astra 并未卷入近期 Hugging Face 的安全事件。
因此,OpenAI 正在加强内部控制:隔离测试环境、限制网络和工具访问、强化模型权重加密、增强监控以及在沙箱中执行。涉及 Astra 且尚未满足这些要求的内部活动已被暂停;此外,监控器现在会分析该模型在所有 agentic 应用中的推理链,一旦出现高风险行为,就会触发安全响应。
After evaluating one of our upcoming models, Astra, we’re treating it as our first “critical” model for cybersecurity under our Preparedness Framework. This is a scenario we’ve planned for, and we’re putting additional controls in place to ensure Astra’s further development happens safely and securely.
🇨🇳 在评估了我们未来的一款模型 Astra 之后,我们将其视为我们在网络安全方面的首个“关键级”模型,依据是我们的 Preparedness Framework。这是我们预料到的情形,我们正在加上额外控制,以确保 Astra 后续开发能够安全稳妥地进行。 — @OpenAI 在 X 上
NVIDIA 发布 Cosmos 3:面向物理 AI 的开放模型家族
8月6日 — NVIDIA 发布了 Cosmos 3,这是一个面向物理 AI 的全新开放模型家族——涵盖机器人、自动驾驶车辆、车载视觉——并作为 Into the Omniverse 系列的一部分推出。该系列提供三种规模:Cosmos 3 Super 用于高保真建模,Cosmos 3 Nano 用于高效推理,Cosmos 3 Edge 用于车载部署。
| Cosmos 3 变体 | 参数 | 目标用途 |
|---|---|---|
| Cosmos 3 Super | 640亿 | 高保真建模 |
| Cosmos 3 Nano | 160亿 | 高效推理 |
| Cosmos 3 Edge | 40亿 | 车载部署 |
该系列在多个榜单上宣称位列第一:Artificial Analysis(开放权重下的文生图与图生视频)、PAI-Bench(世界生成)以及 RoboLab(机器人策略)。多家工业企业已宣布采用——机器人方向包括 Doosan Robotics、LG Electronics、Samsung Electronics 和 Skild AI;自动驾驶车辆方向包括 Li Auto、Xiaomi 和 Afari——同时 NVIDIA Cosmos Coalition 的活动也已扩展至日本。这些模型以 OpenMDW 1.1 开放许可在 Hugging Face 和 GitHub 上提供。
Claude Code 与 Claude Fable 5:Anthropic 侧的两个新功能
Claude Code 的各个会话现在可以互相通信
8月7日 — Claude Code 引入跨会话消息:无需在另一个会话中重新解释某项任务的上下文,现在可以直接让 Claude 代为传递信息。发送的消息是一个摘要——不是完整历史,也不是原始会话的文件——目标会话会在任务进行中接收它,而无需从零开始。该功能双向可用:一个会话可以向另一个会话发起询问,并在自己的对话中收到回复;或者当某项修改影响到并行任务时,Claude 也可以自主发起这条消息——这对于协调同一重构中的两个代理很有用。现已在 macOS 和 Linux 上提供。
Claude Fable 5 放宽生物领域防护,误报减少85%
8月7日 — Anthropic 更新了 Claude Fable 5 的生物防护,以减少误报。根据内部测试,这次更新使在生物相关主题上被错误触发的回退(fallback)情况减少了约 85%,适用于所有产品表面——如今 Fable 可以在不必要拦截的情况下处理更广泛的常见健康与教育问题。该防护仍然会在双重用途场景中保持 सक्रिय——病毒学、毒理学、分子设计——这些内容会继续切换到 Opus 5:因此,Fable 5 仍不能用于专业生物研究或药物开发。Anthropic 表示,正在通过专门的可信访问路径来弥补这一差距。
代码工具:Amp 定价、Replit SSO 与 Codex 安全审查
Amp 重构了定价和 orb 尺寸
8月7日 — Amp 新增了一种新的 a1.medium 规格 orb(4 CPU、8 GB 内存),比旧的 a0.medium 便宜 50%,也更适合大多数项目。自动暂停的无操作等待时间从 15 分钟缩短到 5 分钟,从而降低后台遗忘 orb 的费用。现在还可以通过 amp -ox 命令及其 --orb-size 标志按对话线程选择 orb 尺寸。
| orb 尺寸 | CPU | 内存 | 每小时价格 |
|---|---|---|---|
| a1.tiny | 1 | 2 GB | 0,08 $ |
| a1.medium | 4 | 8 GB | 0,33 $ |
| a1.xxlarge | 16 | 32 GB | 1,32 $ |
Replit 添加 Okta 和 Entra ID SSO,免费到10月
8月6日 — Replit 在与 Clerk 合作的基础上,将企业单点登录(SSO)集成到其生成的应用中。Pro 套餐客户可以让代理直接在其应用中配置 Okta 或 Entra ID(OIDC 或 SAML),无需手动配置身份提供方。该选项在 2026年10月1日 之前免费提供,不收取额外费用。多因素认证、会话时长和验证频率也可以通过代理在专用的身份验证控制中心进行配置。
Codex Security Review:用于拉取请求安全分析的研究预览
8月6日 — OpenAI 以研究预览形式推出 Codex Security Review,面向 ChatGPT Enterprise、Business、Edu 和 Pro 工作区开放(Plus 不可用)。在引入期内,审查不会消耗 ChatGPT 点数,但需遵守使用限制。该工具在安全问题上比现有的 Code Review 更进一步:它会分析拉取请求的 diff、仓库上下文以及威胁模型;如果未提供文件,则威胁模型会自动重新生成。默认情况下,自动审查会报告“高”和“关键”严重性的问题,人工审查则会额外加入“中等”严重性——这些阈值可按文件路径调整。可随时通过评论 @codex security review 触发人工审查。
研究与基准:面向 AI 导师的评估框架,以及代码对决
Ai2 发布 TutorMoments,一个面向 AI 导师的评估框架
8月7日 — Ai2 发布 TutorMoments,这是一个开放评估框架,用来衡量模型是否能处理教学中的一个核心权衡:是直接支持学生,还是让学生自行思考。方法论基于 462 份匿名化的一对一数学辅导真实会话转录(小学二年级到初中二年级),其中教师标注了超过 1,500 个关键决策时刻。首个结论是:提示词非常关键——使用中性提示时,所有模型都倾向于过度帮助;但在提示中明确这个权衡后,得分会显著改善,而且不同模型之间的差异很大。
| 指标(明确提示) | 得分 |
|---|---|
| 合理支架 | 0,458 |
| 深入严谨 | 0,182 |
| 避免过度支架 | 0,496 |
Ai2 以开放访问方式发布了转录文本、流水线代码和原始结果。
Together AI 在真实代码上比较 DeepSeek-V4 Flash-0731 与 GPT-5.6 Luna
8月6日 — Together AI 在 113 个真实软件工程任务上运行了 900 次 DeepSWE 执行。GPT-5.6 Luna 在原始准确率上胜出,pass@1 达到 67,2%,而 DeepSeek-V4 Flash-0731 为 53,3%,这一 14 个百分点的差距在 pass@4 中仍然存在(90,3% 对 80,5%)。真正的差异体现在成本上:每次执行 0,10 $ 的 DeepSeek 能以 100 美元解决 532 个任务,而 Luna 每次执行 0,61 $ 只能解决 110 个任务——也就是每美元大约多 4,8 倍 的解决方案。级联策略(先用 DeepSeek,失败后升级到 Luna)可以以每个任务 0,385 $ 的成本解决 78,9% 的任务,这一成功率高于单独使用 Luna,同时每个任务成本降低了 37%。
🔗 Together AI — DeepSeek 与 GPT-5.6 Luna 对比
Gemini:创造力与旅行
Gemini Omni:五位创作者分享他们的创意用法
8月7日 — Google 展示了五位使用 Gemini Omni 的创作者——可通过 Gemini 应用、Google Flow、AI Studio 和 API 访问——他们用它进行视频编辑和通过简单指令可视化创意。Leon Lin 通过改变角度和环境,以 20 种不同视角 捕捉同一城市场景;Carlos Santana 通过语音指令将户外场景转化为不同版本(昼/夜、多云天空、积雪地面);Pan 从草图出发,让日常物品动起来;Jerrod Lew 在 Google Flow 中将多种视觉风格(实拍、anime、claymation)应用到同一段视频;Hyperagent 则生成景观设计提案和动态仪表板。文章体现了 Gemini Omni 的核心承诺:用自然语言简化视频剪辑,而无需技术技能。
🔗 Google — Gemini Omni Builders
Gemini 如何构建详细旅行行程
8月6日 — Google 以四个步骤详细说明了 Gemini 在旅行规划中的工作方式,该功能现已在 Gemini 应用中提供。首先,通过 Google Maps、Flights、Hotels 和 YouTube 进行实时数据收集,并集成 Viator 以提供活动建议。随后,Personal Intelligence 功能会基于用户已经存储在 Gmail、Photos、Search 和 YouTube 中的数据来个性化推荐——例如,从保存的食物照片中推荐餐厅。接着,Gemini 会考虑行程时间来构建一个连贯的行程,而 Gemini Spark 可以将一串预订邮件转换为一份主行程文档。最后,助手还能填写预订表单、比较租车选项并编写行李清单——文章中以京都之行作为示例。
GitHub Copilot:审查治理与代理指标
Code Quality 不再自动强制要求 Copilot 审查
8月7日 — 自 2026年7月20日 启用 Code Quality 以来,GitHub 会自动创建一个 ruleset,要求每个 pull request 都进行一次 Copilot 审查。GitHub 现在禁用了其中三种触发方式:PR 打开时的审查、新推送时的审查,以及草稿的审查。在现有仓库中,已创建的 ruleset 已被修改为关闭这三项选项——ruleset 仍然存在,但不再自动生效;在新仓库中,启用 Code Quality 不再创建这项要求。希望保留自动审查的团队,需要在仓库或组织级别手动创建或修改 ruleset。GitHub 将这一变化归因于一个反复出现的需求:添加审查人应当是一个选择,而不是默认强加的设置。
Copilot usage metrics API 按第三方 AI 代理细分活动
8月7日 — Copilot usage metrics API 公开了一个新的表格 totals_by_3rd_party_agent,它会详细列出在 GitHub workflows 中运行的每个合作代理(Claude、Codex 等):一个稳定标识符(agent_name、agent_id)、用户发起的任务数量,以及在聚合报告中的会话数量。该数据面向企业所有者、计费管理员、组织所有者,以及拥有“查看 Copilot 指标”角色的用户。其目标是清晰追踪每个 app 代理并比较它们的采用情况,从而基于真实使用情况而不是假设来做部署决策。
媒体生成:视频与语音
Seedance 2.5 在 Runway 和 Luma 上全面上线
8月7日 — 在 8 月初获得抢先体验后,Seedance 2.5 现已在 Runway 上正式可用:每次生成最多可使用 50 个参考 来构建多角色世界,可生成带声音和对白的 30 秒 片段,并支持编辑/扩展。同一天,Luma 也宣布在其平台上接入 Seedance 2.5,具备相同能力,并可通过 Luma Agents 进行控制,包括场景、镜头角度和节奏。与此同时,Pika 通过其 API Club 确认,Seedance 2.5 在那里提供,价格比其他 API 聚合器最多便宜 88%,并被描述为永久定价。
ElevenLabs 详解 ElevenAgents 对 ElevenReader Voice Chat 的影响
8月7日 — ElevenLabs 分享了 ElevenAgents 的部署数据,这些能力已推广到其全部产品中。重点案例是 ElevenReader Voice Chat:它允许有声书读者在读到一半时用与叙述者相同的声音提问,同时不会泄露书中后文的内容。
| 测量指标 | 观察值 |
|---|---|
| 平均聆听时长提升 | +24% |
| 图书完成率(5+ 会话) | 78% |
最常见的问题是对情节的总结,其次是关于人物、主题和引文的问题。
Suno 在其 iOS 和 Android 移动应用上推出 Voices
8月7日 — Voices 功能允许录制自己的声音并将其融入生成的曲目中,目前已可在 Suno 移动应用(iOS 和 Android)中通过创作界面的“+ Voice”按钮使用。录音时长必须至少 一分钟。Pro 和 Premier 订阅可无限使用,免费计划则提供受限版本。
🔗 @suno 公告
简讯
- Devin(Cognition)为初创公司推出 65,000 美元额度计划 — Cognition 开放了一个 startup 计划,提供最高 65,000 美元的 Devin 额度,延续了生成式 AI 主要厂商类似计划的做法。 🔗 来源
- v0(Vercel)推出 Usage & Activity 仪表盘 — 按日跟踪额度、按成员或项目统计活动,并细化到每条消息(日期、模型、成本),可从 Settings → Usage & Activity 访问。 🔗 来源
- Warp Agent CLI——高级个性化 — 所有配置现在都保存在一个可由代理编辑的
settings.toml文件中,支持主题、动画、可自定义状态栏以及多代理编排。 🔗 来源 - Replit 获得吉尼斯世界纪录,成为最大 AI 视频课程 — 14,075 人在一次直播会话中共同构建,创下了经吉尼斯认证的纪录。 🔗 来源
- SK Telecom 发布 A.X K2,一个拥有 6880 亿参数的 MoE,采用 Apache 2.0 许可 — 韩国混合专家模型,256K token 上下文,开放许可,可用于商业用途。 🔗 来源
- Hugging Face 托管了一个包含一百万张公有领域图片的数据集 — 1,080,814 张图片,大多来自 19 世纪书籍,已发布到 Hub 上。 🔗 来源
- Together AI 声称在多个基准测试中为 Kimi K3 提供了最佳吞吐量 — Moonshot AI 将 Together AI 排在 4 个测试基准中的 3 个上居首或并列第一:OCRBench、MMMU Pro Vision 和 DeepSWE。 🔗 来源
- 幕后花絮:Apollo 2(Apptronik)运行在 Gemini Robotics 2 上 — Google DeepMind 发布了一系列围绕人形机器人 Apollo 2 的宣传内容,其运行于 Gemini Robotics 2。 🔗 来源
- issues 预览版与多选字段之间的“Relates to”关系进入 GA — 新的 issues 关系在公开预览中保持中性,同时 issues 和 projects 的多选字段进入正式可用。 🔗 来源
- Secret scanning 添加合作伙伴并新增 push protection 检测器 — Lovable Labs 加入该计划;新增检测器包括
mistral_ai_api_key,并为 Cohere、GoCardless 和 Square 的告警补充了更多元数据。 🔗 来源 - 企业托管设置中的 MCP allowlists — 企业可以通过
managed-settings.json为 Copilot app、CLI 和 VS Code 集中管理允许或阻止的 MCP 服务器。 🔗 来源 - MiniMax H3 已在 Genspark AI Video Agent 中可用 — 这款在 8 月初转为开放权重的视频模型,现在可直接在 Genspark 的视频生成工具中使用。 🔗 来源
- MiniMax H3 已在 Luma Agents 中可用 — 可生成最长 15 秒的 2K 视频,带原生立体声音频,并可由文本、图片、视频和参考音频驱动。 🔗 来源
- MiniMax H3 社区产出了一款蒸馏 LoRA(20 → 4-8 步) — 在开放权重发布四天后,社区 LoRA 将采样步数从 20 步降至 4-8 步。 🔗 来源
- Genspark 加入世界经济论坛 Unicorn Innovator Community — 宣布参与,并计划与商界和政府领导人一道出席达沃斯。 🔗 来源
- GitHub 允许在组织级别限制打开的 pull requests 数量 — 新选项可在组织范围内限制未写权限贡献者创建的打开 PR 数量。 🔗 来源
- Genspark 让两个 AI 代理(ChatGPT vs Claude)在柠檬水摊上对决 — 一场营销演示中,每个代理都负责一个真实摊位,试图在一天内赚到 100 美元。 🔗 来源
- HSP GRUPPE 在其税务咨询机构网络中部署 ChatGPT Enterprise — 德国税务咨询、审计和法律服务网络,在 81 个组织组中采用了 ChatGPT Enterprise。 🔗 来源
这意味着什么
默认安全正在各大实验室同时落地,但形式各不相同。Anthropic 把 Auto Mode 设为默认,依据的是一个很难反驳的数字——89% 的危险命令被阻止,而人工复核在疲劳状态下只有 14%——它押注于安全判断的自动化如今比反复依赖人类注意力更可靠。OpenAI 则在另一条不同赛道上采取了相反路径:它不是放松控制,而是在测试活动结束前就把 Astra 定为关键级别。同一周发布的 Codex Security Review,则把这种逻辑延伸到产品侧,将安全分析前置到 merge 之前,而不是事后复核。这三项公告讲述的是同一个故事:代理式安全不再是一个手动勾选的选项,而是成为默认层,无论它体现为更强的自主性,还是更严的防护栏。
开放模型生态越来越不只是看 benchmark 分数,而是更看成本与工业采用度。NVIDIA 将 Cosmos 3 定位为的不只是另一个模型,而是一套在大规模推广前就已被 Doosan、LG、Samsung 和 Li Auto 采用的基础设施。Together AI 在代码侧记录了同样的权衡:GPT-5.6 Luna 在 DeepSeek-V4 Flash 上把 pass@1 提高了 14 个百分点,但 DeepSeek 每美元能提供 4.8 倍的解法,以至于级联策略单独击败了这两个模型。SK Telecom 又以宽松许可向这个已经很拥挤的格局中补充了一个 6880 亿参数的韩国 MoE。共同信号是:竞争不再只发生在能力边界上,而是发生在能力与实际使用成本的比值上。
代理式开发工具正在配备更传统的企业级基础设施——精细计费、身份、治理——这表明它们正从单纯原型走向成熟。Amp 现在像任何基础设施供应商一样,按规模和线程切分云环境;Replit 在加速采用的同时提供免费的企业 SSO;Claude Code 则让会话之间传递上下文摘要,而不是强迫用户重新输入所有内容。GitHub 这边的方向几乎相反,但指向同一结果:Code Quality 取消了自动添加 Copilot 审查人的做法,让选择变得明确;与此同时,usage metrics API 终于展示了在企业 workflows 中到底是谁在执行工作,是 Claude 还是 Codex。合在一起,这些公告把讨论从“哪个代理最聪明”转向“如何治理一支代理舰队”。
媒体生成则继续通过各个平台扩散,而不是局限在单一厂商之中。Seedance 2.5 同时在 Runway 和 Luma 上全面上线,MiniMax H3 在短短几天内传播到 Genspark 和 Luma Agents,同时社区已经为其制作了蒸馏 LoRA;ElevenLabs 和 Suno 则在细分场景上继续打磨——有声书聆听中的上下文提问、直接从移动端录音。MiniMax H3 在几天内就从一个产品流入多个产品,这种快速流通说明,开放权重正在把创意扩散速度推向远超原始发布方的范围。
来源
- @ClaudeDevs 公告 — 默认 Auto Mode
- @bcherny 在 X 上
- OpenAI — Astra 透明度说明
- @OpenAI 在 X 上 — Astra
- NVIDIA — 用于物理 AI 的开放世界模型
- @ClaudeDevs 公告 — 会话间消息传递
- @claudeai 公告 — Claude Fable 5
- Amp — Size the orbs of production
- @Replit 公告 — SSO
- @OpenAIDevs 公告 — Codex Security Review
- Ai2 — TutorMoments
- Together AI — DeepSeek vs GPT-5.6 Luna 对比
- Google — Gemini Omni Builders
- Google — Gemini 如何规划旅行
- GitHub 更新日志 — Code Quality
- GitHub 更新日志 — Copilot usage metrics API
- @runwayml 公告 — Seedance 2.5
- @ElevenLabs 公告 — ElevenAgents
- @suno 公告 — Voices
- @cognition 公告 — Devin startup program
- @v0 公告 — Usage & Activity
- @warpdotdev 公告 — 个性化
- @Replit 公告 — 吉尼斯纪录
- @SKtelecom 公告 — A.X K2
- @vanstriendaniel 公告 — Hugging Face 数据集
- @togethercompute 公告 — Kimi K3 吞吐量
- @GoogleDeepMind 公告 — Apollo 2
- GitHub 更新日志 — Relates to 与多选
- GitHub 更新日志 — secret scanning
- GitHub 更新日志 — MCP allowlists
- @genspark_ai 公告 — MiniMax H3 在 Genspark 中
- @LumaLabsAI 公告 — MiniMax H3 在 Luma Agents 中
- @MiniMax_AI 公告 — 蒸馏 LoRA
- @genspark_ai 公告 — WEF
- GitHub 更新日志 — 按组织限制 PR 数量
- @genspark_ai 公告 — 柠檬水摊
- OpenAI — HSP GRUPPE