搜索

GitHub 回顾 8 月 17 日宕机,Meta AI 发布 WildArtifactBench,Pika 公开其音频模型

ai-powered-markdown-translator

由 gpt-5.4-mini 将文章从法语翻译成中文。

在 GitHub 上查看项目 ↗

2026 年 8 月 20 日,GitHub 的 CTO 发布了 8 月 17 日宕机的详细总结(持续 7 小时 47 分钟,也是本月第二次重大事故),并加速向 Azure 迁移。Meta AI 介绍了 WildArtifactBench,这是一个面向多模态智能体的新评估框架,同时还展示了扩展版的 Muse Spark 1.2。Pika Labs 详细介绍了其完整的音频模型系列(Music、SFX、Soundtrack),并给出了与 Suno、ElevenLabs 和 Stable Audio 对比的量化基准。围绕这三项公告,Anthropic 强化了 Claude Academy 和托管智能体,Mistral 推出新的文档检索层,另外还有十多项新动向覆盖开发、开放模型和媒体生成。


GitHub 详述 8 月 17 日持续 7 小时 47 分钟的宕机并加速其可靠性计划

8 月 20 日 — GitHub CTO Vladimir Fedorov 发布了 2026 年 8 月 17 日宕机的复盘,该故障持续了 7 小时 47 分钟,影响了 github.com、身份验证、GitHub Actions、API、pull requests、issues 以及 Copilot。这是本月第二起显著事故,前一次是 8 月 6 日的 Actions 宕机。两次事故都不是由代码或配置变更引起,而是容量故障。

事故始于一波前所未有的流量峰值超过了 GitHub 位于美国中部数据中心的一个关键基础设施组件的容量。压力随后在系统间扩散,导致身份验证失败。大多数服务在当天内恢复,但部分 Copilot 服务耗时更久:其中的错误触发了客户端侧的重试循环,在恢复期间进一步放大了流量。

Fedorov 将这起事故与平台增长联系起来:自 4 月以来,月度 commits 已从 14 亿增至 29 亿。自 3 月和 4 月以来,GitHub 已新增超过 300 万 CPU 核心和 120 PB 存储,同时加快了向 Azure 的迁移:如今 Azure 承载了 58% 的负载,而 5 月时仅为 12%。作为即时修复措施,GitHub 正在为各项服务建立一致的重试限制。

On August 17, GitHub experienced a significant outage that disrupted developers and organizations around the world. If you were trying to ship software that day, we let you down.

🇨🇳 8 月 17 日,GitHub 遭遇了一次重大宕机,影响了全球各地的开发者和组织。如果你当天正试图交付软件,我们辜负了你。@Vlad_GitHub 在 X 上

🔗 8 月 17 日宕机,以及接下来的工作(github.blog)


Meta AI 公开 WildArtifactBench 并扩展 Muse Spark 1.2 的演示

8 月 20 日 — 在一条十连推中,Meta AI 同时展示了 Muse Spark 1.2 多模态能力的扩展演示,以及 WildArtifactBench 的发布——一个面向多模态智能体的新内部评估框架。该模型被展示为能够分析多模态观察并调用工具,指导一个双臂机器人去找回一只塑料鸭子,然后整理一张办公桌——其中还包含一个将发梳与化妆刷区分开来、以便正确收纳口红的示例。

文中重点强调了两项具体能力:其一是从图像生成数字工件(网页、游戏),评估依据是真实渲染结果,而不是代码对比;其二是 Muse Spark 在媒体生成中的内部使用,并与 Muse Image 和 Muse Video 协同工作。

这条推文最终落到 WildArtifactBench:与基于真实标签的严格评分表不同,该框架采用胜率和 Elo 分数,由人类和智能体偏好评审产生,用于覆盖实用的多模态工作流。Meta 今天同步发布了该基准的 10 个任务以及一份设计原则文档。

Today we’re also previewing WildArtifactBench, an internal evaluation framework designed to assess agents on complex, real-world tasks across diverse deliverable formats. By using win rates and Elo scores from human and agentic preference judges rather than strict ground-truth rubrics, it expands task coverage across practical multimodal workflows.

🇨🇳 我们今天也发布了 WildArtifactBench,这是一个内部评估框架,旨在通过多样化的交付格式来评估智能体在真实复杂任务中的表现。它采用胜率和 Elo 分数,由人类和智能体偏好评审产生,而不是依赖基于真实标签的严格评分表,从而将任务覆盖范围扩展到实用的多模态工作流。@AIatMeta 在 X 上

🔗 完整线程 @AIatMeta


Pika 以 Suno、ElevenLabs 和 Stable Audio 为对照,详述其 Pika Audio Models 产品线

8 月 18-20 日 — 在 8 月 14 日宣布 “Pika Audio Models” 产品线后,Pika Labs 本周详细介绍了三款产品,每一款都带有数据。

Pika Music(8 月 20 日)接受四种输入模态——文本、歌词、语音参考、音乐参考——并可在同一个潜在扩散解码器中组合使用。它在 Audiobox Aesthetics 上取得了接近市场领先者的分数,并以平均 6.25 秒生成一首 90 秒歌曲,约为播放时长的 14.5 倍速度。Pika SFX(8 月 19 日)可在不到一秒内生成音效,成本最多比竞品低 95%。Pika Soundtrack(8 月 18 日)从压缩为潜在 token 的视频中同步音乐、旁白和音效,在 67 个序列的面板上位居视听对齐第一。

音频模型关键指标Pika竞争对手
Pika MusicAudiobox Aesthetics(制作)8,064Suno:8,151
Pika Music速度(90 秒歌曲)6,25 s~14,5x 播放时长
Pika SFX平均延迟(50 条提示词)0,847 sElevenLabs v2:2,47 s
Pika SFX平均延迟(50 条提示词)0,847 sStable Audio 3 SFX:2,64 s
Pika Soundtrack语义对齐(ImageBind)0,245767 个序列面板中的最佳表现

这三款模型都可通过 Pika API Club 访问。

On our fixed-lyrics benchmark, Pika Music reached the top tier of Audiobox Aesthetics: Content Enjoyment: 7.403, Production Quality: 8.064. For context, Suno scored 7.412 and 8.151 on those respective measures.

🇨🇳 在我们的固定歌词基准上,Pika Music 达到了 Audiobox Aesthetics 的最高水平:内容愉悦度 7,403,制作质量 8,064。相比之下,Suno 在同样的指标上分别取得了 7,412 和 8,151。@pika_labs 在 X 上

🔗 Pika Music(8 月 20 日) · Pika Soundtrack(8 月 18 日) · Pika SFX(8 月 19 日)


Anthropic 强化 Claude Academy、托管智能体和 Claude Code

Claude Academy 已上线

8 月 20 日 — Anthropic 推出 Claude Academy,这是一个面向所有人免费开放的课程与教程平台,不论水平高低:从刚接触 AI 的人到已经在日常使用 Claude 的用户都适用。该 նախաձեռնative 更像一条渐进式学习路径,而不是简单的产品文档;初学者和高级用户都能获得相同的访问权限。配套文章详述了 Anthropic 在 AI 学习方面的教学理念,以及 Claude Academy 在这一方法中的定位;在公司不断围绕 Claude 推出教育类举措的背景下,这与其产品发布相辅相成。

🔗 @claudeai 公告

Claude Managed Agents 的三项更新

8 月 19 日 — Anthropic 宣布 Claude Managed Agents(Claude Developer Platform)有三项变化:现在可以在 Self-Hosted Sandboxes 中使用记忆功能,写入自托管 sandbox 中的工作可为后续会话保留;web_searchweb_fetch 工具现在接受 allowed_domainsblocked_domains 参数,以便精确限制智能体可访问的网站;而 Console 会话查看器也为多智能体会话重新设计,包含按智能体分成单行的 minimap、按迭代分组的流式转录,以及按线程和会话显示美元成本的 inspector。

🔗 @ClaudeDevs 公告

Claude Code —— 新的 Concise 输出风格

8 月 20 日 — Claude Code 提供了一种新的 “Concise” 输出风格:启用后,Claude 会优先在回复开头给出结果,并默认保持简短回答;如果用户明确要求,则会提供完整细节。可通过 /config → Output style 启用,或者直接在 settings.json 中通过 "outputStyle": "Concise" 配置。对于希望在终端里更快读完回答、但在明确要求下仍能深入某个具体问题的用户来说,这是一项日常非常实用的设置。

🔗 @ClaudeDevs 公告


Cognition 的 Devin 为代码新增专用 Slack 频道

8 月 20 日 — Cognition 与 Slack 达成正式发布合作,推出 “Slack Code in Devin”:该智能体现在会主动为每个代码任务创建专用 Slack 频道,以便让工作聚焦,而不是把交流混在已有团队频道里。Cognition 表示,他们专门为 Devin 在 Slack 中的行为重塑了其“个性”,这种语气调整更适合团队聊天场景,而不是终端或 IDE。该公告将 Devin 锚定在产品团队和非技术团队已经在使用的协作工具中,并补充了其现有集成(GitHub、Linear)。

🔗 @cognition 公告


开放模型:Liquid AI、Sakana AI,以及面向机器人领域的大型数据集

Liquid AI 的 LFM2.5-DSpark,推理加速最高可达 3.2 倍

8 月 20 日 — Liquid AI 发布 LFM2.5-DSpark,这是一组约 3 亿参数的 “draft” 模型,可通过 speculative decoding 加速 LFM2.5 系列三款模型的推理,同时不损失质量——输出序列在构造上与参考 greedy decoding 完全一致。在 H100 GPU 上,实测平均加速比为:LFM2.5-2.6B 2.67 倍(323 → 864 tok/s)、LFM2.5-1.2B 2.10 倍、LFM2.5-8B-A1B 2.54 倍。对于多工具场景,函数调用延迟平均下降 57%。这些 checkpoints 提供 safetensors 和 GGUF 版本,首日支持 llama.cpp,并可直接集成到 SGLang。

🔗 Hugging Face 上的 LFM2.5-DSpark

Sakana Translate 升级到新一代 Sakana Namazu

8 月 20 日 — Sakana AI 的日英中免费翻译服务升级到新一代 Namazu,结合了更新的基础模型和改进的训练方法。在使用内部工具 TransEvalnia 评估的 160 个日英翻译任务中,Sakana Translate 在与每个被比较的竞争系统对比时,超过 50% 的情况下被判定为更优。现有的三项功能(最长约 5,000 字符的流式翻译、带样式 diff 的修订、翻译问答)仍然免费,并已运行在新模型之上。

🔗 Sakana Translate 公告

HiPHI:面向机器人领域的大型开放人体运动数据集

8 月 19 日 — Noitom Robotics 面向研究免费发布 HiPHI,包含 617.5 小时高精度人体运动捕捉数据,并带有物体交互——据公司称,这是同类中迄今公开规模最大的数据库之一。基于该数据集训练的策略已经能够在真实的 Unitree G1 机器人上运行,标签为 #PhysicalAI。这类开放资源契合物理 AI 和机器人领域构建数据集的更大趋势,而 Hugging Face 生态也密切跟进并转发了这一公告。

🔗 @noitomrobotics 公告


媒体生成:HeyGen、Black Forest Labs、Ideogram 和 NVIDIA

HeyGen 推出头像修饰(Retouch)

8 月 20 日 — HeyGen 直接在其视频编辑器中加入了头像修饰工具:可修正瑕疵(痘痘、皱纹)、调整妆容和光照,并通过控制修饰程度来保持对原始头像的忠实度。其目标是避免仅因外观问题而重拍——一次修饰,然后将效果复用于后续所有视频。HeyGen 强调,修饰后头像仍然可辨识:这不是生成一个不同的脸,而是对现有头像进行精修。

🔗 @HeyGen 公告

Black Forest Labs 发布 FLUX Video Upscale(2K/4K)

8 月 20 日 — Black Forest Labs 为 FLUX 3 Video 增加了原生放大模块,可生成或转换为 2K/4K 视频,带来更清晰的人脸、更干净的纹理以及更多背景细节,同时保留 FLUX 3 Video 独有的风格多样性和真实感。该功能也可用于外部视频,不仅限于 FLUX 生成的视频,而且据称比第三方放大方案更快。可通过 API 和专门演示访问。

🔗 @bfl_ai 公告

Ideogram 在 Runware 上发布量化开放模型和图像去背景工具

8 月 20 日 — Runware 托管了两个新的 Ideogram 模型:Ideogram 4.0q 是 Ideogram 4.0 的开放权重量化版本(93 亿参数),支持通过边界框控制版式、结构化 JSON 提示词以及 LoRA;而 Ideogram Background Remover 则可从任意图像中生成透明 PNG 去背景效果,边缘保真度良好,尤其适用于排版和 logo。

🔗 @runware 公告

NVIDIA 借助 cuOpt 宣称拥有最快的开源求解器

8 月 19 日 — NVIDIA 表示,其开源优化求解器 cuOpt 在 Hans Mittelmann 基准上表现最快;Hans Mittelmann 是该领域公认的权威基准,涵盖三类组合优化和线性优化问题。公司邀请社区直接在 GitHub 上测试该项目,这延续了其围绕自家硬件开放软件工具的策略——cuOpt 尤其面向物流和大规模规划场景,在这些场景中,求解速度会直接转化为运营成本因素。

🔗 @NVIDIAAI 公告


Mistral、Kimi 和 GLM-5.3:文档检索与成本/性能竞争力

Mistral 推出 Agentic Search:一种迭代式文档检索层

8 月 20 日——Mistral 发布 Agentic Search,这是一个旨在突破传统 RAG 局限的文档检索层;传统 RAG 依赖单次检索,无法迭代。该系统为模型提供了五种受文件操作启发的工具(searchopennavigatereadgrep),可与现有索引配合使用,无需微调,并且与模型无关——已在 Mistral Medium 3.5 和 Z.ai 的 GLM-5.2 上完成测试。在 FinanceBench(368 份 SEC 文件)上,Mistral Medium 3.5 的准确率从 26.7% 提升到 86%,p90 延迟从 255 秒降至 154 秒。在 OfficeQA Pro 上,GLM-5.2 的准确率提升了 45.6 个百分点。可通过 Mistral Search Toolkit 使用,并已集成到 Studio 和 Vibe 中。

🔗 mistral.ai 上的 Agentic Search

Kimi K3 在 Agent Arena 的成本/性能帕累托前沿中领先

8 月 19 日——Agent Arena(LMArena)公布了其在长周期真实任务上的代理评测成本/性能帕累托前沿。Moonshot 的 Kimi K3(Max)位列第 4,性能提升 +10.53%,每个任务的中位成本为 0.62 美元——在前八名模型中最低,远低于 Claude Opus 5(Max)的 3.37 美元/任务,而后者的分数仅略高(+12.0%)。Grok 4.5 达到 +6.1%,成本为 0.22 美元/任务,Qwen-3.8 Max 则为 +6.3%,成本为 0.33 美元/任务。

🔗 @arena 排名

Z.ai 的 GLM-5.3 原生集成到 AutoClaw 中

8 月 20 日——Z.ai 的工作代理 AutoClaw 原生集成了 8 月 18 日发布的 GLM-5.3。连接其订阅的 GLM Coding Plan 用户可获得 1.5x 的临时额度加成,以及每月 AutoClaw 额度(Lite 5K / Pro 10K / Max 26K);新用户可获得 26K AutoClaw 额度(价值 20 美元),有效期 30 天。此外,GLM-5.3 在官方 DeepSWE 排行榜上获得了 69 分,同一天还被一位外部开发者报告。

🔗 @AutoClawAIer 公告


OpenAI 将 ChatGPT desktop 扩展到欧洲、推出 ChatGPT Sites 和 Codex SDK

ChatGPT desktop(Mac)将 Computer History、多应用记忆和 Record & Replay 扩展到欧洲

8 月 20 日——OpenAI 将 ChatGPT desktop for Mac 的三项功能扩展到欧洲(EEA、英国、瑞士),此前这些功能仅限美国用户:Computer History(已于 8 月 13 日上线),面向 Pro、Business 和 Enterprise 用户;一种多应用记忆功能,使 ChatGPT 能记住用户跨应用和网站的活动;以及 Record & Replay,它通过“展示”而不是“描述”常规工作流,把它变成可复用技能,供 ChatGPT Work 和 Codex 使用。

🔗 @OpenAI 公告

ChatGPT Sites:URL 自定义与借助 Codex 的团队协作

8 月 20 日——ChatGPT Sites 是集成在 ChatGPT 中的网站创建工具,现在允许自定义已发布网站的 URL,使其更贴合项目,也更容易识别和分享。OpenAI 还新增了邀请协作者作为编辑者的能力,以便多人共同构建并发布同一项目。在这种协作模式下,Codex 在后台管理 Git 和持续集成,使非技术团队无需自行处理版本控制或部署,也能协作构建网站。

🔗 @OpenAIDevs 公告

适用于 ChatGPT Work 和 Codex 的全新 Exa 插件

8 月 20 日——OpenAI 推出了一款与 Exa AI Labs 联合开发的插件,让 ChatGPT Work 和 Codex 能访问超过 1000 亿网页、研究论文和文档。该插件将 Codex 代理和 ChatGPT Work 的信息检索能力扩展到其常规来源之外,延续了 OpenAI 为其代理生态系统整合第三方插件的策略;这一策略在 8 月初随 Agent Plugins 的发布而启动。

🔗 @OpenAIDevs 公告

Codex SDK:Cisco App Builder 与 Thrive Holdings/Crete 客户案例

8 月 20 日——OpenAI 重点展示了 Codex SDK 的两个部署案例:Cisco 用它为 App Builder 提供支持,允许客户用自然语言为 Cisco Cloud Control 创建自定义应用;而 Thrive Holdings 与 Crete 合作,构建了一个税务准备系统,已处理 7000 份申报,将准备时间缩短了约三分之一。OpenAI 还强调了开源 Codex harness 的更广泛使用场景:各团队将其集成到现有内部工具中,由他们自己的应用负责界面、上下文和审批,而 harness 负责代理循环。

🔗 @OpenAIDevs 公告


简讯

  • 用于 Claude Managed Agents 的 AG-UI 适配器——与 CopilotKit 联合发布的新 cookbook,将每个对话线程映射到一个受管理会话,支持文本、工具和推理的流式传输。 🔗 来源
  • 用自然语言配置 Auto Mode——Claude Code 的 Auto Mode 规则可以用自然语言编写;添加 $defaults 可保留内置规则。 🔗 来源
  • Claude Desktop 启动速度约快 2 倍——修复了后台启动时的限流问题,即使窗口隐藏也能全速启动。 🔗 来源
  • v0(Vercel)——GPT-5.6 Sol 和 Fast mode 降价 50%——促销价格有效期至 2026 年 9 月 18 日。 🔗 来源
  • Gemini 中免费的 SAT 模考——开学季提醒:内容由 The Princeton Review 验证,提供即时反馈和答案解析。 🔗 来源
  • 搭载 Visual Studio 2026 的 Windows 11 arm64 镜像现已正式可用——适用于标准和 larger GitHub-hosted runners。 🔗 来源
  • Code scanning 新增 “Mitigated” 驳回原因——当外部控制已缓解风险时,可用于关闭告警。 🔗 来源
  • GitHub Code Quality 专用的 GitHub Actions 路径——历史记录和使用报告现在与其他 runs 分离。 🔗 来源
  • 在审计日志中跟踪 GitHub Code Quality 的启用情况——三个新事件用于记录启用、停用和设置变更。 🔗 来源
  • CodeQL 2.26.3 改进了 GitHub Actions 查询——JavaScript、TypeScript 和 Vue 的源建模。 🔗 来源
  • Luma 详述了一个代理客户案例(Aperture)——通过三层系统(智能、人类验证、反馈循环),获客成本降低 75%,广告预算扩大 9 倍。 🔗 来源
  • NVIDIA 将 GeForce NOW 开放给 Firefox——Ultimate 订阅用户最高可达 1440p/120 fps,并新增 12 款游戏,包括 Gallipoli。 🔗 来源
  • Suno 新增离线播放列表——作为前一天宣布的播放列表重构的补充。 🔗 来源
  • Qwen3.8-27B 在 Harvey 的代理法律基准测试中领先——开放权重模型中的 Legal Agent Benchmark 第一名。 🔗 来源
  • AI Futures:OpenAI 关于变革性 AI 治理的新博客——探讨变革性 AI 带来的权力集中风险。 🔗 来源
  • Stampli 借助 ChatGPT Work 和 Codex 加速产品发布——Deep Finance 产品在六周内上线,估算的人力工时从 243 小时降至 77 小时。 🔗 来源

这意味着什么

AI 基础设施触及的是容量极限,而不是算法极限。8 月 17 日 GitHub 的故障不是 bug:而是一个在四个月内流量翻倍(每月 14 亿到 29 亿次提交)、通过 Azure 迁移和新增数百万 CPU 核心来追赶容量债务的平台。同样的规模与可靠性之间的张力也体现在模型侧:Meta AI 的 WildArtifactBench 放弃了严格的评分表,转而采用 Elo 分数,这表明真实多模态代理的评估已经超出了有真值答案的基准测试所能衡量的范围。

竞争越来越多地围绕成本/性能比展开,而不只是单纯的原始性能。在 Agent Arena 的帕累托前沿上,Kimi K3(Max)以比 Claude Opus 5(Max)低五倍的单任务成本,取得了几乎相当的分数。Mistral 在文档检索侧应用了同样的逻辑:Agentic Search 将单次通过的 RAG 变成一个迭代系统,在密集财务文档上的准确率提升了三倍,而且无需微调。Liquid AI 则将重心推向本地推理,借助 3 亿参数的 draft 模型,通过 speculative decoding 使比它们大得多的模型速度翻倍。

代理平台正在扩大其对企业工作流的渗透,而不再只是聊天界面。OpenAI 正在不断增加集成组件(Exa、Record & Replay、Cisco 和 Thrive Holdings 中的 Codex SDK),Anthropic 则增加治理控制(受管理代理的允许/阻止域),而 Cognition 则将 Devin 直接嵌入 Slack。这是三种不同的押注,但目标都一样:成为非技术团队将工作委派给代理时默认使用的那一层。

最后,媒体生成正在以加速的速度普及。Pika 发布的基准测试在音频上几乎与 Suno 持平,而在音效上比 ElevenLabs 便宜高达 95%;与此同时,Ideogram 将一个开放权重图像模型部署到第三方基础设施(Runware)上,Sakana AI 则在 160 项具体任务上将其翻译能力与竞争对手进行比较。差异化不再取决于模型是否可用,而是取决于公开、可验证、且越来越细致的基准数据。


来源