ai-powered-markdown-translator使用 gpt-5.4-mini 将文章从法语翻译成中文。
对于代理基础设施层来说,这是个大日子:Anthropic 将 computer use、browser tool、Skills API 和 Files API 从 Claude Platform 的测试版推进到正式可用;与此同时,GitHub Copilot 也开始进入 Slack 和 Microsoft Teams。模型方面,DeepSeek 发布了其首个多模态模型,Pika Labs 推出了一款主打前所未有性价比的语音合成器。两者之间,还有一个大规模的自我中心数据集、一项关于语音识别基准偏差的研究,以及 Google DeepMind、GitHub、Z.ai、Qwen、Harvey 和视频/音频生成工具的一长串重要更新。
Claude Platform:computer use、browser tool、Skills API 与 Files API 正式可用
8月20日 — Anthropic 宣布将用于在 Claude Platform 上构建代理的四个组件——computer use、browser tool、Skills API 和 Files API——升级为正式可用。官方目标是减少在没有 API 的应用中自动化任务所需的来回次数,并支持基于版本化技能和可复用文件构建Claude Managed Agents。
新的 computer_toolset_20260801 让 Claude 能在一个回合内串联多个动作(点击、输入、按键、截图),而不是每个独立动作都来回一次。Anthropic 表示,早期访问客户在每个任务上的来回次数减少了20% 到 40%。browser tool 也同步升级为 browser_toolset_20260801:不再像以前那样依赖像素定位——页面布局一有变化就容易失效——Claude 现在接收页面结构,并可以基于元素引用执行操作。
在 API 方面,Skills API 允许把团队流程一次性上传、版本化,并挂载到某个特定的 version_id 或 latest 上。Files API 新增了 expires_in_seconds 参数、5 倍更高的速率限制(每分钟 500 个请求)以及每个组织 1 TB 的配额。Anthropic 还为 Managed Agents 发布了一个 AG-UI 适配器,它会把每条对话映射到一个托管会话,并向界面流式传递文本、工具调用和推理过程。
| 组件 | 今日更新 |
|---|---|
| Computer use | computer_toolset_20260801,每个任务最多减少 40% 的来回次数 |
| Browser tool | browser_toolset_20260801,按页面元素引用定位 |
| Skills API | 版本管理,挂载到 version_id 或 latest |
| Files API | 500 次请求/分钟(5 倍),每个组织 1 TB 配额 |
GitHub Copilot 登陆 Slack 和 Microsoft Teams
8月21日 — GitHub Copilot 正式进入 Slack 和 Microsoft Teams 的公开预览版。两边的用法基本一致:在直接消息、频道或线程中提及 @GitHub,就会开启一个云端代理会话,它可以回答关于代码和 GitHub 活动的问题,整理 bug 报告,调查失败原因,在受保护的云端沙箱中实施变更,然后创建带有原始对话链接的 pull request。
在 Slack 上,这一集成依托于 Slack Code——Slack 在同一周末发布的全新 agentic 产品:GitHub Copilot 可以开设专门的代码频道,让团队查看 diff、检查渲染预览,而不会污染原始对话。在 Teams 上,一段讨论会变成一个团队可共同跟进和引导的代理会话;团队做别的事情时,工作会在云端沙箱中异步继续。
仅面向 Copilot Business 或 Enterprise 方案组织开放。管理员需要启用 Copilot 云代理策略并安装 Slack 或 Teams 应用;仓库管理员可以要求代理生成的 pull request 在合并前必须审批。使用会消耗 AI credits,云端沙箱则单独计费,并支持可配置预算。
🔗 GitHub Copilot 在 Slack 中 · 🔗 GitHub Copilot 在 Teams 中
DeepSeek-V4-Flash-Vision-Exp:DeepSeek 首个 API 多模态模型
8月21日 — DeepSeek 上线了 DeepSeek-V4-Flash-Vision-Exp,这是一个通过 deepseek-v4-flash-vision-exp 提供的实验性多模态模型。在纯文本能力——代理、推理、世界知识——方面,该模型与 DeepSeek-V4-Flash 持平。新意在别处:在多模态代理基准上,DeepSeek 宣布相较 V4-Flash 有明显跃升,性能接近 Opus-4.8。
API 侧的多模态支持是完整的:支持文本+图像混合输入(base64、外部 URL,或通过同日发布的新免费 Files API),并兼容现有三种格式(Chat Completions、Messages、Responses)。价格沿用 V4-Flash 的档位,图像 token 计费上限为每张 384 tokens。Files API 允许你只上传一次图片,然后通过 file_id 引用它,这对重复性的代理式工作流很节省带宽。DeepSeek Harness 0.1.1——这套于 8 月 13 日发布的开源代理 harness——也在当天更新,原生支持新模型。
| 项目 | 详情 |
|---|---|
| 模型 | deepseek-v4-flash-vision-exp |
| 文本能力 | 与 DeepSeek-V4-Flash 持平 |
| 多模态能力 | 在多模态代理基准上接近 Opus-4.8 |
| 图像价格 | 最多 384 tokens/图像,V4-Flash 价格 |
| 支持的 API | Chat Completions、Messages、Responses |
| Harness | DeepSeek Harness 0.1.1(原生支持) |
DeepSeek-V4-Flash-Vision-Exp is now live on the DeepSeek API Platform! This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities—including agents, reasoning, and world knowledge. On multimodal agent benchmarks, V4-Flash-Vision-Exp makes a major leap over V4-Flash, bringing multimodal agent performance close to Opus-4.8.
🇨🇳 DeepSeek-V4-Flash-Vision-Exp 现已在 DeepSeek API 平台上线!这款实验性多模态模型在文本能力上与 DeepSeek-V4-Flash 持平——包括代理、推理和世界知识。在多模态代理基准上,V4-Flash-Vision-Exp 相较 V4-Flash 实现了显著跃升,使多模态代理性能接近 Opus-4.8。 — @deepseek_ai 在 X 上
Pika Speech:3B 语音合成,1.2 秒生成 1 分钟音频,最高比 ElevenLabs v3 便宜 9 倍
8月21日 — Pika Labs 扩展了其 Pika Audio 产品线,推出 Pika Speech,一款拥有 30 亿参数的语音合成模型。其主要卖点是速度:实时因子(RTF)为 0.02,也就是说,在本地长文本测试中,生成 1 分钟、48 kHz、录音棚质量的语音大约只需 1.2 秒,并且支持最长 5 分钟的连续语音请求。
在节奏控制上,Pika Speech 的创新之处在于:它不是像大多数 TTS 系统那样在事后拉伸或压缩音频,而是借助一个“句末潜变量”(EOS latent)直接控制节奏和时长,这个锚点放在目标最终帧上。把这个锚点提前会压缩语速;把它后移则会让文本更舒展。架构方面,团队结合了 flow matching 和分布匹配蒸馏、FlashAttention-3,以及一种“token packing”机制,使得 5 段句子片段的成本大约只会是单段的两倍,而不是五倍。
在成本方面,Pika 宣称相较 ElevenLabs v3 最高可便宜 9 倍,相较 Cartesia 和 ElevenLabs Turbo 便宜 4.5 倍,相较 Fish Audio 便宜 2 倍——但除了这些比例外,并未披露更具体的方法学。该模型可通过 Pika API Club 使用。
Let’s talk about Pika Speech, a 3B text-to-speech model at RTF 0.02. […] Pika Speech generates one minute of studio-quality 48 kHz speech in about 1.2 seconds—and supports requests up to five minutes. That efficiency makes it up to 9× more cost-efficient than ElevenLabs v3, 4.5× than Cartesia and ElevenLabs Turbo, and 2× than Fish Audio.
🇨🇳 来聊聊 Pika Speech,这是一款拥有 30 亿参数、实时因子为 0.02 的语音合成模型。[…] Pika Speech 只需大约 1.2 秒,就能生成 1 分钟 48 kHz 录音棚质量的语音——并支持最长 5 分钟的请求。这样的效率使它相较 ElevenLabs v3 最高便宜 9 倍,相较 Cartesia 和 ElevenLabs Turbo 便宜 4.5 倍,相较 Fish Audio 便宜 2 倍。 — @pika_labs 在 X 上
🔗 架构细节
EgoSuite-Open100K:全球最大的开放式人类第一视角数据集
8月21日 — Lightwheel AI 与 Hugging Face 合作开源了 EgoSuite-Open100K,并将其称为迄今公开发布的、规模最大的全标注人类第一视角数据集。目标规模为10 万小时的人类第一视角数据;其中前 1 万小时已可用,其余内容将分阶段发布。
该数据集覆盖超过 15,000 个任务,分布在超过 15,000 个真实场景中——厨房、卧室、仓库、装配线等——并被归纳为 7 类环境和 128 种场景类型。每段序列都标注了手部姿态、身体姿态以及子任务级别的语义,其中一部分语料还提供了腕部摄像头覆盖。许可方面有一个值得注意的点:与许多研究数据集不同,EgoSuite-Open100K 允许用于商业训练,而不仅仅是学术用途。
其创建者将该数据集描述为更大规模 “Physical AI”(机器人与具身智能)数据基础设施的第一块公开积木——核心观点是,物理模型的规模化如今取决于对海量、共享的人类数据的获取。
🔗 Lightwheel AI 公告 · 🔗 Hugging Face 转发
Claude Security 切换到 Claude Mythos 5
8月21日 — Anthropic 将其漏洞扫描工具 Claude Security 运行在 Claude Mythos 5 上,并向所有 Claude Enterprise 客户开放公开测试版。理由是:让 Anthropic 最强的安全模型来分析自家代码库,而无需单独接入模型;扫描费用按现有方案中的标准 token 用量计费。
具体来说,工具会连接到一个 GitHub 仓库,然后由 Mythos 5 通过追踪文件之间的数据流、推理组件之间的交互来分析代码。每个结果都会附带 CWE 分类、置信度、严重性评估以及建议修复方案,并可直接在网页端的 Claude Code 中打开。Anthropic 还借此推出了一个配有 3500 万美元开源安全 credits 的 Defender Advantage Fund,并计划在未来几周内扩展其 Cyber Verification Program。
GPT-5.6 Sol 定价:OpenAI 下调 API 价格,GitHub Copilot 跟进
8月21日 — OpenAI 在接下来的三个月里将 GPT-5.6 Sol 的 API 和 credits 价格下调了超过 20%。这一调整已在 API 侧生效,并将在当天逐步覆盖到 Codex 和 ChatGPT Work。对于按任务计划(token-based)使用 Codex 的用户来说,已购买的 credits 现在可以用得更久;而 Pro、Plus 和 Business 订阅中包含的用量保持不变——因此,这次降价主要惠及 API 开发者和按 token 计费的用户。
GitHub Copilot 中 GPT-5.6 Sol 立减 50%
与此同时,GitHub 也同步推出了单独促销:在 GitHub Copilot 中使用 GPT-5.6 Sol 可享受 50% 折扣,持续到9月3日,可用于应用、CLI 和 IDE。这个折扣是 Copilot 侧的一次性优惠,不要与上文所述 OpenAI 的永久性价格下调混淆——两家公司不同,两套机制也不同,尽管针对的是同一个模型。
🔗 OpenAI 降价 · 🔗 GitHub Copilot 促销
GLM-5.3(Max)在 Code Arena: WebDev 上攀升
8月20日 — LMArena 表示,Z.ai 的 GLM-5.3(Max) 推动了专注于网页开发任务的 Code Arena: WebDev 排行榜中的帕累托前沿(质量/成本比)发生变化。该模型以 1597 分位列开源权重模型(发布后)中的第 2 位、全部类别中的第 8 位。
| 模型 | 价格($/M tokens) | Code Arena: WebDev 分数 |
|---|---|---|
| GLM-5.3 (Max) | $3,65 | 1597 |
| Qwen3.8 (Max) | $5,00 | — |
| Gemini-3.7-flash-high | $2,86 | 更低分 |
| DeepSeek-v4-flash-high | $1,10 | 更低分 |
按每百万 tokens $3,65 的价格计算,GLM-5.3(Max)仍处于与 Qwen3.8(Max)相近的价格区间,同时在该榜单上超过了 Gemini-3.7-flash-high 和 DeepSeek-v4-flash-high——这再次表明 Z.ai 在代理式网页开发方面具有竞争力,且与其在 Terminal-Bench 和通用 Agent Arena 中已经取得的结果相呼应。
Harvey 基于 Kimi K3 推出法律模型 Tenet
8月20日 — Harvey 发布了 Tenet,这是其首个面向法律领域的后训练模型,基于 Kimi K3(Moonshot AI),并通过 Fireworks AI 在一个由公开法律数据、合成数据和模拟长期法律工作的人工专家数据构成的语料上进行了后训练。
Harvey 表示,这次后训练使 Tenet 在 LAB 基准上的完整通过率提高了 82%,在 LAB Contracts 上提高了 22%,相较基础版 Kimi K3——其中 LAB Contracts 达到 SOTA,整体 LAB 排名第 2。Tenet 的运行成本据称不到市场上最强基础模型的四分之一。作为补充,Harvey 还训练了三个专门的子代理:并购尽调、表格审阅,以及律所知识。
Georgia Tech 追溯 Olmo 3 社会推理的起源
8月21日 — Georgia Tech 团队利用 Ai2 的 Olmo 3 全栈完全开放这一事实——权重、Dolma 3 预训练语料(12.6 亿文档)、基础设施——通过统计方式将模型能力与生成这些能力的文本联系起来;这一实验在封闭模型上是不可能实现的。
该方法基于影响函数,应用于从 Dolma 3 中采样的约 568 万份文档。主要结果:富含对话和人际写作的文本,对社会推理性能的影响大于对事实知识的影响——而移除最具影响力的文学类文档后,SocialIQA 基准上的性能显著下降,证实了因果关系。
🔗 Ai2 文章
开源 ASR 模型中检测到“基准优化”偏差
8月21日 — Hume AI 团队在 Hugging Face 博客上发布了一项关于语音识别方法偏差的研究:某些模型似乎更倾向于复现公共基准的参考转录,而不是忠实转写音频。
在测试的 11 个开源 ASR 模型 中,约 40% 的 VoxPopuli 片段 所对应的参考文本被发现存在错误,而 11 个模型中有 6 个 复现了这些错误,而不是正确转写音频。在 LibriSpeech 上,被遮蔽数字的恢复率达到 30% 到 40%,表明某些模型是在“补全”文本,而不是“听”到文本。结论建议使用保密的评测集,并更严格地区分训练数据与测试数据。
SenseNova-U1.5-8B-MoT:没有 VAE 也没有 DiT 的开放图像模型
8月21日 — SenseNova 以开放权重发布了一款图像生成模型,其宣称性能据称可与 Nano Banana 2 相当。技术亮点在于架构:没有 VAE,没有单独的文本编码器,没有 DiT——模型基于“transformers 混合体”,其中文本和图像 token 使用不同权重并相互期望,去噪直接在像素空间中进行,而非在压缩的潜在空间中进行。
这种方法与标准的文本到图像扩散模型栈形成鲜明对比,而其权重开放将使社区能够独立验证所宣称的性能对比。
Diffusers 0.40.0:Modular Diffusers 退出实验状态
8月21日 — Hugging Face 发布 Diffusers 0.40.0。最具结构性的变化是 Modular Diffusers——该库的模块化流水线系统——正式退出实验状态。该版本新增了多款近期开放模型的集成(LTX2.5、MiniMax H3、MiniMax Music 3、Wan Animate 2),为部分模型提供了张量并行支持,并增加了两个新的量化后端(SDNQ、Nunchaku-Lite)。
Google DeepMind 与 Fenris Creations 探索游戏中的 AI
8月21日 — Google DeepMind 宣布与工作室 Fenris Creations 建立研究合作,这是其 15 年以来将电子游戏作为 AI 实验场工作的延续,从掌握 Atari 到在 StarCraft II 上达到 Grandmaster 水平。继 SIMA 让智能体学会理解 3D 世界之后,DeepMind 希望探索在持久宇宙中对真实人类动态的导航。
该合作聚焦四个开放挑战:持续学习(在不忘记先前技能的情况下获取新技能)、远超当前上下文窗口的深度记忆系统、长程规划(数周、数月、数年),以及多智能体动态(协作、谈判、经济、涌现行为)。长期目标有两个:与开发者共同创造新的游戏体验,并将这些进展重新用于现实世界问题和科学发现。
Runway Ruby:SDR 到 HDR 的 16 位视频转换
8月21日 — Runway 推出 Ruby,这是一款将 SDR(standard dynamic range)视频转换为 16 位 HDR 的模型,输出可为 EXR 序列或 ProRes/HEVC 10-12 位格式,色彩空间为 BT.2020,并支持 PQ 或 HLG——这些是专业后期制作和 HDR 广播所使用的标准。
Ruby 既可处理用户上传的视频,也可处理 Runway 生成的输出,最长限制为 30 秒。该功能现已向 Max 和 Enterprise 套餐开放。
NVIDIA AVO 在 ARC-AGI-3 基准上宣称 100%
8月21日 — NVIDIA 发布 AVO,一款通用代码智能体,在互动推理基准 ARC-AGI-3 上获得了 100% 的分数。根据 NVIDIA 的说法,AVO 完成了分布在该基准 25 个公共环境中的 183 个关卡,且没有显式指令、明确规则或预先设定的目标。
AVO 通过一个持续循环运行:检查、规划、实现和评估,并借助记忆、工具和执行反馈,在时间推移中构建其所学——这种方法旨在维持长任务的推进,而不是在每次新的上下文窗口中从零开始。
HeyGen Look Packs:在保留脸部的同时更换服装与场景
8月21日 — HeyGen 推出 Look Packs,这是一项可在保留人物面部特征的同时更换头像视频服装和场景的功能——其论点是,大多数生成模型在改变外观时也会修改面部特征。
其目标用途是在不同专业场景中保持个人品牌一致性:房地产、法律、健身、教育、健康。一位 B2B 内容创作者因此可以制作适用于各个行业的服装与场景视频,同时在不同视频之间保持可识别性。该公告也延续了 HeyGen 近几天的高频发布节奏(8月20日的 Retouch、以及8月18-19日的 Brand Kits 和 4K upscale)。
Amp 推出 Explain Usage 以解释 token 消耗
8月21日 — Amp 增加了 Explain Usage,这是一项允许用户直接请求内置助手 Puck 分析其自身 token、credits 和 orb 大小消耗的功能。用户可以用自然语言提问——“今天哪个 threads 消耗了最多 token?”——然后 Puck 读取个人使用数据和按 thread 的指标来回答。
有两个入口:直接向 Puck 提问,或者在 usage 页面点击专用按钮。对于更偏好原始数据的用户,Amp 也通过 CLI 暴露这些信息(amp usage --details, amp threads usage <thread-id> --details)。
v0(Vercel)加入 Vercel Connect,可连接 100+ 服务
8月21日 — 在 v0 中构建的应用和智能体现在可通过 Vercel Connect 直接连接到 Slack、GitHub、Salesforce 以及 100 多个其他第三方服务,而无需开发者自行管理认证流程。
该机制依赖可复用的团队连接器,并配合短生命周期 token:一旦在团队侧配置了连接器,每个新生成的应用或智能体都可以复用它,而不必每次都重新请求完整认证。这使 v0 不仅是一个生成孤立界面的平台,也成为能够产出与企业软件栈集成的智能体的平台。
Codex 与 ChatGPT Work 中的共享线程
8月20日 — Codex 和 ChatGPT Work 引入了“共享线程”:一个只读链接,展示某次会话的完整推理过程——方法、决策、上下文——而不仅仅是最终结果。其目标是在代码审查、深入技术探索或团队成员之间的项目交接时,避免依赖零散截图来重建 pull request 的上下文。
这项功能延续了近期围绕 ChatGPT Sites(多人编辑、URL 自定义)的公告,并强化了 Codex/ChatGPT Work 作为团队协作工具的定位。
🔗 共享线程
GPT-Image-2 预览版支持透明背景
8月20日 — GPT-Image-2 API 现已在预览版中支持生成透明背景图像。其实用价值在于产出可复用的资源——产品图、平面设计元素、网站原型、营销活动素材——之后可以无需手动抠图即可放置在任意背景上。
🔗 透明背景
简讯
- Zed — Antigravity 可通过 Zed 的 ACP Registry 一键安装。🔗 推文
- trackio 0.36 — Hugging Face 发布更新,增加了对一种新的可记录数据类型的支持,但未作进一步说明。🔗 推文
- Google DeepMind 视角下的“全栈”AI — Paige Bailey 将 Google 的端到端方法拆解为五层:基础设施、安全、研究、模型/工具、产品。🔗 Google 文章
- GitHub — 被封禁用户管理更佳:支持按名称搜索、排序以及长列表分页。🔗 更新日志
- GitHub — 仓库侧边栏中的视图、项目和里程碑固定功能进入正式可用,同时带来多项相关改进(反应表情头像、仪表盘密度)。🔗 更新日志
- Manus 将 Manus 1.6 Lite 和 Manus 1.6 的免费访问延长至 8月28日(SGT),且受每日配额限制。🔗 推文
- Manus 提醒收到通知的用户在 8月23日 7:59(SGT)之前保存数据,以便其转为独立公司前完成迁移。🔗 推文
- Genspark 推出截至 9月30日的促销:Design + GenTeam 立减 90%,GenMail 免费,Slides Ultra Mode 立减 50%。🔗 推文
- NVIDIA 在一场 agentic 栈安全深度解析中,详细说明了智能体的 harness(它试图做什么)与基础设施(它实际能做什么)之间的分工。🔗 推文
- NVIDIA 发布了 DGX Spark 上西雅图 Spark Hack Series 的总结:获奖项目涵盖灾害响应、医疗保健,以及使用 Nemotron 和 NemoClaw 的离线生存。🔗 推文
- NVIDIA Cosmos 3 — 一段 Cosmos Labs 视频展示了 Cosmos 3 在合作伙伴 Aigen 和 Linker Vision 处的 post-training。🔗 推文
- Luma Labs 将在 9月14日与 GMI Cloud 联合举办的 Summer Signal 上就创意智能体发表演讲。🔗 推文
- Synthesia — 其 CEO 在一篇 Forbes Tech 文章中被引用,内容是如何通过结果而非使用量来衡量 AI 采用情况。🔗 推文
- Qwen3.8-27B 继续其社区热度:SGLang cookbook 中新增 NVFP4 + DFlash2 推理配方,Unsloth 发布轻量版本,四天内登上 Cline 代码智能体排行榜第一,以及一台 NVIDIA DGX Station 在 BF16 服务中报告聚合峰值超过 2713 tokens/秒。🔗 SGLang · 🔗 Unsloth · 🔗 Cline · 🔗 DGX Station
- Qwen3.8-Max 现在可在代码工具 Kilo Code 中用于界面生成。🔗 推文
- Kimi Work 为金融分析师发布了第二个教程:投资者仪表盘、财务模型更新、批量报告生成。🔗 推文
- GLM-5.3 持续推进:在官方 DeepSWE 排行榜上获得 69 分,在 WorkBuddy 平台可用,以及由 Z.ai 将 Build Week 延长至 8月23日 18:00(PT),并为前 50,000 名新注册 ZCode 用户提供 1 亿免费 token。🔗 DeepSWE · 🔗 WorkBuddy · 🔗 Build Week
- GPT-5.6 Sol — 三个平台(Router、Cloudflare AI Gateway、OpenCode Zen)均提供截至 9月中旬的 50% 折扣,此外 Devin、OpenRouter 和 v0 处已覆盖既有优惠。🔗 Cloudflare AI Gateway
这意味着什么
今天 Anthropic-GitHub 的公告勾勒出一个底层趋势:智能体基础设施正在离开实验阶段。Claude Platform 上 computer use 和 browser tool 的正式发布,叠加 Copilot 进入 Slack 和 Teams,表明大型供应商不再只是卖模型——他们开始卖能够在团队日常使用的工具中直接行动的智能体,而不是每次都依赖单独的 API 集成。这不仅是能力上的变化,也是分发方式上的变化:智能体现在去工作发生的地方,而不是要求工作来找它。
在模型层面,DeepSeek-V4-Flash-Vision-Exp पुष्टि了多模态正变成一种默认预期,而非差异化卖点——即便是定位于经济效率的厂商(V4-Flash)也已原生集成多模态,并且性能接近最好的闭源模型。围绕代码智能体基准的竞争(GLM-5.3 在 Code Arena: WebDev 上、Qwen3.8-27B 在 Cline 上)也体现了开发工具侧的同样动态:开放模型与闭源模型之间的价格差距正在收窄,这反过来推动 OpenAI 紧随其后将 GPT-5.6 Sol 的 API 价格下调超过 20%。
走向完全开放——不仅是权重,还包括数据和训练基础设施——的趋势仍在持续产生科学成果:Georgia Tech 关于 Olmo 3 的研究若在闭源模型上根本无法进行,而 Hume AI 关于 ASR 基准偏差的研究则提醒我们,leaderboard 分数并不保证真实转写质量。这两点都在行业频繁宣布创纪录分数的当下提供了有用提醒。
最后,越来越多带商业许可的大规模数据集——今天的 EgoSuite-Open100K,以及过去几周的若干类似公告——再次证明,获取真实的人类数据,而不仅仅是合成数据,正在成为机器人和具身 AI 的战略重点,其重要性不亚于算力之于大语言模型。
来源
- Claude Platform — GA computer use、browser tool、Skills API、Files API
- Slack 中的 GitHub Copilot
- Teams 中的 GitHub Copilot
- DeepSeek-V4-Flash-Vision-Exp
- Pika Speech
- Pika Speech 架构详情
- EgoSuite-Open100K
- EgoSuite Hugging Face 转载
- Mythos 5 上的 Claude Security
- GPT-5.6 Sol 降价(API)
- GitHub Copilot 中的 GPT-5.6 Sol -50%
- Code Arena: WebDev 上的 GLM-5.3(Max)
- Harvey Tenet
- Georgia Tech 追溯 Olmo 3 社交推理的起源
- ASR 中的 benchmark optimization 偏差
- SenseNova-U1.5-8B-MoT
- Diffusers 0.40.0
- Google DeepMind × Fenris Creations
- Runway Ruby
- ARC-AGI-3 上的 NVIDIA AVO
- HeyGen Look Packs
- Amp 解释使用情况
- v0 Vercel Connect
- Codex / ChatGPT Work 共享线程
- GPT-Image-2 透明背景
- Zed × Antigravity
- trackio 0.36
- Google DeepMind 眼中的全栈 AI
- GitHub — 已屏蔽用户管理
- GitHub — 侧边栏固定
- Manus — 延长免费访问
- Manus — 保存提醒
- Genspark — 促销
- NVIDIA — agentic 技术栈安全
- NVIDIA — DGX Spark 西雅图黑客松
- NVIDIA Cosmos 3 — post-training
- DGX Station — Qwen3.8-27B
- Luma Labs — Summer Signal
- Synthesia 登上 Forbes
- Qwen3.8-27B — SGLang 食谱
- Qwen3.8-27B — Unsloth
- Qwen3.8-27B — Cline 第 1 名
- Qwen3.8-Max — Kilo Code
- Kimi Work — 金融分析师教程
- GLM-5.3 — DeepSWE 得分
- GLM-5.3 — WorkBuddy
- GLM-5.3 — Z.ai Build Week
- GPT-5.6 Sol — 第三方折扣