ai-powered-markdown-translator从法语翻译成中文,使用 gpt-5.4-mini。
8月24日 既是硬件的一天,也是模型的一天。NVIDIA 在同一轮 Hot Chips 发布了三项基础设施公告——Vera Rubin NVL72 的硅上首次实测、Groq 3 LPX 进入量产、以及通过 NVLink Fusion 向第三方芯片开放平台。Alibaba 推出 Wan 3.0,可一次生成 30 秒原生视频。还有两家非美国实验室在同一天与国家级机构同台亮相:Mistral 与沙特 HUMAIN,Sakana AI 与日本防卫省。再加上 Anthropic 面向 MCP 连接器的企业授权正式可用、GPT-5.6 进入 Kiro,以及一系列语音代理相关发布。
Wan 3.0 一次生成原生 30 秒
8月24日 — Alibaba 推出 Wan 3.0,这是其视频模型的新一代。最直观的变化在于时长:该模型可一次生成 30 秒原生视频,无需拼接连续片段(stitching)。此前,想要超过十几秒通常必须先生成多个片段再拼接,这会在光照、纹理和人脸一致性上带来漂移问题。
第二个方向是多模态输入。Wan 3.0 支持最多 20 个参考资产,并在图片、音频和视频之外还能解析文档和网页——官方页面将其称为全模态创作(Omni-Creation)。实际使用中,更像是把品牌资料包交给它,而不是只给一段文字描述。
此外,该模型还能原生生成同步音频:人声、音效和环境声与画面同时生成,而不是事后补配。对于静态图像,Wan 3.0 可将最多 9 张图片融合成单一构图,并生成最多 12 张风格与主体保持一致的连续图像,这显然是冲着分镜和广告物料衍生而来。
还有两项不那么“炫”的能力在专业场景中很重要:支持 12 种语言的长文本渲染,覆盖图表、公式和信息图,而视频模型通常在这些地方表现不佳;以及精确的色彩控制,这对满足品牌规范至关重要。
当日生态也同步跟进:Wan 3.0 上线首日即已在 fal、Leonardo.Ai、Scenario、RunningHub、Venice、TapNow、DeeVid、Pixmax 以及通过 Pika API Club 提供。
| 宣称能力 | Wan 3.0 的价值 |
|---|---|
| 原生时长 | 一次生成 30 秒,无需拼接 |
| 参考资产 | 最多 20 个,支持解析文档和网页 |
| 音频 | 与画面同步,原生生成 |
| 文本渲染 | 12 种语言的长文本(图表、公式、信息图) |
| 图像融合 | 最多 9 张图片合成一个构图 |
| 图像序列 | 最多 12 张风格与主体一致的连续图像 |
NVIDIA 在 Vera Rubin NVL72 上测得每瓦工作量最高达 30x
8月24日 — 借 Hot Chips 大会之机,NVIDIA 发布了 Vera Rubin NVL72 的首批硅上性能实测数据。重点数字直接指向数据中心经济性:在 DeepSeek V4 Pro 模型上,每兆瓦吞吐量最高可达 GB300 NVL72 的 30x,且每百万 token 成本最多低 35x。
方法学重点与结果同样重要。NVIDIA 排除了传统推理测试——那类测试通常以 1,000 到 8,000 token 的序列为基准:而在代理式会话中,上下文会不断累积,输入可达到数十万 token。因此,这些测试使用了 SemiAnalysis AgentX,一项记录下来的真实代理式编码会话负载,保留了工具调用和子代理。另有两个说明:这些数字仍待 SemiAnalysis 审核,而且还未计入 Vera CPU 的贡献。
其依据来自一项 OpenRouter 统计:代理式负载消耗的 token 数是普通聊天请求的 15x。对于受能源约束的 AI 工厂而言,问题被直截了当地表述出来——每兆瓦吞吐量决定营收,每百万 token 成本决定利润率。DSX MaxLPS 技术还可以在相同兆瓦预算下额外配置最多 40% 的 GPU。
这些提升来自一整套推理优化的叠加:将上下文处理与回复生成分离的解耦服务、带分级卸载的分布式 KV 缓存、如 MegaMoE 之类的融合 CUDA 内核,以及把权重压缩到 4 bit 的 NVFP4 量化。完整平台共七颗芯片,包括 Rubin GPU。
| 实测对比 | 宣称提升 |
|---|---|
| Vera Rubin NVL72 对比 GB300 NVL72(每兆瓦吞吐量) | 最高 30x |
| Vera Rubin NVL72 对比 GB300 NVL72(每百万 token 成本) | 最多便宜 35x |
| GB300 NVL72 对比 Hopper(每兆瓦吞吐量) | 最高 15x |
| DSX MaxLPS | 在相同兆瓦预算下增加 40% GPU |
Groq 3 LPX 进入全面量产,Nebius 和 SpaceXAI 采用 Vera Rubin
8月24日 — 同一轮 Hot Chips 的第二项内容:NVIDIA Groq 3 LPX 机架级系统在 Vera Rubin NVL72 的扩展中正式进入全面量产。
基准数字来自 Artificial Analysis 对 Gemma 4 31B 的测试:在 100,000 token 的长上下文下,每秒输出 3,400 token,是最接近的替代平台的 4x。其瞄准的问题有明确名称——解码延迟:代理按 token 逐个生成回复,任何单次延迟都会在整个工作链中被放大。
角色分工非常清楚:Rubin GPU 负责大规模上下文处理,LPX 加速对延迟敏感的解码。一个机架可容纳 256 个 LP30 加速器,并通过芯片到芯片的直接链路互联。
文中提到了三个采用方。Nebius 是首个将 Groq 3 LPX 集成进其 Token Factory 的 AI 云;CoreWeave 正在生产环境中部署 Spectrum-X Multiplane,用于互联其 Vera Rubin 机架;而 SpaceXAI 则采用 NVIDIA Vera CPU 负责编排、工具调用以及代理式 AI 背后的代码执行,并计划以 Vera Rubin 为核心构建其架构,从地面数据中心一直延伸到轨道卫星。
在网络层面,突破当前最大集群此前通常需要第三层级,这会在布线、光模块、能耗和延迟上付出高昂代价。Spectrum-X Multiplane 则把每台服务器的连接拆分为多个独立路径或平面,每个平面运行自己的两层网络。
| 测量项目 | 宣称数值 |
|---|---|
| Groq 3 LPX 在 Gemma 4 31B、100k 上下文 | 输出 3,400 token/s,为最接近平台的 4x |
| Groq 3 LPX 机架 | 最多 256 个 LP30 加速器,芯片到芯片链路 |
| Spectrum-X Multiplane | 两层网络下可达 512,000 GPU |
| 八个平面中的一个失效 | 约保留 90% 带宽 |
| 硬件恢复 | 比软件均衡快 11x,产出高 1.6x |
🔗 Groq 3 LPX、Spectrum-X 与 NVLink Fusion
NVLink Fusion 将定制芯片接入 NVIDIA 平台
8月24日 — NVIDIA 当天的第三篇文章:NVLink Fusion 让定制芯片(XPU)进入一个可扩展到 72 个加速器的 NVLink 域。第六代 NVLink 的端到端延迟比基于标准 Ethernet 的方案低 3x,数据包吞吐高 10x;路线图还宣布了最高可达 1,152 个加速器的域以及共封装光学。NVLink-C2C 可将 XPU 连接到 Vera CPU 或其他 CPU,能效最高比 PCIe 接口高 6x。
其核心论点是解耦:AI 工厂的规划——能源、建筑、制冷、机架、网络——在加速器组合最终确定之前就已启动,而锁死在单一芯片上的数据中心会成为排期风险。采用方可以复用 MGX 机架架构及其供应链。列出的合作伙伴包括 Intel、MediaTek、GUC、QCT 和 Annapurna Labs。
Mistral 与 HUMAIN 签署协议,在沙特推进主权 AI
8月24日 — Mistral 宣布与沙特人工智能公司 HUMAIN 达成战略合作:涵盖算力基础设施、先进模型开发,以及在沙特王国和地区内的解决方案部署。根据 Mistral 的说法,这项合作金额达数亿欧元。
初期重点是网络安全和语音,并将推出在阿拉伯语方面表现强劲的前沿模型。Mistral 将探索使用 HUMAIN 数据中心满足其本地算力需求,而双方也将共同面向沙特的受监管行业。此次公告延续了今年夏天开始的一系列动作——先是与 Microsoft 扩大战略合作,随后在 8 月初推出 European Compute Units——而新闻稿也明确指出,这些属于前瞻性声明,后续仍取决于商业协议。
Control is becoming the defining topic in enterprise AI adoption. Across the world, and especially in regulated industries, organizations want the benefits of AI without giving up control over their sensitive data and systems.
🇨🇳 控制正在成为企业采纳 AI 的决定性议题。无论在世界何处,尤其是在受监管行业中,组织都希望获得 AI 的好处,同时又不放弃对自身数据和敏感系统的控制。 — @MistralAI 在 X 上
🔗 @MistralAI 公告 · Mistral 博客文章
Sakana AI 取得日本防卫省合同
8月24日 — Sakana AI 公布了一份于 7月29日 与日本防卫省(防衛省)签署的合同,内容涉及对综合分析行动所需 AI 功能的研究与验证。该项目面向情报局的分析官,涵盖三个方向:收集、分析能力和文档管理。所使用的核心组件是该实验室的 AI 代理技术。
这并非其首个防务合同:2026 年 3 月,这家东京实验室已因指挥与控制系统的基础技术而中标。对于一家对外形象建立在开放模型之上的公司而言,这条轨迹值得注意——其博客如今已有专门的防务与情报栏目,而 Sakana AI 也正在为该团队招聘。
「Sakana AI株式会社は、令和8年7月29日、防衛省と「総合分析業務に必要なAI機能の調査・実証」に関する契約を締結いたしました。」
🇨🇳 Sakana AI 于 2026 年 7 月 29 日与防卫省签署了合同,内容是研究并验证综合分析行动所需的 AI 功能。 — Sakana AI,官方博客
Anthropic 让 MCP 连接器的企业授权正式可用
8月24日 — 企业托管授权(enterprise-managed auth)现已在 Claude Team 和 Claude Enterprise 上针对 MCP 连接器正式可用,此前在 6 月曾开放测试。解决的问题很具体:此前接入一个 MCP 连接器需要两步——管理员先为组织启用它,然后每个用户都要为每个工具走一遍 OAuth 流程。现在管理员只需通过企业身份提供商一次性授权,用户看到的工具就已经连接好了。
有一点值得安全团队关注:管理员可以强制某个连接器始终通过身份提供商,这样就能避免把个人账户连到工作工具上。发布时支持 10 个 MCP 提供商——Asana、Atlassian、Canva、Datadog、Figma、Granola、Linear、Notion、Slack 和 Supabase——而目前唯一支持的 IdP 是 Okta。这个机制并非专有:这是 Model Context Protocol 的 Enterprise-Managed Authorization 扩展的首个实现。
🔗 @ClaudeDevs 公告 · Anthropic 博客文章
Boris Cherny 将网络安全拒绝视为缺陷
8月24日 — 在他谈论三个能力层级的第二天,Claude Code 负责人回应了开发者在安全领域经常提出的两个问题。第一个是关于是否存在偏向内部模型的猜测:团队使用的 Fable 与最终用户完全相同。
第二个则更直接:由网络安全主题触发的拒绝被认定为一种缺陷,措辞并未加以淡化,团队正在努力减少这类情况。对于做防御性安全或 CTF 的从业者来说,这是一条有用信息,因为他们经常在合法请求上遭遇拒绝。虽然没有给出时间表,但这一表态延续了 8 月关于 Fable 5 生物安全护栏的更新,而那次更新本来就旨在减少误报。
We use the same exact Fable. Cyber security refusals suck, and we are working on reducing them. More to come.
🇨🇳 我们使用的就是完全相同的 Fable。网络安全方面的拒绝很烦人,我们正在努力减少它们。后续还会有更多内容。 — @bcherny 在 X 上
Anthropic 开始自动维护自己的应用
8月23日——在被要求更准确地说明他所说的“编码”是什么意思时,Boris Cherny 给出了一个简单的区分:coding 是写代码这件事,engineering 则是在这之上的其余一切。他承认,把工作拆分为战术性工作和战略性工作,是另一种同样成立的理解框架。
真正带来新信息的是他消息的结尾。他称自己看到部分战略性工作开始被自动化,并给出一个具体例子:Anthropic 开始自动维护自己的应用,而且越来越多的客户也在这么做。这里的措辞很关键——这不再是按需生成代码,而是让 agent 负责生产环境中应用的日常维护:依赖更新、修复、适配 API 变化。这里用的动词描述的是一个正在推进的部署,而不是既成事实,而且没有给出任何数字、任何点名的应用或准确的范围。
🔗 @bcherny 关于 coding 和 engineering 的帖子
使用 Claude Code 自动生成的每周商业 digest
8月24日——Anthropic 发布了一篇关于 Claude Code 在软件开发之外的内部用途的文章:一位一线市场营销人员讲述了她如何把周一早上 15 分钟的站会,替换成一份个性化的每周 digest,并通过 Slack 消息发给每位销售。
其架构并不复杂:Claude 通过 MCP 连接到 BigQuery,数据仓库作为营销数据的事实来源。方法比技术更值得借鉴:试点从一个自愿参与的团队开始,每一条来自接收者的纠正反馈都被转化为 prompt 中的一条明确规则;到第一周结束时,这份 prompt 已经包含 9 条内容规则,而且每一条都能追溯到具体反馈。由于每条消息都基于收件人的客户名单生成,因此没有两条消息会完全相同;随后 BDR(business development representatives)也提出要自己的版本。
🔗 使用 Claude Code 的个性化每周 digest
GPT-5.6 登陆 Kiro,AWS 的开发 agent
8月24日——完整的 GPT-5.6 系列——Sol、Terra 和 Luna——现已可在 AWS 的软件开发 agent Kiro 中使用。主打卖点不是原始能力,而是性价比:在由 OpenAI 和 AWS 共同进行的 Terminal-Bench 2.1 测试中,GPT-5.6 Terra 在完成成功任务时,成本约降低了 82%。
其背后的解释在于 Kiro 的方法——基于规格的开发(spec-driven development):工具将高层意图转化为需求、技术设计和可执行任务,从一开始就把模型锚定在具体上下文中,并减少跑偏。OpenAI 还细化了目标用途:结构化实现计划、多步骤代码任务、仓库上下文、变更应用前的检查点。对于关注代码 agent 生态的人来说,这则公告最重要的意义在于:GPT-5.6 系列正在 OpenAI 的表面之外扩散。
Codex 获得带有 Chrome DevTools Protocol 访问权限的开发者模式
8月24日——ChatGPT 和 Codex 的更新日志迎来了一波围绕 agent 驱动浏览器的新品。最重要的是 Browser use 的开发者模式,在 Chrome 以及 Codex 内置浏览器中都可用:它授予对 Chrome DevTools Protocol 的受控访问,这正是 Chrome 开发工具所使用的接口。这样一来,agent 就能分析性能并调试网络流量、控制台输出和页面状态,而不再只局限于读取屏幕上显示的内容。
同一协议也带来了速度提升:借助减少与浏览器来回交互的 DOM 快照,Browser use 的速度最高可提升 2 倍。计划任务现在遵循所选的审批模式,修复了无人值守执行时一个令人头疼的偏差。
| 更新日志中的新内容 | 宣称的范围 |
|---|---|
| Browser use 开发者模式 | Chrome 和 Codex 内置浏览器,受控 CDP 访问 |
| Browser use 加速 | 最多快 2 倍(CDP 优化与 DOM 快照) |
/init 命令 | 编写应用,与 Codex CLI 行为一致 |
| Computer Use | EEA、英国和瑞士以外的企业 |
| Windows 下的 Computer Use 控制 | 可按应用单独配置 |
Gemma 4 Good Challenge 的获奖者
8月24日——Google 发布了 Gemma 4 Good Challenge 的结果。这是一项 Kaggle 竞赛,邀请开发者使用其开放模型处理现实问题:6 周内提交了超过 1600 个项目。难点与其说在模型质量,不如说在受限环境中的部署,参赛者动用了 LiteRT、Cactus、Ollama、llama.cpp 和 Unsloth,让项目能在普通硬件上运行。
获奖项目的共同主线是离线运行与隐私优先。GEM-4 获得第一名:它为老年人和残障人士提供一个机器人助手,Gemma 4 31B 用于标注训练视频序列,经过微调的 E2B 控制器则把观察结果和指令转化为动作。在专项奖中,Gem-Care 通过微调 Gemma 4 E2B 来重建非标准语音,使词错误率从 32.7% 降至 19.0%;PreVillage 则在 Raspberry Pi 5 上,以每秒 7.5 个 token 的速度,用罗马化尼泊尔语进行对话路由。
🔗 Gemma 4 Good Challenge 的获奖项目
ADK 原生评估语音 agent
8月24日——Google 的 Agent Development Kit 现已支持实时和语音 agent 的评估,与文本 agent 处在同一个闭环中。原理是:用户模拟器通过 Gemini TTS 朗读自己的回合,再流式传给 agent,而其口头回答会被自动评分。只要存在一个 live_model_config 块,实时模式就会被激活;没有它时,同样的测试案例就会以文本模式运行。
测试案例分为两种风格:场景式,即 persona 按照计划即兴发挥自己的回合;以及固定对话,即逐字脚本化的对话。评分通过由自然语言 rubric 驱动的 LLM 裁判完成,rubric 只需编写一次,随后应用到整个测试套件。执行可通过 adk eval 或 AgentEvaluator 进行,这使得在 CI/CD 流水线中插入语音评估成为可能。ADK Web 新增了标准模式与实时模式之间的切换,可从音频流重建转录,并为每个回合附加一个可播放的音频片段。
Grok Voice Think Fast 2.0 登上 Speech-to-Speech 排行第一
8月24日——xAI 宣布,Grok Voice Think Fast 2.0 在 Artificial Analysis 的 Speech-to-Speech 指数中位居第一。这个指数衡量的与其说是输出语音的质量,不如说是语音 agent 对所听内容进行推理、解决真实客户问题,以及通过调用工具完成任务的能力。
这并不是一个今天才出现的模型:它的介绍文章早在 7 月 29 日就已发布。xAI 这里公布的是排名和生产数据。在同属一集团的 Starlink,Grok Voice 每天处理超过 15,000 通支持和销售来电,并且每周完成超过 3,000 笔订单,语音和聊天合计。Think Fast 系列把推理与语音合成并行执行,从而避免把智能成本体现在延迟上。
| 基准 | Think Fast 2.0 | GPT-Realtime-2.1 (High) | Gemini 3.1 Flash (High) |
|---|---|---|---|
| AA Speech-to-Speech 质量指数 | 82,9 % | 79,1 % | 69,5 % |
| τ-voice Bench(agent 性能) | 56,5 % | 45,7 % | 37,7 % |
| 到第一声的时间 | 0,70 s | — | 2,98 s |
🔗 @SpaceXAI 公告 · x.ai 帖子
ElevenLabs 把整个 API 都搬进了终端
8月24日——ElevenLabs 发布了其 CLI 的 1.0 版,把完整 API 暴露在终端中。公告面向两类人群:开发者和代码 agent。
这种双重定位体现在技术选择上。命令文档经过设计便于发现,agent skills 被直接集成进工具中,输出也提供结构化 JSON——这三点都是让 agent 能可靠地操控工具、而不是去解释自由文本的前提。dry run 模式则完善了这一套:它允许在执行某个操作之前预览结果,当触发调用的是自主 agent 时,这是一道有用的安全阀。该发布延续了编辑器于 8 月 17 日推出的官方 MCP 服务器。
MiniMax 在 GMI Cloud 上开放 14 天无限访问
8月24日——从 8月24日到9月6日,MiniMax 在 GMI Cloud 上开放其模型的无限访问:语言侧有 M3 和 M2.7,音频侧有 Speech 2.8 和 Music 3.0。
值得注意的地方超出了商业推广本身。8 月 21 日,MiniMax 只是发布了一则含糊其辞的公告,暗示 M3 模型即将到来,但没有规格也没有日期。三天后,M3 已经以带日期的方案正式可用,同时还有两个此前供应商通讯中未曾出现版本号的音频模型。公告没有附带任何 benchmark 或技术规格:这是一项开放提供,而不是产品说明书。
快讯
- Nemotron 3.5 Lightning 进入 PinchBench 前 4——NVIDIA 模型在标准化 OpenClaw agent 测试中,以 86.4% 的平均成功率跻身开放权重模型前 4;Nemotron 3 Ultra 仍居第一。🔗 @NVIDIAAI 推文
- Wan 3.0 已可通过 Pika API Club 使用——该聚合器于 8 月 5 日上线,通过单一 API 提供一百多个模型的访问。首日加入延续了 8 月 17 日 Seedance 2.5 已体现出的逻辑。🔗 @pika_labs 推文
- Runway 将 Ruby 扩展到其平台上的所有模型——Seedance 2.5、Gen-4.5 或 MiniMax H3 的输出现在都可转换为 16 位 EXR 或 ProRes 与 HEVC 的 10 位和 12 位格式,无需为不同生成器单独建立调色链。🔗 @runwayml 推文
- Runway 在旧金山开启线下 hackathon——9月30日 举办,重点面向 agent 和应用构建;报名通过 hackathon.runway.com。🔗 @runwayml 推文
- Boris Cherny 认为 prompt 注入已经被证明可以解决——他继续谈代码无 bug 生成,并引用了前例:对齐训练与机制可解释性的结合,最终在多年之后解决了这一问题。🔗 @bcherny 帖子
- GitHub 将于 8 月 25 日举办围绕 Copilot app 的 Webinar——与 Pierce Boggan 和 James Clancey 一起进行下午 6 点到 7 点 CEST 的现场演示;报名页面详细介绍了 Agent Merge,它支持 rebase、审查以及 merge 前的检查。🔗 @github 推文
- GitHub 强调其播客第二季——展示主持人及其上一季最喜欢的几期节目的视频,没有产品公告。🔗 @github 推文
- Nous Research 门户中的 Grok 4.6 半价——为期一周的 50% 折扣,可与开源 agent Hermes 一起使用,或通过现有的 SuperGrok 或 X Premium+ 订阅使用。🔗 @SpaceXAI 推文
- Codex Live Build 强调语音驱动——与创作者 Alex Finn 在 X 上进行的直播,聚焦在电脑和移动端 Codex 中无键盘工作。仅为演示,没有功能发布。🔗 @OpenAIDevs 推文
- HeyGen 发布房地产视频的 prompt 指南——为电影级质量的 avatar 视频撰写 prompt,延续其房地产系列。🔗 @HeyGen 推文
- 借助 Maps、Search 和 Gemini 庆祝美国国家公园 110 周年——Google 结合其搜索趋势(“新手徒步”相关查询在一个月内增长 165%)以及 AI Mode、Ask Maps 和 Gemini Live 在旅行规划中的使用。没有新功能。🔗 blog.google 博客文章
这意味着什么
在连续几天聚焦软件用途之后,硬件重新回到舞台中央——而它衡量的东西已经变了。NVIDIA 明确放弃了那些以 1,000 到 8,000 个 token 序列为基准校准的推理指标,转而采用真实、已记录的代理式编码会话,包括不断增长的上下文、工具调用和子代理。计量单位也随之转移:不再是单纯的原始吞吐量,而是每兆瓦的工作量,以及每百万 token 的成本。约束不再是可用的硅,而是我们能供给它的能源。GPU/LPU 的分工从另一个角度说明了同一件事:一边处理上下文,另一边进行对延迟敏感的解码,因为代理式推理已经不再是一种同质化负载。
当天的第二个信号是平台的开放。NVLink Fusion 连接了由其他厂商设计的芯片,SpaceXAI 采用 Vera CPU,Intel、MediaTek 和 Annapurna Labs 也出现在合作伙伴名单中。商业论点在于时间表:一座 AI 工厂必须提前规划——能源、建筑、散热、网络——远早于加速器组合最终敲定;而出售机架、网络和配套工具,而不只是单一加速器,意味着即便面对自研硅片的客户,也能变得不可或缺。
更出人意料的是,主权在同一天占据了两项公告。Mistral 宣布与 HUMAIN 合作,面向阿拉伯语模型并使用沙特数据中心;Sakana AI 则与日本防卫省签约,开展情报分析。两个非美国实验室,两个国家机构,同一种逻辑:Mistral 所说的控制,以及日本政府所称的信息力量,指的都是在所选司法辖区内执行训练与推理的能力。对 Sakana 而言,其公开身份建立在开放研究之上,专门的防务栏目以及相关招聘表明这是一条长期业务线,而非一次性合同。
还有一条不那么显眼却前后一致的线索:工具链正在被构造成由代理而非仅由人来驱动。ElevenLabs 发布了一个 CLI,其卖点——可发现的命令、结构化 JSON、dry run 模式——明确面向代码代理。Codex 获得了 Chrome DevTools Protocol 的访问权限,也就是说,它可以读取网页的真实状态,而不只是其渲染结果。ADK 提供原生的语音评估,使说话型代理不再只能靠感觉交付。Grok Voice 则公布了生产量——Starlink 每天 15,000 次调用——而不再只是一个排行榜分数。每一次,都是同一个转折:要走出原型阶段,就需要可机器操作的接口和可重复的衡量方式。
来源
- Wan 3.0 — 官方页面
- NVIDIA — Vera Rubin NVL72 和代理式负载
- NVIDIA — Groq 3 LPX、Spectrum-X 和 NVLink Fusion
- NVIDIA — NVLink Fusion 和 XPU
- NVIDIA — Nemotron 3.5 Lightning 在 PinchBench 上的表现
- Mistral 和 HUMAIN — 官方公告
- Mistral — 关于与 HUMAIN 合作的 X 公告
- Mistral — 控制作为决定性议题
- Sakana AI — 面向防务的集成分析
- Sakana AI — X 上的公告
- Anthropic — 面向 MCP 连接器的企业管理认证
- Anthropic — 关于企业管理认证的 X 公告
- Boris Cherny — 在网络安全领域的拒绝
- Boris Cherny — 编码、工程与自动维护
- Boris Cherny — 将 prompt 注入视为可解决的问题
- Anthropic — 使用 Claude Code 的个性化每周摘要
- OpenAI — Kiro 中的 GPT-5.6
- OpenAI — ChatGPT 和 Codex 更新日志
- OpenAI — 与 Alex Finn 一起的 Codex Live Build
- Google — Gemma 4 Good Challenge 的获奖项目
- Google — 在 ADK 中评估语音代理
- Google — 美国国家公园 110 周年
- xAI — Grok Voice Think Fast 2.0
- xAI — X 上的语音到语音排行榜
- xAI — Nous Research 门户中的 Grok 4.6
- ElevenLabs — CLI v1
- MiniMax — GMI Cloud 14 天无限访问
- Runway — 向所有模型扩展 Ruby
- Runway — 旧金山黑客松
- Pika — API Club 中的 Wan 3.0
- HeyGen — 房地产视频提示词指南
- GitHub — Copilot 应用网络研讨会
- GitHub — 播客第二季