ai-powered-markdown-translator由 gpt-5.4-mini 将文章从法语翻译成中文。
2026 年 8 月 12 日,NVIDIA 宣布达成总额超过 5000 亿美元的融资合作,用于打造下一代 AI 基础设施;与此同时,Alibaba 发布了 Qwen3.8-2.4T-A95B 的开源权重,这是一款拥有 24000 亿参数的推理模型。Zed 推出 Delta,这是一款用于借助智能体编码的多人协作环境;Google DeepMind 在 Pixel 11 上推出 SL2T,用于将手语翻译为文本;而 Suno 则与 BMG 签署了全球合作伙伴关系。还有:Cohere 和 Liquid AI 发布新的开源模型,开发工具方面也有进展(Devin、Replit、GitHub Copilot),以及 OpenAI 关于企业中代理式 AI 采用情况的一项研究。
NVIDIA 为 AI 基础设施 जुट集超过 5000 亿美元
8 月 12 日 — NVIDIA 宣布与六家金融与投资领域的重要机构——Apollo、BlackRock、Blackstone、Brookfield、Goldman Sachs 和 KKR——建立合作,准备搭建独立的融资平台,动员超过 5000 亿美元的第三方资本。目标是在长期内支持“AI factories”的建设,即用于模型训练与推理的大型数据中心。
NVIDIA 将这一举措描述为整个行业的结构性转折点:AI 计算能力部署的资金支持不再仅仅依赖科技公司的资产负债表,而将越来越多地由专门的融资载体承担,这些载体由一流金融机构而非仅仅是行业巨头推动。
这一公告延续了 NVIDIA 近几天围绕基础设施的其他举措:面向未来几代加速器的 800 伏直流供电架构,以及美国国家科学基金会(NSF)面向 AI 的区域枢纽计划。它也印证了支撑计算需求所需资本规模之大——在各大云服务提供商都在加速 AI 基础设施竞赛的时刻,这一点尤为明显。
Alibaba 发布 Qwen3.8-2.4T-A95B 的开源权重,这是一款 2400 亿参数的推理模型
8 月 12 日 — Alibaba 发布 Qwen3.8-2.4T-A95B 的开源权重。该模型是其在本月初以 Qwen3.8-Max 之名预告的旗舰模型。这里发布的是实际可用的权重:一款细粒度 Mixture-of-Experts 模型,总参数达 2400 亿,其中每个 token 激活 950 亿参数,面向高要求的推理与智能体任务。
该架构在完整注意力层与线性注意力层之间交替:前者负责 token 之间的相互作用,后者依托受限的循环状态,在上下文增长时控制内存占用。该模型支持最长 100 万 token 的上下文窗口,输出长度可达 128K token,并内置可配置的推理深度控制(low/high/xhigh),以便根据任务在计算成本与回答质量之间做权衡。
NVIDIA 在一篇专门的技术博文中详细介绍了部署情况,称该模型在 GB300 NVL72(72 块 Blackwell Ultra GPU)上以 FP8 精度可实现超过每 GPU 每秒 4000 token 的原生吞吐量,并计划引入 NVFP4 优化。
| 测量指标 | 测量值 |
|---|---|
| 总参数 / 激活参数 | 2400 亿 / 950 亿 |
| 上下文窗口 | 最长 100 万 token |
| 每 GPU 吞吐量 | 超过 4000 token/s(GB300 NVL72,FP8) |
| 每用户吞吐量 | 超过 350 token/s |
| 权重可用性 | Hugging Face、ModelScope |
权重已在 Hugging Face 和 ModelScope 上提供,并支持通过 SGLang、vLLM、NVIDIA Dynamo 和 NVIDIA NIM 部署;也可通过 NVIDIA NeMo AutoModel 进行微调(LoRA 和 SFT)。
🔗 NVIDIA 在 X 上的公告 · NVIDIA 技术博文
Zed 推出 Delta:用于借助智能体编码的多人协作环境
8 月 12 日 — Zed 发布 Delta,这是一款用于借助智能体编码并审阅其产出内容的多人协作环境。该产品基于 DeltaDB,后者是 7 月初以“代码版 Google Docs”之名进入早期访问的数据库。Delta 是它的首个实际应用,并从 8 月 12 日起开始发出首批私人测试版邀请。
在 Delta 中,与智能体的对话本身就是一份文档:光标可在整个线程中自由移动,并使用与代码编辑器相同的快捷键。若要对某个具体点做出回应,只需把光标放到那里然后开始输入,线程中的任何内容都触手可及。
复审发生在工作实际进行的地方:编写代码的智能体会一直留在线程中,因此你可以直接向它提问,而不必通过 diff 去推断它的意图。一个线程可以一键分享,队友则像完整参与者一样加入其中——他们可以浏览历史、共同编辑提示词,或者几天后再接手工作,而无需怀疑最后一版代码是否已经提交。
Delta is built on DeltaDB, which keeps your code and conversation in sync for everyone in the thread, in real-time. It works with the git repo you already have. Every edit and conversation is captured between your commits.
🇨🇳 Delta 基于 DeltaDB,后者让代码和对话在整个线程中实时同步,所有人看到的都是一致的内容。它可以直接与你已有的 git 仓库协同工作。每一次编辑和每一段对话都会在你的提交之间被捕获。 — @zeddotdev 在 X 上
Zed 会在接下来的几周逐步扩大邀请范围;等待名单现已开放。
🔗 X 上的公告
SL2T:Google DeepMind 在 Pixel 11 上将手语翻译为文本
8 月 12 日 — Google DeepMind 发布 SL2T(sign-language-to-text),这是一款可将手语直接转换为书面文本的模型。该功能来到 Android:用户现在可以直接在 Gboard 和 Live Transcribe 中用手语输入,而不必打字,用于网页搜索、撰写消息或向 Gemini 发送查询。
从技术上说,该系统基于在设备端运行的 MediaPipe Holistic 模型,追踪的是身体姿态(双手、手臂、躯干、头部、面部)而不是录制原始视频——原始视频会被立即删除,只有姿态的几何坐标会被发送到服务器进行翻译。这一选择既保护隐私,又能直接把坐标翻译为文本,而无需经过中间标注,从而避免了现有系统在精度上的限制。
该模型使用超过 10 万小时的数据进行训练,覆盖 50 多种手语,其中约 25% 为美国手语(ASL)。在 FLEURS-ASL 基准上,SL2T 取得了 70 BLEURT 的零样本成绩,Google DeepMind 称这一成绩显著高于此前报告的任何分数。
开发过程通过一个专门的咨询委员会让聋人社区在每个阶段都参与进来,该委员会共同撰写了一份影响报告,详细说明系统的能力与局限。该功能首先在 Pixel 11 上推出 ASL 到英语的转换,未来还会支持更多设备和手语。
SL2T is state-of-the-art on academic benchmarks, plus it’s optimized for real-world use like one-handed signing while holding a phone. To protect privacy, it tracks body poses on-device, while our servers translate them into text.
🇨🇳 SL2T 在学术基准上达到了最先进水平,并且针对真实使用场景进行了优化,比如一边拿着手机一边单手打手语。为了保护隐私,它在设备上追踪身体姿态,而我们的服务器则把这些数据翻译成文本。 — @GoogleDeepMind 在 X 上
Suno 宣布与 BMG 的全球合作伙伴关系
8 月 12 日 — Suno 宣布与 BMG(Bertelsmann Music Group)建立全球合作伙伴关系,后者是世界上主要的唱片公司和音乐出版公司之一。该公司将这一协议称为构建创意生态系统的“landmark”(里程碑),这一生态系统旨在让艺术家和词曲作者参与其中,而不是绕开他们。
这一合作发生在一个特殊背景下:Suno 在 2024-2025 年间曾被三大唱片公司——Universal Music Group、Warner Music Group 和 Sony Music——起诉,原因是其模型训练中未经授权使用了受保护录音。与 BMG 的协议因此标志着一种战略转向:从司法对抗转向与音乐产业进行协商许可,这一趋势在视频领域已由 Runway 与 Bertelsmann 于 7 月达成的协议率先出现——而 BMG 正是 Bertelsmann 的一部分。
该新闻稿并未披露协议的财务条款或确切范围(可用于训练的目录、权利人的报酬、面向 BMG 艺术家的工具等)。这些内容仍需等待 Suno 和 BMG 未来的官方沟通进一步说明。
🔗 X 上的公告
代理式开发工具:Devin、Replit、VS Code 和 JetBrains
8 月 12 日,多款 AI 辅助开发工具同步推进,在新模型可用性、基础设施控制以及智能体插件标准化等方面都有进展。
Grok 4.6 已可在 Devin 中使用,Cognition 将其排在 Opus 5 和 Fable 5 之后
Cognition 将 Grok 4.6(xAI,当天发布)加入 Devin 可用模型列表。团队将其定位为相较 Grok 4.5 的显著改进,在内部排名中把它排在 GPT-5.6 Sol 之前、而在 Opus 5 和 Fable 5 之后。Cognition 特别强调它在深入代码探索和修改前的根因分析方面表现突出——这对需要 Devin 在动手前先理解系统的复杂调试任务尤其有用。
🔗 X 上的公告
Replit 允许选择工作区的托管区域(Pro/Enterprise)
Replit 向 Pro 和 Enterprise 客户开放新工作区托管区域的选择,可在北美、欧洲和亚洲之间切换。目标有二:降低开发过程中的感知延迟,并让用户控制已发布应用的数据和预览所在位置,这在企业环境中经常是必需的(合规、用户就近等)。该功能是在现有的已发布应用区域选择基础上的补充,并立即面向符合条件的账户生效。
🔗 X 上的公告
Agent Plugins 1.0 登陆 VS Code、Copilot CLI 和 Copilot 应用
开放标准 Agent Plugins 1.0 于 8 月 6 日发布,由 AWS、Anysphere(Cursor)、Microsoft、OpenAI 和 Vercel 共同参与,之后 Google 也作为维护者加入,如今已来到 VS Code、Copilot CLI 和 Copilot 应用。一个一次打包的插件(智能体技能 + MCP 服务器)可以从 Awesome Copilot 市场安装,并在多个兼容客户端之间无需修改即可运行,而现有的 Copilot 插件也无需强制迁移。对于企业而言,治理通过 managed-settings.json 实现,该功能可在 Copilot Business 和 Enterprise 计划中使用。
JetBrains 版 Copilot 获得持久记忆和本地 Ollama 访问
GitHub Copilot for JetBrains 收到一次大版本更新:持久记忆 现在可以跨不同的智能体聊天会话保存并回忆有用信息,避免重复项目上下文或个人偏好。另一个值得注意的新增功能是,Ollama 变成了一个 BYOK(Bring Your Own Key)提供方,可在 JetBrains 的模型选择器中直接访问本地运行的模型。企业还获得了对插件可用性、MCP 访问权限以及权限绕过行为的服务器端控制。
开源模型与边缘 AI
在模型方面,多家实验室接连发布了针对本地推理和文档理解优化的开源版本。
Hugging Face:Transformers.js 月下载量突破 1000 万
Hugging Face 首席执行官 Clément Delangue 宣布,Transformers.js——一款可直接在浏览器中运行 AI 模型的库——月下载量已突破 1000 万,仅在六个月内就实现了接近 10 倍的增长,而且这三年来一直由内部团队开发。Delangue 将这一增长与更宏观的趋势联系起来:出于成本、隐私以及应对算力短缺的韧性等原因,越来越多的 AI 工作负载正在向本地迁移。该消息不包含额外技术细节:这是一则关于一个现有项目的增长公告。
🔗 官方推文
Ai2:OlmoEarth Studio 现在支持导出自定义嵌入向量
Ai2(Allen Institute for AI)为 OlmoEarth Studio 新增地球观测嵌入向量的计算与导出功能,提供三种变体:Nano(128 维,140 万参数)、Tiny(192 维,620 万参数)和 Base(768 维,8900 万参数)。这些向量以 Cloud-Optimized GeoTIFF 格式存储,可直接在标准 GIS 工具(QGIS、GDAL、rasterio)中使用。演示的用例包括相似性检索、few-shot 分割——一个基于 60 个标注像素训练的土地覆盖图可达到 0.84 的加权 F1——以及时序变化检测。模型和代码已发布在 Hugging Face 和 GitHub 上。
Liquid AI:面向边缘端的视觉-语言模型 LFM2.5-VL-3B
Liquid AI 发布 LFM2.5-VL-3B,这是一款 31 亿参数的视觉-语言模型,针对设备端推理进行了优化。它将 SigLIP2 400M 视觉编码器与 26 亿参数的文本骨干网络结合,并在约 34 万亿 token 上训练。在基准测试中,它在 MMBench 上取得 81.0%(上一版本为 80.0%),在 RefCOCO 目标定位上取得 87.9%,在 DocVQA 上取得 91.1%。速度方面:在 CPU(M5 Max)上可达 228 token/秒,在移动设备(Galaxy S26 Ultra)上可达 20 token/秒,内存占用约 3 GB。该模型可在 Hugging Face 上获取,并支持 llama.cpp、MLX、vLLM 和 SGLang 集成。
Cohere 推出 North Micro Vision,其最小的视觉语言模型
Cohere 扩展了其 North 模型家族,推出 North Micro Vision,这是截至目前其最小的视觉语言模型。该模型拥有 24 亿参数,专为复杂文档理解而设计,并以 Apache 2.0 许可开源发布,权重可在 Hugging Face 上获取。尽管体量较小,它仍支持原生分辨率视觉处理、图文结合的多轮对话、空间推理以及多语言图像理解。Cohere 表示,它在广泛的视觉理解基准上优于 Gemma 4 E2B 和 Ministral 3 3B,但在公告中并未提供具体数值。
🔗 X 上的公告
连接式助手:Gemini 和 Runway 扩展其集成
Gemini 新增 14 个连接应用
Google 正在扩展可直接从设置中连接到 Gemini 的应用列表:14 个新服务加入目录,包括 Zoho Bigin、Granola、Wix、GetYourGuide、Ticketmaster、OpenTable、Pandora、iHeartRadio、Thumbtack、Zocdoc 和 Otter.ai。服务连接后,只需向 Gemini 发出请求,例如“在 Zocdoc 上帮我找一个工作地点附近的眼科预约”,助手就会直接与该服务交互。该部署将在接下来的几周内逐步推进,延续 Google 将 Gemini 打造成通往多个第三方服务的单一入口的战略。
Runway 将 Agent 连接到 Figma、Dropbox 和 Notion
Runway 为其平台内置的生产力助手 Agent 新增了 Figma、Dropbox 和 Notion 连接器,以避免创意资产被孤立在各自分离的工具中。现在,Agent 可以直接将这些第三方平台中的设计、文件和文档同步到一个统一的工作空间中。该功能适用于 所有付费套餐,延续了 Runway 将 Agent 打造成连接现有创意团队工具生态的媒体生产中心枢纽的战略。
🔗 X 上的公告
OpenAI 关于企业采用代理式 AI 的研究
OpenAI 发布了两项关于企业使用 AI 的互补研究:一项是“Enterprise Signals”,对其客户中的代理式 AI 进行实践性概览;另一项是关于不同企业、岗位和资历层级的采用扩散的配套工作论文。核心结论是:AI 的使用正在从辅助转向执行。6 月,Codex 生成了 64% 的企业客户中 Codex 与 ChatGPT 合计产出的 token 量。最领先企业与其他企业之间的差距正在扩大:所谓“frontier firms”(按月使用量排名前 10%)如今每位活跃用户产生的输出 token 数量是典型企业的 8.3 倍,而 1 月时这一比例还是 2.6 倍。自 2 月以来,企业用户每周使用 Codex 的人数在法律领域增长了 108 倍,在销售领域增长了 41 倍,而在工程领域仅增长了 5 倍。
简讯
- Grok 4.6 已在 v0(Vercel)中可用 — 与 xAI 发布同日,v0 将 Grok 4.6 加入其应用生成模型选择器。🔗 推文
- Open_MOSS 发布 MOSS-VL 的 FP8/NF4 版本 — MOSS-VL-Instruct 和 MOSS-VL-Realtime 的量化版本,可用于仅有 24 GB VRAM 的本地推理。🔗 推文
- Google AI Studio 提供 8 月 12 日日全食的 3D 可视化器 — 实时追踪月球在地球仪上的阴影,并可从 Reykjavík 或 Valencia 模拟当地天空。🔗 推文
- GitHub Enterprise Server 3.22 进入 release candidate — 离线环境中的 Copilot CLI、Enterprise Teams 正式可用,以及针对 secret scanning 和 rulesets 更精细的控制。🔗 更新日志
- Rule insights 现已提供组织级别支持(公开预览) — rulesets 的审计仪表板从 repository 级别扩展到更高层级,并支持 CSV 导出。🔗 更新日志
- 分支保护规则自动迁移到 rulesets — 一个“Convert to ruleset”按钮可将传统规则自动转换为等效的 ruleset。🔗 更新日志
- Seedance 2.5 进入 Genspark 的 AI 视频代理 — 单次生成 30 秒内容,最多可使用 30 张参考图片和 10 段视频/音频片段。🔗 推文
- Genspark 与 Grant Thornton 合作——加速生成提案 — 该公司可基于单个 prompt 生成投标回应,并由人工进行系统性复核。🔗 推文
- GitHub Monthly Enterprise Roundup——2026 年 8 月版 — 该 roundup 强调 AI 正从代码补全转向端到端受治理的工程工作流。🔗 推文
- LTX-2.5 已登陆 Runway — Lightricks 的开放世界模型于 8 月 11 日发布,现已加入 Runway 的模型目录。🔗 推文
- FLUX 3 已登陆 Luma — Black Forest Labs 的首个统一多模态模型(图像、视频、音频)已来到 Luma,并支持原生视频转音频生成。🔗 推文
- Nemotron 3.5 Lightning 已在 Perplexity 的 Agent API 中可用 — NVIDIA 的开源 30B MoE 模型加入了 Perplexity 代理的高吞吐执行层。🔗 推文
- Qwen-Image-3.0 已在 OpenArt 上线 — 阿里巴巴的图像生成模型将其分发扩展到一个新的第三方平台。🔗 推文
- Qwen3.8-Max 在 Legal Research Bench 上升至第 4 名 — 该模型在这一法律研究专项排行榜中从第 22 名升至第 4 名。🔗 推文
- Daybreak 模型(网络安全)可通过 Amazon Bedrock 使用 — 获授权的防御者可直接在 Bedrock 控制台访问 OpenAI 的 Daybreak Blue 和 Daybreak Red。🔗 OpenAI
这意味着什么
AI 基础设施融资正在扩大规模:NVIDIA 从传统金融机构(Apollo、BlackRock、Goldman Sachs、KKR 等)筹集的 5000 亿美元,标志着融资模式从仅依赖科技公司资产负债表,转向专门的资本工具。这一宏观经济动向又与更具体的现实相互呼应:同日发布的 Qwen3.8-2.4T-A95B 在 NVIDIA GB300 基础设施上可原生以每 GPU 超过 4,000 个 token/秒的速度运行——资本胃口与算力需求相互滋养,每一个新的超大模型都在进一步证明已宣布投资的合理性。
开源权重仍在向各个规模层次扩展:从阿里巴巴 2,4000 亿参数的前沿模型,到 Cohere 24 亿参数的小型视觉语言模型,再到专为在手机上运行而设计的 Liquid AI 的 LFM2.5-VL-3B。按规模而非仅按性能进行的这种多样化,印证了 Hugging Face 所观察到的热度:Transformers.js 的月下载量达到 1000 万次,几乎是六个月前的 10 倍,证明本地推理正走出实验阶段,成为一种真正可用于生产的选项。
AI 辅助开发工具正汇聚为更丰富的协作形式。Zed 通过 Delta 将与代理的交互转化为共享且可版本化的文档,GitHub 通过 Agent Plugins 1.0 在 VS Code、Copilot CLI 和 JetBrains 之间标准化代理插件,而 Devin 与 v0 也在 xAI 发布 Grok 4.6 的当天将其集成。共同点在于:这些工具不再只是孤立的助手,而是正在成为可互操作的基础设施层,其中底层模型的选择和跨会话记忆的重要性,不亚于代码生成本身。
最后,AI 正更深入地融入日常使用场景和通过协商而非强加形成的产业关系。Google DeepMind 的 SL2T 直接在 Pixel 11 上翻译手语,并采用为隐私而设计的架构;Gemini 和 Runway 将其连接器扩展到数十个第三方服务;Suno 则与 BMG 签署许可协议,这与 2024-2025 年的诉讼形成鲜明对比——这表明音乐产业如今是在与生成式模型谈判,而非系统性地对抗它们。在企业侧,OpenAI 的研究确认,这种向代理式执行的转变已经在最领先组织与其他组织之间显著加深。
来源
- NVIDIA — 5000 亿美元融资合作
- NVIDIA — X 上的 Qwen3.8-2.4T-A95B 公告
- NVIDIA — Qwen3.8-2.4T-A95B 技术博客
- Zed — X 上的 Delta 公告
- Zed — X 上的 DeltaDB
- Google DeepMind — SL2T,手语
- Google DeepMind — X 上的 SL2T
- Suno — BMG 合作伙伴关系
- Cognition — Devin 中的 Grok 4.6
- Replit — 工作区区域选择
- GitHub — Agent Plugins 1.0
- GitHub — Copilot JetBrains、记忆与 Ollama
- Hugging Face — Transformers.js 1000 万次下载
- Ai2 — OlmoEarth Studio embeddings
- Liquid AI — LFM2.5-VL-3B
- Cohere — North Micro Vision
- Google — 14 个连接到 Gemini 的新应用
- Runway — Figma、Dropbox、Notion 连接器
- OpenAI — 企业代理式 AI 采用研究
- v0 — Grok 4.6
- Open_MOSS — FP8/NF4 版本
- Google AI Studio — 日食 3D 可视化器
- GitHub — GHES 3.22 RC
- GitHub — 组织级 Rule insights
- GitHub — 分支保护迁移到 rulesets
- Genspark — Seedance 2.5
- Genspark — Grant Thornton
- GitHub — 2026 年 8 月 Monthly Enterprise Roundup
- Runway — LTX-2.5
- Luma — FLUX 3
- Perplexity — Nemotron 3.5 Lightning
- Alibaba Qwen — OpenArt 上的 Qwen-Image-3.0
- Alibaba Qwen — Legal Research Bench
- OpenAI — Amazon Bedrock 上的 Daybreak