搜索

Sol-H3 生成视频的速度快于播放速度,CMS Manhattan 瞄准处理器,一个语料库为 58 种语言中的 106 892 个噪声添加时间戳

由人工智能生成的文章
Sol-H3 生成视频的速度快于播放速度,CMS Manhattan 瞄准处理器,一个语料库为 58 种语言中的 106 892 个噪声添加时间戳

ai-powered-markdown-translator

使用 gpt-5.6-sol 将文章从法语翻译成中文。

在 GitHub 上查看项目 ↗

NVIDIA Research 发布 Sol-H3,这套推理栈可在视频本身的播放时长内完成五秒视频的生成,并采用 Apache 2.0 许可证。同一天,一家厂商在 Hugging Face 上发布了两条专为处理器设计的模型产品线,但其承诺没有任何测量结果作为支撑;与此同时,一个印度团队开放了噪声语音语料库,其中每个时间戳都经过一套有据可查的验证流程。此外,Google Research 还将其避开凝结尾迹的航线试验扩展至亚洲。


Sol-H3 在 1.653 秒内生成五秒视频,快于其播放速度

9 月 7 日 — NVIDIA Research 的 Efficient AI 团队与其新加坡实验室共同发布 Sol-H3,这是一套面向 MiniMax-H3 视频模型的完整推理栈。结果可以用一句话概括:在配备八个 B300 Blackwell 加速器的系统上,以 1344×768 分辨率和每秒 24 帧生成五秒视频,并在同一次处理中生成立体声音频,只需 1.653 秒。因此,该模型制作视频片段的速度比观众观看它的速度还快。

这项比较针对的是完整配置,而非仅仅更换 attention kernel。基准配置 Base H3 Dense 使用 50 个调度器步骤,即对 DiT 网络执行 49 次前向传播;Sol-H3 则只使用四次。

硬件配置生成时长Base H3,50 个步骤Sol-H3,4 个步骤加速倍数
8× B3005 s18,250 s1,653 s11,04×
8× B30010 s50,660 s3,732 s13,57×
8× B30015 s99,513 s6,612 s15,05×
4× B3005 s35,328 s2,918 s12,11×
4× B30015 s194,930 s12,542 s15,54×
1× B3005 s129,898 s13,745 s9,45×

加速倍数最高达到 15.54×,这一峰值是在四个 B300 上生成十五秒视频时取得的。测试规程异常明确:预热后运行三次取中位数,并保持提示词和种子相同;计时涵盖文本编码、DiT 去噪和 VAE 解码,但不包括模型加载与最终的 MP4 编码。

这套系统结合了两个分别开发的组件:用于视频推理运行时的 Sol-Engine,以及无需重新训练、可即时应用 sparse attention 的 Sol-Attn。此外还包括融合 kernel、在 QKV 投影上使用 INT8 并在输出上使用 FP8 的 GPU 间通信、并行化和批量处理的 VAE 解码,以及 AdaLN 参数缓存。sparse attention 的准备时间从 1.206 毫秒降至 0.285 毫秒,VAE 解码从 7.55 秒降至 0.602 秒,每个 GPU 还能释放约 24 GB 内存。

有两项决定使这次发布不止停留在演示层面:代码采用 Apache 2.0 许可证发布,而且任何已经为 MiniMax-H3 训练好的少步骤 LoRA 都可以接入同一运行时。首日即通过 Reactor 提供开放 API,让用户无需占用八个 B300 就能进行尝试。

For us, the bigger milestone is crossing from “fast generation” into “faster than playback.” That opens the path toward continuous 24 FPS generation and truly interactive video systems.

🇨🇳 对我们而言,真正的里程碑是从“快速生成”迈向“快于播放”。这为以 24 FPS 持续生成视频以及真正具备交互性的视频系统铺平了道路。@xieenze_jr 在 X 上

🔗 NVIDIA Research 的 Sol-H3 项目页面

🔗 首日起通过 Reactor 提供 API 访问


一个开放语料库为 58 种印度语言中的 106 892 个真实噪声添加时间戳

9 月 7 日 — Indian Institute of Science 的 ARTPARK 团队发布 Vaani Noise Event Timestamp Dataset,这是在 Project Vaani 自发语音语料库之上添加的一层人工标注。每个背景噪声都标有类型以及精确到毫秒的开始和结束时刻。

语料库属性数值
标注音频总量超过 122 小时
带时间戳的噪声事件106 892 个,分为 7 类
语音片段与说话者72 756 个片段,38 541 个声音
语言和地域覆盖范围58 种语言,30 个邦
已验证集合与原始集合约 22 小时和约 100 小时

方法上的关键点在于:语音与噪声是在普通手机上同时采集的,没有加入合成噪声,也没有进行后期混音。咳嗽和笑声等人类非语言声音出现在约 38% 的片段中,但持续时间不到半秒;动物和交通噪声更少见,却持续得更久,两者合计占据了噪声总时长的最大部分。每个时间戳都要依次经过标注、一致性验证、内部复核,以及对随机抽取的十分之一语料库进行独立审计:只要有一个未通过,整个批次都必须返工。

🔗 ARTPARK-IISc 在 Hugging Face 上的文章


CMS Manhattan 发布两条面向处理器的模型产品线,却没有 benchmark 支撑

9 月 6 日 — 厂商 CMS Manhattan 在 Hugging Face 上发布了两个开放权重项目,目标是在处理器而非显卡上进行推理。两篇文章均由模型厂商自行发布,下文所有内容也均按这一性质呈现。

第一条产品线 JiRack Ultra 系列包含四个采用 BitNet 风格 1.58 bit 三值权重的模型,据厂商称,它们源自 DeepSeek-R1-Distill-Qwen-32B 架构。最有趣之处并非量化,而是 tokenizer:它新增了专用于路由、工具调用、机器人控制标签和媒体的 token,目标是服务于智能体系统和嵌入式机器人。第二条产品线 JiRackDeltaNet_27b 则基于一个迁移至 DeltaNet 架构的 270 亿参数 Qwen 3.8;该架构交替使用完整 attention 和与状态空间模型相关的 Gated DeltaNet 层,宣称支持 262 144 tokens 的上下文。

模型产品线厂商宣称的基础模型发布的权重格式许可证与打包方式
JiRack Ultra,四种规模DeepSeek-R1-Distill-Qwen-32B1.58 bit 三值权重,GGUF Q2_K 至 Q4_K_MHub 上的权重、Docker 镜像及订阅制界面
JiRack DeltaNet 27B迁移至 DeltaNet 的 Qwen 3.8 27B从 FP16 生成的常规 llama.cpp GGUF采用 MIT 许可证的权重、Docker 镜像及每位用户每年 12 美元的界面

读者需要注意两点。尽管 DeltaNet 仓库带有 ternary 和 bitnet 标签,但发布的 GGUF 产品线对应的是常规 llama.cpp 量化,而不是独立的三值 checkpoint,文章本身也承认了这一点。其次,第二篇文章标题中宣称质量接近 Opus 4.6 Max,却没有任何 benchmark 结果提供支持:要想不只依据文档来评判这些模型,缺少的恰恰是一项已发布的对比测量。

🔗 Hugging Face 上的 JiRack Ultra 系列

🔗 Hugging Face 上的 JiRack DeltaNet 27B


为什么 RL 环境如今能够奏效,而在 2016 年却不能

9 月 7 日 — Sergio Paniego 在 Hugging Face 博客上发表了一篇回顾文章,起点是一个耐人寻味的观察:2016 年 12 月发布的 OpenAI Universe 介绍,即使原封不动地出现在今天某个顶尖实验室的文章中也毫不违和。然而,其仓库已经归档。

时间线从 2012 年的 Arcade Learning Environment 延伸至 2016 年的 OpenAI Gym 及其最简词汇 reset()step(),后者此后已在 Farama Foundation 旗下演变为 Gymnasium。随后,各领域相继掀起浪潮,从 World of Bits 到 WebArena,再到 SWE-bench 和 Terminal-Bench:一项任务通常先作为 benchmark 出现,之后才成为训练场。

分析的核心是 2016 年缺失的五个要素:没有足以作为起点的预训练模型、任务超出能力范围、界面以人类而非机器为参照、没有应对稀疏奖励的方案,以及无法编排数千个一次性 sandbox。如今,GRPO 与可验证奖励补上了第四项。文章最后谈到 OpenEnv——由 Meta 的 PyTorch 团队与 Hugging Face 于 2025 年 10 月宣布的标准接口——以及一个包括 Prime Intellect 和 Mechanize 在内的环境市场。

🔗 RL 环境回顾


Google 让 Cathay Pacific 的 80 多个航班采用避开凝结尾迹的航线

9 月 7 日 — Google Research 将凝结尾迹规避试验扩展至亚太地区,Cathay Pacific 成为该地区首家商业航空合作伙伴。纸面上的应对方法很简单:略微调整高度,绕开那些寒冷、潮湿的区域,因为尾迹会在那里持续存在并扩散成滞留热量的云层。

第一阶段指标数值
Cathay Pacific 航线网络中的目标航班超过 100 个
实际采用规避航线的航班超过 80 个
凝结尾迹增温影响的预计降幅约 40 %
香港—新加坡航线对改善效果的贡献超过 50 %
凝结尾迹在航空业气候影响中的占比约三分之一

该系统结合了 Google 模型生成的预测、卫星影像和先进气象数据。预测通过机上 Wi-Fi 和航空公司的电子飞行文件夹(Electronic Flight Folder)传送至驾驶舱,不会中断常规流程,而所有调整均保持在既定安全参数范围内。目前,规模更大的第二阶段已经启动,Contrails.org 将作为合作伙伴参与。

Contrail mitigation remains one of the most immediately available, scalable, and cost-effective ways to reduce aviation’s climate footprint, and it can get started now, with today’s aircrafts and fuel.

🇨🇳 缓解凝结尾迹仍是减少航空业气候足迹最能立即实施、最易推广且最经济的手段之一,并且现在即可使用现有飞机和燃料着手开展。 — Kemal Armada 与 Max Vogler,Google Research

🔗 Google Research 文章


Genspark 将 Muse Spark 1.3 加入其三款产品

9 月 7 日 — Genspark 在 Muse Spark 1.3 发布五天后,将 Meta 的这一模型接入 AI Chat、Code Agent 和 Claw。该平台引用了 Meta 为说明这一选择而给出的两项数据:工具调用量减少 20%,token 消耗减少 25%;这两个指标会直接影响智能体在长期任务中循环运行的成本。

真正的信号在于其节奏。六天内,Genspark 集成了来自四家不同供应商的模型:9 月 2 日的 Claude Fable 5.1、9 月 3 日的 Gemini 3.8 Flash、9 月 5 日的 GPT-6 Astra,以及 9 月 7 日的 Muse Spark 1.3。与其说该平台将自己定位为一个模型,不如说它是一层编排系统,能在各实验室发布成果后的几天内吸纳它们的输出。

🔗 Genspark 在 X 上的公告


简讯

  • Replit 在伦敦开设首个国际办公室 — 该公司将其打造为欧洲业务中心,并与伦敦市长 Sadiq Khan、英国政府及 London & Partners 合作,同时宣布与 TLMA 开展技能提升试点项目,面向未就业且未接受教育或培训的伦敦年轻人。🔗 公告
  • Tolquane:一个支持可组合并行处理的 Python 库 — 同一张图无需更改代码,即可通过线程、进程、异步、分布式或顺序方式执行。在无全局锁的 Python 3.14t 上,其速度达到基准的 5.6 倍,而使用 GIL 的线程模式仅为 0.9 倍。它将禁止阻塞设为设计原则,并通过错误信息指出发生阻塞的节点。🔗 文章
  • 用于安装 Agent Skill 的专用操作 — Aiden 固件现在会将 Skill URL 路由至一个统一操作,由该操作依次准备、验证并以原子方式发布。在真实 Agent 上复现后,原本涉及多个工具的跟踪记录缩减为一次调用。🔗 文章
  • Together AI 对比 GLM-5.3 Flash 与 GPT-5.6 Terra 的单任务成本 — 据托管服务商称,两者在 Artificial Analysis 智能指数上的得分相同,但前者的单任务成本低 82%;不过,该服务商既未公布计算方法,也未发布详细文章,而且对比中的模型正是由其自身提供服务。🔗 公告
  • 一份关于巴西 AI 生态系统的宣言 — 这篇葡萄牙语文章以自然生态系统为喻,描述该国的 AI 社群,但未提供模型、数据集或衡量指标。为保证内容完整性而收录。🔗 文章
  • Google DeepMind 为其亚太地区 AI for the Planet 加速器选出 16 家机构 — 首期项目先在新加坡举办密集训练营(bootcamp),随后提供为期三个月的 AnthroKrishi、ForestCast、AlphaEarth Foundations、SpeciesNet 和 Perch 模型使用权限,项目分布于自然保护、可持续农业和碳解决方案三大领域。🔗 文章
  • GitHub 再次推广其 Copilot 应用中的 canvases — 其重新发布了一篇 8 月 17 日的文章,将 canvas 描述为一个共享且持久的工作空间,可让工作状态始终可见;文章还披露了一个鲜少公开的数字:构建文中两个示例,每个都需要 2,000 至 3,000 AI Credits。🔗 公告
  • GitHub 推出 GitHub Universe 别名生成器 — 这是为 2026 年 10 月活动预热的社区推广互动,与 AI 或产品功能无关。🔗 公告
  • Synthesia 详述其面向 ECCV 2026 的三大研究方向 — 包括由音频驱动的生成式虚拟人、应用于语音识别的语音研究,以及交互式虚拟人,均归入以人为中心的世界模型这一主题。🔗 公告
  • Mati Staniszewski 认为对话式图灵测试将在六至十二个月内实现 — ElevenLabs 联合创始人兼首席执行官在 GDIY 播客中作出这一判断,该公司音频服务还提供了这期访谈的法语配音版本。🔗 公告
  • QwenCloud 发布 Qwen Conference Thailand 2026 活动回顾 — 9 月 4 日,近 400 名客户和开发者齐聚曼谷;现场还展示了一个端到端流程,其中 Agent 本身就是客户,从注册到付款和开票全程无需人工介入。🔗 公告
  • Cohere 转发 CNN 关于多伦多成为全球 AI 中心的报道 — 这是一则未包含产品发布的宣传内容,其中提到:根据 CBRE 的数据,多伦多在全球科技人才排名中位列第三;加拿大国家战略已投入超过 20 亿美元;Cohere 还表示,在针对 Anthropic 模型实施出口管制后,公司收到的客户请求大量增加。🔗 公告

这意味着什么

Sol-H3 跨越的门槛,并不只是榜单上又一项纪录。只要生成一段视频所需的时间仍长于观看时间,视频生成就依然是一种批处理工作:启动、等待、观看。降至这一门槛以下,便开启了另一类应用场景——画面在人们观看的同时实时生成。对实践者而言,关键在于性能提升并非来自新模型:模型没有变化,改变的只有推理栈。因此,15 倍的提升来自执行工程而非模型权重;相关成果以 Apache 2.0 许可证发布,并兼容现有 LoRA。

这一天呈现了两种发布开放权重的截然不同的方式。一边是两篇自行发布的文章,其质量主张没有任何可比指标作为支撑,仓库标签与实际提供的格式不符;此外,胜出模型的托管服务商还宣称其单任务成本更低,却未公布计算方法。另一边则是一个语音语料库,其中每个时间戳都经过完整的审核链路,团队还明确区分了 22 小时经过验证的数据和 100 小时未经验证的数据。在一个任何人都能发布内容的公共仓库中,严谨的验证工作成了唯一可用的信号,而产生这种信号的成本远高于拟定一个吸引眼球的标题。

关于 RL 环境的回顾与 Genspark 的集成速度,从两个不同尺度讲述了同一种转变。前者解释了为什么 2016 年的一个想法如今能够奏效:当时缺少的并非算法,而是算法周围的基础设施,从初始模型到一次性沙箱皆是如此。后者则展示了这种基础设施具备后会发生什么:一个平台可以在六天内接入来自四家供应商的四个模型。在这两种情况下,价值都从模型迁移至其外围层,而这一层正在走向标准化,一边是 OpenEnv,另一边是多模型编排器。

此外,还有一些工作并不属于模型竞赛。与 Cathay Pacific 的试验针对现有飞机和燃料;唯一新增的是在恰当时机将预测信息送入驾驶舱,据估算,可使相关航班的影响减少约 40%。Vaani 语料库涵盖 58 种印度语言,其中数种语言此前没有任何带噪语音资源;DeepMind 的亚太地区加速器则向 16 支一线团队提供专业模型。这三项工作都没有需要击败的 benchmark。它们面临的制约在别处:需要采集的数据,以及必须成功完成的部署;而演示与可衡量成效之间的差距,也正是在这里形成的。


来源