搜索

MiniMax 推出 H3,公布开放权重;Together AI 宣称 token 增长 10000 倍;GitHub 锁定有风险的 npm 令牌

ai-powered-markdown-translator

由 gpt-5.4-mini 从法语翻译成中文的文章。

在 GitHub 上查看项目 ↗

MiniMax 推出 H3,这是一款通用多模态模型,具备原生立体声和“将在未来几天内”公布的开放权重。Together AI 宣称其服务的 token 总量出现了惊人的增长,而 GitHub 在一波账号接管攻击后加强了 npm 令牌的安全性。围绕这三个主题,当天的另一条主线是图像与视频生成(Runway、Wan Video、Luma、Black Forest Labs、Ideogram)、代码代理工具链(Devin、Replit、GitHub Actions),以及 OpenAI 和 Google 的模型迁移。


MiniMax H3:通用多模态模型,宣布开放权重

7月31日 — MiniMax 推出 H3,被描述为一款通用多模态生成模型。与前几代(Hailuo 01 和 02)按专用模型拆分任务不同,H3 将这些能力统一到一个模型中,可理解混合了文本、图像、视频和音频的上下文。它最醒目的特性,是与视频联合生成的原生立体声音频,支持最长 15 秒、2K 分辨率的视频片段。

MiniMax 强调其激进的性价比定位:在 2K 下,单秒价格低于所谓“主流”模型的三分之一;在 768p 下,价格低于这些模型 720p 价格的一半。H3 基于多项自研模块(Contextual Omni Representation、H3-VAE、H3-Omni Transformer、In-Context Regeneration),并支持广义编辑:图像到图像、图像到视频、音频到音频、视频到视频的动作迁移,同时能精确渲染文本和品牌元素——这在视频生成模型中往往是弱项。

MiniMax 还宣布即将开放模型权重,称此举将加速硬件兼容性,并支持长期由闭源模型主导的开源社区。此次发布还伴随约十几家合作伙伴的 day-0 上线,包括 Runway、Pika、Leonardo.Ai、OpenRouter 和 Krea。

特性详情
分辨率默认 2K
最长时长15 秒
音频原生立体声,联合生成
2K 价格低于主流模型每秒价格的三分之一
768p 价格低于主流 720p 价格的一半
开放权重宣布“将在未来几天内”

MiniMax H3: An Open Model Breaking the Boundaries Between Tasks and Modalities — Today, we’re launching MiniMax H3, a general-purpose multimodal generation model. H3 understands unified context across text, images, video, and audio, generating video with native stereo sound, up to 15 seconds at 2K resolution.

🇨🇳 MiniMax H3:一款消除任务与模态边界的开放模型——今天,我们发布 MiniMax H3,一款通用多模态生成模型。H3 通过统一上下文理解文本、图像、视频和音频,并生成带有原生立体声的视频,最长可达 15 秒,2K 分辨率。@MiniMax_AI 在 X 上

🔗 补充链接 — @MiniMax_AI 在 X 上


Grok Imagine Video 1.5 可在 Runway 上使用

8月1日 — Runway 继续扩大其第三方模型目录,直接在平台中集成了 Grok Imagine Video 1.5,也就是 xAI 生成模型的视频版本。此次集成延续了 Runway 的策略:汇聚多家厂商的前沿模型——其前一天已经接入 MiniMax H3——形成同一创意制作平台,而不是只押注自家的 Gen 模型。

🔗 公告 — @runwayml 在 X 上


Wan Video(Alibaba)推出用于草图和文本的 Realtime 模式

7月31日 — Alibaba 已在 wan video 的 Labs 区上线 Realtime 模式,可在绘制过程中把草图实时变成写实场景——细长火柴人、粗略矩形、几笔线条即可——无需显式生成步骤,也没有“generate”按钮。同一天,Alibaba 又推出了第二个 Realtime 模式,这次面向文本:用户逐句输入描述时,图像会同步实时调整,无需加载界面。这两项功能让图像生成体验更接近连续交互,像绘图或文字处理,而不是传统的 prompt/生成循环。

🔗 公告 — @Alibaba_Wan 在 X 上


Luma 推出 Layers:由 Uni-1 驱动的分层图像编辑

7月30日 — Luma 在 Luma Agents 中部署了 Layers,由其 Uni-1 模型驱动。其原理是:要求代理提取现有图像的各个图层(无论是 Luma 生成还是用户导入),然后通过简单对话修改某个具体元素,同时保持图像其余部分不变——无论是主打产品、背景还是文字。Luma 用两个例子说明这一功能:基于一张扁平 JPG 直接重新设计整张品牌重塑海报,以及在场景中添加一个独立物体,同时不改动光照或布景。目标是实现有针对性的迭代式修图,而不是为了改一个细节就重生成整张图。

🔗 公告 — @LumaLabsAI 在 X 上


Black Forest Labs 公布 FLUX 3 预览

7月30日 — Black Forest Labs(BFL),也就是 FLUX 系列模型的开发者,通过 Nous Research 的 Hermes 代理,借助 48 小时临时访问,首次公开展示了其下一代模型 FLUX 3。该代理会将多个生成方案串联起来,从一个单一的端到端 prompt 生成完整短片。此次公告还伴随 Nous Research 本周举办的短片比赛,以及 BFL 将于下周五在旧金山举行的线下活动中对 FLUX 3 的现场展示。BFL 目前尚未公布正式可用时间,也没有透露模型能力的技术细节。

🔗 公告 — @bfl_ai 在 X 上


Ideogram 与 Pruna AI 推出 P-Image-Ideogram:Pareto 最优模型家族

7月30日 — Ideogram 与 Pruna AI 合作推出了一组新的图像模型家族,名为 P-Image-Ideogram,在质量、速度和成本上同时优化。该模型提供四种质量模式(Very low、Low、Medium、High),支持原生 1K 和 2K 生成,起步价格为每张 0.003 美元,并宣称根据模式不同,延迟在 3 到 8 秒之间。在 Design Arena 排行中(匿名人类投票),Ideogram 声称在偏好/成本和偏好/速度上都达到了新的 Pareto 前沿:在 1K 模式下,最经济模式的价格为每张 0.3 美分,生成约需 3 秒,速度约为被评估模型平均值的 8.6 倍。该模型已立即部署到十几家合作平台,包括 ComfyUI、Runware、Replicate、Leonardo.Ai 和 Together AI。

质量模式分辨率1K 价格近似延迟
Very low原生 1K/2K0.3 ¢/image~3 s
Low原生 1K/2K0.75 ¢/image~3 s
Medium原生 1K/2K未说明最高 8 s
High原生 1K/2K未说明最高 8 s

🔗 公告 — @ideogram_ai 在 X 上


Devin 推出 Outposts:可在任意电脑上原生执行应用

7月31日 — Cognition,也就是 Devin 的开发者,宣布了一项名为 Outposts 的新功能。它允许 Devin 代理直接在任意电脑上原生执行和测试应用,而不再完全依赖隔离的云环境。这一能力延续了 Cognition 最近关于原生执行的公告——前一天刚宣布通过 macOS 云代理支持原生 iOS——并旨在扩展 Devin 可端到端处理的任务范围,包括用户工作站特定的硬件或软件配置。

🔗 公告 — @cognition 在 X 上


Replit 发布 Model Selector、Follow-up Tasks 和新的使用页面

7月31日 — 在每周回顾 “This Week in Replit” 中,Replit 介绍了多项新功能。Model Selector 现已向 Core 和 Pro 套餐开放,选择范围扩大到除专有模型外还包括开放权重模型——用户可以手动选择,也可以让 Replit 自动推荐。Follow-up Tasks 本周向所有用户开放:在完成一项任务后,Agent 会提出可一键执行的后续步骤,并在后台运行。还有两项调整:重建后的使用页面提供按日期、资源、项目、workspace、组和用户的近实时追踪,以及更长的用户会话时长(默认登出时间从 7 天延长到 14 天)。

功能状态
Model Selector已上线,Core 和 Pro 套餐,包含开放模型
Follow-up Tasks已向所有用户部署
使用页面已重建,近实时追踪
会话时长从 7 天延长到 14 天

🔗 公告 — @Replit 在 X 上


Together AI:开放式推理的规模化

Together AI 本周围绕专用推理发布了多项公告,分成两个不同方向:一是使用量层面的惊人增长数据,二是底层基础设施自动扩缩容的详细技术文章。

服务 token 数量增长超过 10000 倍

8月1日 — Together AI 给出了一个醒目的增长数字:其服务的 token 总量据称已从每月 300 亿增长到每月 400000 亿(400 万亿),也就是增长了超过 10000 倍。公司将这一进展归因于大规模工作负载从专有闭源 API 迁移到了开放权重模型。由于该数字没有给出明确参考周期,其可比性也因此受到限制。

Josh had to stop @vipulved and ask him to repeat the number: @wolfejosh Together AI went from serving 30B tokens a month to 400T. Over 10,000x growth as AI-native companies and enterprises move scaled workloads to open model.

🇨🇳 Josh 不得不打断 @vipulved,让他重复一遍这个数字:Together AI 每月服务的 token 数量从 300 亿增长到了 400000 亿。增长超过 10000 倍,这一切都得益于 AI 原生企业和大型客户把大规模工作负载迁移到了开放模型。@togethercompute 在 X 上

用八个指标来驱动专用推理的自动扩缩容

7月31日 — Together AI 发布了一篇关于其 Dedicated Model Inference 自动扩缩容的技术文章。起点是一个事实:从 Web 世界沿用来的传统指标(CPU/GPU 利用率)并不能反映 LLM 推理引擎的真实压力——GPU 即便显示 60% 利用率,其队列也可能早已饱和,因为利用率衡量的是计算强度,而不是等待中的负载。文章详细列出了八个原生推理指标,分为三类(并发、SLO、效率),并推荐将 inflight_requests 作为默认指标。文章还量化了 H100 GPU 上 cold start 的真实成本:基础模型约 86 秒,18 GB 的 fine-tune 约 145 秒,增加一个副本约 2.5 分钟。

测量步骤1×H100 用时
基础模型部署86 s
fine-tune 部署(18 Go)145 s
从 1 到 2 个副本扩容~2.5 min

🔗 完整技术文章


Ai2——基于 infini-gram 的研究追踪 AI 写作书籍中的借用语言

7月31日 — Ai2(Allen Institute for AI)重点介绍了一项基于其 infini-gram 引擎的研究。该工具会索引海量文本语料,并精确统计任意短语出现的频率,从而可以追溯某种表述最可能的来源。Tuhin Chakrabarty(Stony Brook University)团队筛选出“稀有表达”——即最多只出现在五本 Google Books 书籍中、且在已索引网络中不存在的措辞——并比较它们在高 AI 检测率的自出版书籍、未检测到 AI 的自出版书籍,以及获奖文学作品中的出现比例。结果显示,高 AI 内容书籍中稀有表达的占比明显更高,这表明它们对训练数据中的模式依赖更强。

被评估组别稀有表达覆盖率
自出版前 200 名,AI 检测率高41.6 %
自出版前 200 名,未检测到 AI37.2 %
获奖或提名文学(参考组)19.1 %

🔗 完整文章 — Ai2


Gemini 3.5 Flash Cyber:一个受限访问的网络安全专用模型

7月31日 — Google 悄然为其 Flash 系列新增了一名成员:Gemini 3.5 Flash Cyber。与本月公布的面向大众版本(3.6 Flash、3.5 Flash-Lite)不同,这个模型面向非常具体的用途——大规模检测并修复软件漏洞——并且仍然是专为这一单一场景优化的经济型模型。其访问权限被刻意限制在政府和可信合作伙伴范围内,因此更像是一款防御性网络安全工具,而不是面向所有人的开放商业产品。此次公告没有附带专门的产品页面、基准测试或架构细节:唯一可用来源只是 @GoogleAI 的一篇双周汇总帖,这也限制了我们目前能了解的深度。

同一篇汇总帖还宣布了 Gemini Notebook(原 NotebookLM)中的 Collections,一种新的笔记本整理方式。这里同样只有一句话,没有配图,也没有相关文档。

🔗 汇总帖 — @GoogleAI 在 X 上


Copilot 降级 Gemini 2.5 Pro 和 Gemini 3 Flash

7月31日 — GitHub 将 Gemini 2.5 Pro 和 Gemini 3 Flash 从其所有 Copilot 体验中移除(Chat、inline edits、ask 和 agent 模式、代码补全),无需用户侧任何操作——这些模型会自动从选择器中消失。系统提示用户切换到 Gemini 3.1 Pro (Preview) 和 Gemini 3.6 Flash。就管理层面而言,企业组织需要先确认其模型策略确实允许这些替代模型,然后团队才能在 VS Code 和 github.com 上的 Copilot Chat 选择器中看到它们。此次降级体现了 Copilot 所提供模型快速轮换的节奏,在这里,前一代 Gemini 版本正被 Google 的最新迭代所取代。

🔗 官方更新日志


npm 限制配置为绕过 2FA 的 GAT 令牌

7月31日 — GitHub 限制了 npm 的细粒度访问令牌(GAT)在配置为绕过双重身份验证(2FA)时可执行的操作。此前,这类令牌一旦泄露,几乎可以完全接管账户:创建其他令牌、添加维护者、修改包的访问权限。如今,这些敏感操作即使对通常免于 2FA 的令牌也需要交互式 2FA 挑战。该措施立即生效;第二阶段计划于 2027 年 1 月实施,届时这些令牌还将失去直接发布包的能力,这也推动自动化团队转向可信发布(trusted publishing,基于 OIDC)。受影响的只有 npm 令牌——常规 GitHub 令牌(PAT、GitHub App、Actions)仍可不变使用。这是对近几个月开源生态系统中 npm 包接管攻击浪潮的直接回应。

🔗 官方更新日志


用于在 GitHub Actions 中引用操作的 self-repository 语法

7月30日 — GitHub Actions 引入了一种新的语法,$/,用于引用与调用工作流位于同一仓库中的 action 或可复用工作流。此前,这类内部引用要么必须配合显式 checkout 步骤使用 ./,要么只能将版本固定死。借助 $/,引用会自动指向当前运行的精确提交,无需额外 checkout 步骤,并且适用于 ./ 曾被使用的所有场景:工作流步骤、复合 action、嵌套组合以及可复用工作流调用。此新功能需要 2.336.0 版本或更新的 runner。其核心价值在于:让组织能够强制要求 action 以完整 commit SHA 方式固定,同时又保持内部引用会自动与当前运行 ref 同步。

🔗 官方更新日志


OpenAI 将于 8 月 31 日从 ChatGPT 中移除 GPT-5.4 和 GPT-5.4 mini

7月31日 — OpenAI 宣布,自 8 月 31 日起,将把 GPT-5.4 和 GPT-5.4 mini 从面向已登录账户用户的 ChatGPT 界面中移除。不过,这两个模型仍可通过 OpenAI API 使用,也可在通过 API key 认证的 Codex 会话中使用——这一区分意味着,受影响的是使用 ChatGPT app/web 的用户,而不是通过 API 或带有 API key 的 Codex 进行开发的开发者。该公告延续了 7 月底 GPT-5.6(Luna/Terra)价格更新的趋势,后者加速了 ChatGPT 产品线向最新模型的切换。

🔗 公告 — @OpenAIDevs 在 X 上


Codex CLI 中的 ImageGen:新的 lightbox 和 canvas

7月30日 — OpenAI Devs 为 Codex CLI 中集成的 ImageGen 功能更新了新的“lightbox”式界面和专用 canvas。此更新旨在简化在 Codex 工作流中直接浏览和微调生成图像的过程,而无需切换上下文。这更多是一次易用性改进,而不是新模型,但它直接影响了 OpenAI 优先跟进的 CLI 工具。

🔗 公告 — @OpenAIDevs 在 X 上


简讯

  • Amp — orb 启动速度提升 20%,Puck 助手切换至 GPT-5.6 Sol — Amp 宣布 orb(远程机器)启动速度约提升 20%,并在用户强烈批评反馈后将其助手 Puck 切换到 GPT-5.6 Sol。 🔗 来源
  • Hugging Face 为 DeepSeek-V4-Flash-0731 部署免费公共端点 — 一名 Hugging Face 员工在模型发布当天就上线了一个无需 token、兼容 OpenAI 的免费端点供测试。 🔗 来源
  • Sakana AI — 在 OSINT Diver 2026 CTF 中获得第 5 名 — Sakana AI 的一个防御/情报团队使用基于 Fugu-ultra 1.1 的 OSINT agent,在 850 多支参赛队伍中获得第 5 名。 🔗 来源
  • Together AI 上的 Kimi K3 — 根据 OpenRouter 显示价格最低且缓存命中率最佳 — OpenRouter 仪表板数据显示,Together AI 为 Kimi K3 提供了最低档位之一的价格,同时拥有最佳的 prompt cache 成功率之一。 🔗 来源
  • 一个开放视频模型(Marlin-2B)让约 370 小时的公共档案可被检索,成本约 10 美元 — 社区成员在 Hugging Face Jobs 上使用 Marlin-2B 索引了 1,864 部 Prelinger Archives 影片,生成了 23,148 个可检索时刻。 🔗 来源
  • GitHub 调查开发者对无障碍工具的使用情况 — 面向残障开发者的开放调查持续到 2026 年 8 月 31 日,内容聚焦其对无障碍技术的使用。 🔗 来源
  • Seedance 2.5 也已在 Luma 上预告 — Luma 预告 Seedance 2.5 即将登陆其平台,但未给出具体日期。 🔗 来源
  • Ideogram Object Remover 已在 Runware 上可用 — Ideogram 的对象移除工具声称在 OmniEraser 基准测试中取得最佳 FID 分数,而且无需提示词。 🔗 来源
  • SGLang 为 NVIDIA DGX Spark 集群添加 Inkling-Small 支持 — 在通过 ConnectX-7 连接的 2 台 DGX Spark 系统上,并发为 1 时,测得吞吐量为 24 tokens/秒。 🔗 来源
  • ChatGPT 桌面版 — 通过动物图标进入“活动”视图和“语音”快捷入口 — 新的 Activity 视图汇总待处理对话和项目更新,并新增前往 ChatGPT Voice 的快捷入口。 🔗 来源
  • 数学与理论计算机科学的十项进展 — OpenAI 分享了关于几何、密码学和复杂性中的开放问题的十项结果;详细内容无法查看,源站对机器人受限。 🔗 来源
  • 在欧洲推进负责任的 AI — OpenAI 介绍了其在安全、透明度和来源可追溯性方面的实践,以支持欧洲在 AI Act 框架下的 AI 治理;详细内容无法查看,源站受限。 🔗 来源
  • Univé 正借助 ChatGPT Enterprise 打造面向 AI 的员工队伍 — 这是一篇关于荷兰保险公司 Univé 部署 ChatGPT Enterprise 的案例研究;详细内容无法查看,源站受限。 🔗 来源
  • OpenAI 表示其已拆解一个位于柬埔寨的诈骗网络 — ChatGPT 被用于投资、情感、博彩和身份冒用类诈骗;详细内容无法查看,源站受限。 🔗 来源
  • avatarin 借助 GPT-Realtime 构建 24/7 零售 agent — 为 Yamada Denki 提供多语言客户支持:官方摘要称两周内覆盖 30,000 名用户,正面评价率为 92%;详细内容无法查看,源站受限。 🔗 来源

这意味着什么

媒体生成正加速走向大规模分发与对话式编辑。 MiniMax H3 率先登场,推出了一个统一的文本/图像/视频/音频模型,并承诺“在接下来的几天内”开放权重,同时已在十几家合作伙伴处 day-0 上线。相同的趋势也体现在 Ideogram(P-Image-Ideogram、四种质量模式、每张图低至 0.003 美元)、Wan Video(无“generate”按钮的 Realtime 模式)和 Luma(Layers,可通过对话一次编辑一个图层)上:价值不再只取决于模型原始质量,而更多取决于迭代速度以及从发布之初就具备的多平台集成能力。Black Forest Labs 则通过仅向第三方 agent 提供 48 小时的 FLUX 3 预览,采取了相反的路径——受控预告,而非立即全面开放。

开放模型推理正在扩大规模,而使用情况的记录也与技术本身同样重要。 Together AI 声称,其在一个月内服务的 token 量增长了 10,000 多倍,主要得益于企业向开放模型迁移;与此同时,它还发布了一篇技术文章,详细讨论了传统 autoscaling 指标在 LLM 推理中的局限性。作为补充,Ai2 基于 infini-gram 构建的研究为这股开放模型浪潮提供了一个出人意料的视角:它基于自出版图书,记录了 AI 生成文本在多大程度上仍然接近训练语料中出现过的表达——这提醒我们,推理可扩展性并不会消解关于生成内容原创性的根本问题。

代码 agent 的工具链与供应链安全正并行推进,但方向并不总是一致。 Devin 通过 Outposts 将执行范围扩展到任意电脑,Replit 则不断增加自治能力相关功能(Follow-up Tasks、Model Selector),而 GitHub Actions 则借助 $/ 语法简化了内部 action 的引用。与此同时,GitHub 通过要求即使是配置为绕过 2FA 的令牌也必须进行交互式 2FA 挑战,收紧了 npm 安全,此举直接回应了近几个月观察到的账户接管浪潮——这表明,随着 agent 自动化程度提升,访问控制也在同步加固。

两个厂商正出于不同原因,收紧对部分模型的访问。 OpenAI 从 8 月 31 日起将 GPT-5.4 和 GPT-5.4 mini 从面向已登录用户的 ChatGPT 中移除,同时仍通过 API 提供——这更像是产品线梳理,而非彻底下架。另一方面,Google 将 Gemini 3.5 Flash Cyber(一个专门用于检测和修复软件漏洞的经济型模型)仅提供给政府和可信合作伙伴:这表明,一些实验室如今开始明确区分面向防御用途受限的模型与面向公众的模型。


来源