ai-powered-markdown-translator使用 gpt-5.4-mini 从法语翻译成中文的文章。
本周,Meta 发布了 Muse Glimmer,这是一款 300 亿参数、开放权重的多模态智能体模型,可立即通过 NVIDIA 的 GPU 加速端点以及 Hugging Face 使用。OpenAI 重组了其网络安全项目 Daybreak,并推出了 GPT-5.6-Cyber,该模型已经帮助在 Chrome 的 JavaScript 引擎中发现了一个前所未见的漏洞。另一条引人注目的消息是:Claude 的一个未公开研究版在一个与黎曼猜想相关的数学问题上取得了进展,并附带经过验证的形式化证明。除此之外,还有 Anthropic 的定价、开发者工具、企业语音 AI 以及 AI 原生金融等内容。
Meta 开源发布 Muse Glimmer,30B 开放权重智能体模型,可通过 NVIDIA 使用
Meta 发布了 Muse Glimmer,这是一款 300 亿参数的稠密多模态模型(2B 视觉编码器 + 28B 文本解码器),针对在本地、持续运行于消费级硬件——Mac 或配备高性能 GPU 的 PC——进行了优化。其权重采用 Apache 2.0 许可证发布。该模型支持超过 120,000 个 token 的上下文窗口,并据 NVIDIA 称,在单个 GPU 上的吞吐量可达每秒 20,000 token;Alexandr Wang(Meta Superintelligence Labs)补充说,它可以在 24 GB VRAM 上运行,而不会损失智能体可靠性。
在技术层面,Muse Glimmer 结合了滑动窗口注意力和全注意力,一种 Gated Grouped-Query Attention 架构将内存缓存降低了 16 倍,以及一个轻量级 DFlash 草稿模型,将生成速度提升 2 到 4 倍。支持在首发当天即已提供于 transformers、llama.cpp 和 vLLM,同时提供量化的 GGUF 权重,并可通过 Hugging Face 的 Inference Endpoints 部署。
| 技术特性 | 测量值 |
|---|---|
| 参数 | 30B(2B 编码器 + 28B 解码器) |
| 许可证 | Apache 2.0 |
| 上下文窗口 | 120,000+ tokens |
| 最低 VRAM | 24 GB |
| 吞吐量(1 GPU) | 最高 20,000 tokens/s |
| MCP Atlas(智能体) | 75.5(对比竞争对手 54.2–62.5) |
NVIDIA 随即开放了一个 GPU 加速访问点用于测试 Muse Glimmer,针对其边缘、桌面和工作站平台进行了优化——作为权重下载之外的一个实际可用补充。
Introducing Muse Glimmer, an open-weight 30B-parameter model optimized for local, always-on agent workflows. […] we’re releasing model weights under a permissive Apache 2.0 license.
🇨🇳 Muse Glimmer 介绍:一个 300 亿参数的开放权重模型,针对本地和持续运行的智能体工作流进行了优化。[…] 我们将以宽松的 Apache 2.0 许可证发布模型权重。 — @AIatMeta 在 X 上
🔗 NVIDIA 为 Muse Glimmer 提供 GPU 加速端点
OpenAI 扩展 Daybreak 并推出 GPT-5.6-Cyber,Chrome 中发现一个前所未有的 CVE
OpenAI 将其网络安全项目 Daybreak 重组为两个访问层级,并推出 GPT-5.6-Cyber,这是一款基于 GPT-5.6 Sol 构建的专用模型。其公开目标是:在攻击者的进攻能力普及之前,先将最前沿的智能交到值得信赖的防御者手中。
| 访问层级 | 使用的模型 | 目标人群 |
|---|---|---|
| Daybreak Blue | GPT-5.6 Sol(解除系统护栏) | 推荐给大多数防御者的入口 |
| Daybreak Red | GPT-5.6-Cyber(新) | 经验丰富的安全研究人员,经过授权的高级工作 |
GPT-5.6-Cyber 降低了对某些高风险双重用途请求的拒绝率(例如针对生产系统的渗透测试),并在 ExploitGym 2 上超越了 GPT-5.6 Sol 以及旧版 GPT-5.5 Cyber。在实际环境中,该模型帮助发现了 Chrome 的 JavaScript 引擎 V8 中两个前所未见的漏洞,可导致内存破坏并逃逸堆沙箱;在与 Google 协调披露后,该漏洞已被修复并编号为 CVE-2026-15903。它还识别出某热门移动操作系统中的至少五个漏洞、某热门数据库中的三个严重漏洞,以及某热门操作系统内核中的 400 多个提权漏洞——这些修复正在与 Daybreak 合作伙伴一起推进。
OpenAI 自 2026 年 9 月 1 日起要求所有个人 Daybreak 账户使用硬件安全密钥,而 Daybreak Cyber Partner 计划已将服务提供商(Accenture、IBM、KPMG)和安全厂商(Palo Alto Networks、CrowdStrike、Cisco)联合起来,把这些模型集成到他们的服务中。
We’re expanding our cybersecurity initiative Daybreak and introducing GPT-5.6-Cyber, a new model for advanced, authorized cybersecurity work.
🇨🇳 我们正在扩展 Daybreak 网络安全计划,并推出 GPT-5.6-Cyber,这是一款用于高级且经授权的网络安全工作的新模型。 — @OpenAI 在 X 上
Claude 在黎曼猜想上取得进展,但尚未解决
Anthropic 要求 Claude 的一个未公开研究版尝试攻克黎曼假设——Clay Mathematics Institute 千禧年大奖的七个问题之一,每个奖金 100 万美元。Claude 并未解决该问题,但在一个相关问题上取得了进展:它将满足该假设的黎曼 zeta 函数零点比例的下界从 41.6% 提升到 67.2%。
这项工作分两次会话完成,总计输出 3100 万个 token。第一次生成了 650 个初始想法,但全部未能奏效。第二次尝试中,Claude 协调了 60 个专门子代理(数学推导、想法生成、验证、写作),执行了 2400 条 shell 命令,并从 arXiv 下载了 54 篇文章来核实思路。结果随后由 Anthropic 的两位数学家审阅,再由外部专家 Brian Conrey 和 Dan Goldston 检查。Claude 生成了一份 在 Lean 中形式化验证 的证明,并通过了标准验证。
这一结果超出了通常基准测试的范畴:在一个开放几十年的问题上取得可测量的改进,并经过独立验证和形式化证明,说明 Anthropic 现在如何测试其研究模型,已不再局限于传统的软件工程任务,而是转向基础数学问题。
We asked an unreleased research version of Claude to take a stab at the Riemann hypothesis. It didn’t solve it, but it did make strides on a related problem: it increased the lower bound for the fraction of zeros of the Riemann zeta function that satisfy the hypothesis from 41.6% to 67.2%.
🇨🇳 我们让 Claude 的一个未公开研究版去尝试黎曼假设。它没有解决这个问题,但在一个相关问题上取得了进展:它将满足黎曼假设的黎曼 zeta 函数零点比例的下界从 41.6% 提高到 67.2%。 — @AnthropicAI 在 X 上
Anthropic:定价与安全
Sonnet 5 的首发定价变为永久
Anthropic 确认,Claude Sonnet 5 的首发定价——输入每百万 token 2 美元,输出每百万 token 10 美元——将变为永久定价。该模型于 6 月发布时,这一定价被描述为促销价,有效期至 2026 年 8 月 31 日。Anthropic 因此消除了围绕该首发价格构建成本预测的团队所面临的不确定性:该模型在开学季不会预期涨价,这也巩固了其在高 token 用量场景中的价格竞争力。
🔗 公告
Anthropic 认为提示注入“在很大程度上已被解决”
Anthropic 的 Claude Code 产品负责人 Boris Cherny 表示,提示注入——针对用户和 AI 代理最常见的攻击方式,即恶意网站或文档隐藏一条由模型执行的指令——如今在 Claude 模型上已经在实践中大体得到解决。他指出,这一进展主要来自模型训练,并辅以多个叠加的安全分类器:模型 + 探针(probe)+ 自动模式的组合会将攻击成功率降至 0%,而这一机制将于 8 月 14 日成为 Claude Code 的默认权限模式。需要说明的是,这是一条在 X 上发布的公开声明,并非带有详细方法学的正式研究论文。
🔗 Tweet
开发者工具:Amp 转向 OpenAI,Copilot Chat 改进
如果绑定 ChatGPT 订阅,Amp 将其模式系统切换到 OpenAI
代理式代码工具 Amp 在账户关联 ChatGPT 订阅时,会修改其模式路由逻辑(“the Dial”)。在绑定订阅的情况下,low、medium 和 high 模式将切换为 OpenAI 模型(low 模式和代码复审使用 GPT-5.6 Terra,high 模式下的 agent 和 oracle 使用 GPT-5.6 Sol),而不再使用 GLM-5.2 或 Claude Fable。若未绑定订阅,则不会有任何变化。Amp 将放弃 Claude Fable 作为 oracle 模型的原因归结为前沿模型性能趋同:其联合创始人 @sqs 认为,未来的测试不太可能证明 Fable 与所使用的 OpenAI 模型之间 80 倍价格差的合理性。Ultra 模式不受影响,仍继续运行在 Claude Fable 上。
github.com 上的 Copilot Chat:改进的对话控制
GitHub 更新了 github.com 上的 Copilot Chat,带来了三项改进,且对所有套餐均为正式可用。现在更容易访问最近的对话;在生成回复时,聊天窗口可以缩小(minimize),随后再重新打开以继续交流;聊天中还会直接显示 token 消耗指示器——可按会话和按消息查看明细。这些调整更多是可用性改进,而非重大新功能,但它们回应了受限 Copilot 配额账户的日常实际使用需求。
开源生态与推理
NVIDIA 发布 Magpie TTS Multilingual,为 12 种语言的语音智能体提供开放 TTS
NVIDIA 发布 Magpie TTS Multilingual,这是一款约 3.57 亿参数的开放权重语音合成模型,采用 NVIDIA Open Model License,覆盖十二种语言(包括法语),且每种语言都提供男女声。其在 GPU B200 上单流的首音延迟达到 32 ms(64 路并发时为 239 ms),在 H100 上为 47 ms,在 A100 上为 79 ms,最高实时因子可达 320 倍。字符错误率也有所下降:法语从 2.70% 降至 1.54%,西班牙语从 1.14% 降至 0.60%。可通过 Hugging Face 上的开放权重或 NVIDIA NIM 进行生产部署。
一种蒸馏技术将所需 GPU 内存最多降低 15 倍
Multiverse Computing 发布了一种知识蒸馏技术,将教师模型的 logits 离线缓存与融合后的 KL 损失函数结合起来,从而避免将完整的 vocab × 序列长度矩阵实体化。结果是:在 32K token 上下文下,GPU 内存从 85.2 GB 降至 5.45 GB(最多减少 15.6 倍);一个 GPT-OSS 20B 模型的蒸馏从四个 GPU 节点缩减为一个,同时迭代时间约缩短 5 倍。将该技术应用于 GPT-OSS 120B 和 Kimi-K3(2.8T 参数)时,在 BoolQ 和 HellaSwag 上可保留约 90% 的教师模型精度。代码已在 GitHub 上开源。
通过 Together AI,DeepSeek-V4-Flash 可在 Ollama 云上使用
Together AI 现在为 Ollama 云上的 DeepSeek-V4-Flash 提供底层推理基础设施,并将其宣传为该开放权重模型可获得的最佳性能托管服务。该服务强调零数据保留政策,以及在美国和欧盟的托管——对于希望使用 DeepSeek-V4-Flash 而又不想依赖中国基础设施的企业而言,这是一个主权方面的卖点。这是一个新的分发渠道,补充了 DeepSeek-V4-Flash 已经可以直接在 Together AI 上使用的既有可用性。
🔗 Tweet
Sakana AI 基于 Gemma 4 训练其 Fugu 编排器
Sakana AI 发布了其多智能体编排产品 Fugu 的新版本编排主模型,这一次基于开放模型 Gemma 4 训练,并补充了此前已有的可切换模型池。该两层架构——一个负责分配任务的小型编排模型,以及一个执行实际处理的模型池——借鉴了在 ICLR 2026 上展示的 Trinity 和 Conductor 研究。内部评估显示,其编排性能与前一版本相当,同时成本更低。Sakana AI 也着眼于未来开发自有编排模型,以满足日本数字主权的要求。
Together AI 详细介绍与 Cursor 的实时推理合作
Together AI 发布了一篇与 Cursor 合写的文章,详细介绍双方的推理基础设施合作:当开发者正在积极编辑文件时,集成到编辑器中的智能体会生成代码,这就对延迟提出了严格要求——模型响应必须无缝插入编辑器的反馈回路,而不能打断工作流。文章展示了 Together AI 如何构建其基础设施以在大规模下满足这些目标,这是其专用推理服务面向 AI 辅助开发工具的一个具体使用案例。
🔗 Tweet
生成媒体:ElevenLabs 进入 Deutsche Telekom,MiniMax 详解 H3
ElevenLabs 将其 AI 语音技术部署到 Deutsche Telekom
ElevenLabs 宣布与欧洲最大的电信运营商 Deutsche Telekom 建立合作伙伴关系,将其 AI 语音技术集成到三个层面:呼叫中心、面向消费者的应用,以及网络本身。AI 通话助手运行在 ElevenLabs 上,并直接集成到网络中,因此无需专用应用即可在任何能够拨打电话的移动设备上使用——包括通话中的实时协助、实时翻译,以及通话转写/摘要。该合作最初在 2025 年初是作为一组应用功能启动,后来演变为嵌入 Deutsche Telekom 核心服务的集成,并计划进一步扩展。
🔗 Tweet
MiniMax 详细介绍 H3 的开源路线图
在 Reddit 上进行了一场 AMA 之后,MiniMax 发布了其视频模型 H3 开源路线图的摘要。在版权问题澄清之后,转向 Apache-2.0 许可证“摆上了台面”,并且后续还会发布一份完整的技术报告。MiniMax 还计划开源 H3-Regenerate-2K 的权重,这是一种潜空间中的再生模型,可将 768p 结果重新生成到 2K;同时还包括一种稀疏注意力(sparse attention)实现、一种正在研究中的低延迟 4-NFE/8-NFE 变体,以及一个源自 H3 系列的统一图像生成/编辑模型。Ref2VA 工作流已经可以把多个片段串联起来,生成 60 秒视频。
🔗 Tweet
多模态智能体与原生 AI 金融
Qwen-MM-Plugins:让多模态智能体原生化
AlibabaQwen 宣布推出 Qwen-MM-Plugins,这是一个插件家族,旨在让任何智能体执行环境(_agent harness)都变成多模态原生:支持图像、视频和文档读取、视频编辑,以及处理 3D/CAD 文件。其思路是:不是单独提供一个多模态模型,而是在开发者已经在使用的环境上叠加一层插件。此次公告没有披露基准测试、定价或具体可用时间——目前仍处于产品预告阶段,只配有一段演示视频。这次发布延续了 Qwen 的 2026 战略,即其重心已从新的原始模型权重转向多模态智能体工具链。
🔗 Tweet
构建原生 AI 金融职能的五条经验
OpenAI 的 CFO Sarah Friar 分享了构建原生 AI 金融职能的五条经验,围绕两个目标展开:零日结账(对公司财务进行实时、已对账且可追踪的视图)和持续预测。这些经验包括:先向所有人开放访问权限,再创造使用理由——例如一次金融黑客松催生了 IR-GPT,一个用于回答投资者尽调问题的定制 GPT;将自下而上的实验与自上而下的战略结合起来;用依托完整业务上下文的“活工具”取代静态电子表格;在每个工作流中建立清晰的责任机制;以及衡量 AI 的投资回报。
🔗 Building an AI-native finance function
ChatGPT Business 将推出 Premium 席位
OpenAI 为 ChatGPT Business 推出 Premium 席位,为最活跃的员工提供比 Standard 席位高 5 倍的使用额度,并取消五小时使用上限。
| 席位类型 | 月费 | 年费(按月计) |
|---|---|---|
| Standard | $25/用户 | $20/用户 |
| Premium | $125/用户 | $100/用户 |
企业可以在同一个工作区内混用 Standard 与 Premium 席位。上线促销:在 2026 年 8 月 20 日 前注册的工作区所有者,每新增一个 Premium 席位可获得 $100 额度(最多 5 个席位可得 $500),并且在正式全面开放前可提前使用。
🔗 Premium seats for ChatGPT Business
简讯
- Claude Code —— CPU 与内存性能提升:团队表示,过去几个月在 CPU 使用和内存方面都有明显改善,99 分位(P99 RSS)表现也更好,但未公布具体数字。🔗 Tweet
- Replit CEO 在 Platformer 中谈“self-driving company”:Amjad Masad 详细阐述了由内部 bot 和使用应用来代替人类的智能体驱动的公司愿景。🔗 Tweet
- Sakana AI 将其 RSI Lab 扩展到具身 AI:公司希望为具身 AI 构建世界模型,并在东京招聘全职与实习岗位。🔗 Tweet
- FC Bayern Munich 与 Google Pixel 和 Gemini 达成合作:已宣布合作,但未说明具体性质(赞助、产品集成等)。🔗 Tweet
- Gemini:参观美国农业博览会的小贴士:Google 博客的生活方式文章总结了 Gemini 的五个既有用途(路线规划、Ask Maps、AI Mode、Gemini Live、照片编辑),没有新功能。🔗 Google Blog
- GitHub 在印度的计费:客户现在可以通过符合印度储备银行要求的电子授权,启用使用已保存银行卡的自动定期支付。🔗 Changelog
- GitHub 弃用按讨论串定制订阅:仅保留 Subscribed/Not subscribed 两种状态,现有定制订阅将自动切换为 Subscribed。🔗 Changelog
- NVIDIA 为 GB200 上的 Qwen 3.5 优化 vLLM:这些优化达到每 GPU 每秒 25,000 个 token,为 Qwen 3.8 的发布做准备。🔗 Tweet
- Codex Build Week——项目与获奖者即将公布:OpenAI 表示,参与者已使用 Codex 将想法变成真实项目;获奖者公告即将发布。🔗 Tweet
- OpenAI 致德克萨斯州州长的信:公司详细说明了其对该州 AI 基础设施负责任发展的承诺。🔗 OpenAI
- Model ML 用 GPT-5.6 Sol 加速金融工作:该公司自动生成可追踪的 PowerPoint 演示文稿和 Excel 工作簿,在一个 Excel 工作流上使用的 token 比 Opus 5 少 36%。🔗 OpenAI
这意味着什么
开放权重竞赛正在加速并且分化:Meta(Muse Glimmer)、Alibaba(Qwen-MM-Plugins)、MiniMax(H3 路线图)和 Sakana AI(Fugu 基于 Gemma 4)在同一周都发布了可复用的组件,而不仅仅是封闭模型。趋势已不再局限于文本:NVIDIA 发布了一个 3.57 亿参数的多语言 TTS,Sakana AI 也明确把数字主权作为选择理由——Together AI 在欧盟和美国托管 DeepSeek-V4-Flash 时也提出了同样的论点。
AI 安全正在从实验室走向真实生产。OpenAI 的 GPT-5.6-Cyber 不只是给出一个基准分数:它实际修复了 V8 中一个真实的 CVE 以及其他数百个漏洞,同时还配套了更严格的访问制度(自 9 月起强制使用硬件密钥)。另一方面,Anthropic 声称通过“模型 + 分类器”的叠加方式,已在防御侧基本消除了提示注入——这两种互补方法(一个是工具化攻击,另一个是强化防御)表明,安全正在成为产品差异化的一个独立维度,而不再是次要议题。
在基础设施层面,推理经济学仍在持续承压:Multiverse Computing 的蒸馏技术将所需 GPU 内存减少了 15 倍,Together AI 通过与 Cursor 的合作强化了代码编辑场景下的严格延迟约束,Anthropic 则将 Sonnet 5 的价格长期稳定下来。综合来看,这些动向说明,随着智能体和交互式用法的普及,推理成本正持续受到压力。
最后,AI 正在进入企业的支持职能,也在进入基础研究。OpenAI 记录了自身财务职能如何变成 AI 原生,并推出了增强容量的 ChatGPT Business 席位;与此同时,Model ML 报告了在 Excel 工作流上的具体 token 节省。另一方面,Claude 在黎曼猜想上的结果——经过形式化验证并由外部数学家复核——提醒我们,这些模型同样也在被用于基础研究问题,而不仅仅是产品场景。
来源
- Meta 推出 Muse Glimmer
- NVIDIA — GPU 加速的 Muse Glimmer 端点
- OpenAI — 在网络防御窗口收窄之际扩展 Daybreak
- OpenAI — 在 X 上宣布 Daybreak/GPT-5.6-Cyber
- Anthropic — 在 X 上宣布 Riemann
- Anthropic — Riemann 研究博文
- Anthropic — Sonnet 5 永久定价
- Anthropic — 提示注入已被大幅解决
- Amp — 我们改变了 Dial
- GitHub — Copilot on web 扩展对话控制
- NVIDIA — Magpie TTS Multilingual
- Multiverse Computing — 知识蒸馏
- Together AI — DeepSeek-V4-Flash on Ollama
- Sakana AI — Fugu × Gemma 4
- Together AI — Cursor 合作
- ElevenLabs — Deutsche Telekom 合作
- MiniMax — H3 路线图
- Alibaba_Qwen — Qwen-MM-Plugins
- OpenAI — Building an AI-native finance function
- OpenAI — Premium seats for ChatGPT Business
- Claude Code — CPU/内存性能提升
- Replit — self-driving company
- Sakana AI — 具身 AI RSI Lab
- FC Bayern Munich × Google Pixel × Gemini
- Google Blog — Gemini 与农业博览会
- GitHub — 印度计费
- GitHub — 按线程订阅弃用
- vLLM/NVIDIA — Qwen 3.5 优化
- OpenAIDevs — Codex Build Week
- OpenAI — 致德克萨斯州州长的信
- OpenAI — Model ML