ai-powered-markdown-translator使用 gpt-5.6-sol 将文章从法语翻译成中文。
整个 8 月 29 日和 30 日的周末只有十二条公告,涉及五个领域——相比之下,前一天有二十二条,28 日则有四十二条。这是两个因素叠加的结果,而两者都不应被掩盖。29 日是星期六,30 日是星期日:几乎所有官方博客都没有发布任何内容。此外,采集期间 X 发生故障,用于提供个人资料动态流的接口停止响应;二十三个受关注的账号——包括图像与视频生成领域以及开发工具领域的账号——始终无法访问。因此,仅通过推文发布的公告可能躲过了扫描。
当天的内容分为两类。产品方面,xAI 将 Grok Bot 接入 X 网络,GitHub 则详细介绍了 Issues 的五项改进。研究方面,所有成果都来自 Hugging Face 博客及个人贡献者:一种可以从一个视觉模型迁移到竞争对手模型的线性探针、一款仅在一台 MacBook 上完成预训练的后 Transformer 模型、一个能让 Qwen3-4B 装入 2.60 GB VRAM 的 Leech 格网络,以及一种在 agent 生成过程中将其中断的方法。这些都是研究成果,并非产品发布。
Grok Bot 接入 X
8 月 29 日——xAI 在其新闻动态中发布了自主 agent 产品 Grok Bot 的更新:该产品如今与 X 实现了更紧密的集成。
其机制只需连接账号。用户从 Grok Bot 关联自己的 X 账号;如果尚无开发者账号,xAI 会自动为其创建一个——这是以编程方式访问该网络的必要条件。此外,Grok Bot 付费订阅者还会获得免费的 X API 初始额度,但 xAI 并未说明额度大小及有效期限。
启用连接器后,Bot 可以搜索帖子、读取其所有者的新闻动态、查看提及,并汇总网络上正在传播的内容。开始使用只需打开 Grok Bot,再通过 X 连接器完成连接。
xAI 明确将此次发布称为该集成的首个版本,并表示将继续简化 Grok Bot 在 X 上的工作流程。
GitHub Issues:五项新功能,包括支持作用域感知的依赖项 REST API
8 月 29 日——GitHub 详细介绍了 GitHub Issues 的五项改进。这些改进直接在 X 上公布,没有对应的更新日志条目,因此该帖子本身就是一手来源。
其中四项旨在提升导航体验。视图现在可以固定在侧边栏中,无需每次会话都重新构建筛选器。反应区域如今会显示个人资料头像,而不再只是数量。仪表板的显示密度变得可调,这对于包含大量条目的仓库很实用。已关闭的子 issue 可以隐藏,从而简化用作项目进度跟踪的父 issue。
第五项对自动化最具结构性意义:issue 依赖项 REST API 现在支持作用域感知(scope-aware)。issue 之间的依赖关系描述了任务应按何种顺序处理,如今可以在考虑作用域的情况下进行查询——这直接关系到根据仓库跟踪信息构建工作计划的 agent 和脚本。GitHub 尚未说明这五项改动的可用范围。
| 公布的新功能 | 改动范围 |
|---|---|
| 在侧边栏中固定视图 | Issues 导航 |
| 在反应区域显示个人资料头像 | 反应显示 |
| 可调节仪表板密度 | 仪表板 |
| 隐藏已关闭的子 issue | 父 issue 与子 issue |
| 支持作用域感知的依赖项 REST API | REST API、issue 之间的依赖关系 |
Gala:一款仅在一台 MacBook 上预训练的后 Transformer 模型,能以恒定速度读取 1000 万个 token
8 月 29 日——一个工作名称为 Gala 的小型语言模型家族,仅使用一台 MacBook——M3 Max、40 核 GPU、128 GB 统一内存——通过纯 MLX 从零开始完成预训练,耗时五天。
该实验源于一次视角反转。Transformer 是为稠密矩阵乘法资源充裕、而高带宽内存稀缺的硬件设计的;Mac 则恰好相反。因此,所选架构会积累参数和状态,同时严格控制每个 token 所需的 FLOPs。
最终测试是在这台笔记本电脑上以批量大小 1 处理 1050 万个来自 FineWeb 的真实文本 token。各项指标均未增长:在整个范围内,循环状态始终固定为 3.07 MB,解码速度也没有下降。随后 2000 个 token 的损失同样没有上升。使用相同数据训练的基准 Transformer,在上下文达到 32k 时解码速度便只有 134 tokens/s;若上下文达到 100 万个 token,则需要约 33 GB 的 KV cache。
| 达到的上下文长度 | 解码速度 | 随后 2000 个 token 的损失 | 循环状态 |
|---|---|---|---|
| 32 768 | 382.3 tokens/s | 3.630 | 3.07 MB |
| 1 048 576 | 388.1 tokens/s | 3.534 | 3.07 MB |
| 5 242 880 | 386.2 tokens/s | 3.590 | 3.07 MB |
| 10 485 760 | 385.8 tokens/s | 3.296 | 3.07 MB |
输入处理速度仍与数据量呈线性关系,约为 28 000 tokens/s,处理 1000 万个 token 约需六分钟。该模型连同运行日志一并发布,文章还专门用一个章节说明了它无法做到的事情。
A post-transformer language model, pretrained from scratch on one MacBook in pure MLX, that reads 10M tokens of context at constant speed. Five days, every number measured, everything released.
🇨🇳 一款后 Transformer 语言模型,仅用一台 MacBook 和纯 MLX 从零开始预训练,能以恒定速度读取 1000 万个上下文 token。历时五天,每项数据均经过实测,所有内容全部公开。 — Arjun Reddy,发表于 Hugging Face 博客
CUDA kernel 中的 Leech 格网络让 Qwen3-4B 装入 2.60 GB VRAM
8 月 29 日——每个权重的 bit 数,是唯一能改变可承载模型之机器类别的因素:采用 2-bit 时,一个 700 亿参数模型的体积会从 140 GB 降至约 18 GB,从而可装入一块 24 GB 显卡。但质量仍须得到保证,而在这一压缩级别下,已报告的最佳质量来自 Qualcomm AI Research 的研究成果:在 Leech 格网络上采用 24 元素分块向量量化。
瓶颈在软件。出于简化考虑,随论文发布的 CUDA kernel 只能解码该格网络的一层,速度仍慢于竞争方法。然而,2-bit 真正需要的码本是多个层的并集:包含 301 个等价类,以及一个 47-bit 索引,用于指向 1.1 × 10¹⁴ 个点中的某一点。作者没有在任何地方找到适用于该索引的解码器。
于是他亲自编写了一个。该项目的数学核心——格网络、精确最近邻搜索、48-bit 双射索引、球面 GPTQ——全部用 Rust 实现,不依赖任何外部库,并配备了此前缺失的融合 CUDA 解码器。
| 测量项目 | 测得数值 |
|---|---|
| 量化模型 | Qwen3-4B |
| VRAM 占用 | 2.60 GB |
| 生成吞吐量 | 87 tokens/s |
| 2-bit 等价类 | 301 |
| 索引大小 | 47 bits,涵盖 1.1 × 10¹⁴ 个点 |
| 2-bit 的 700 亿参数模型 | 从 140 GB 降至约 18 GB |
在贪心解码中,该量化模型生成的 token 与稠密模型相同,仅在相等值的决胜规则上存在细微差异。作者本人提出了两点保留意见:其解码器仍慢于竞争对手的 QTIP kernel,后者读取的字节数少 2.40 倍,运行速度快 2.27 倍;此外,该预印本由作者自行上传,尚未经过同行评审。代码和数据均已公开。
在一个视觉模型上训练的线性探针可用于竞争对手的模型
8 月 30 日——来自四家不同公司的四个多模态模型对相同图像进行编码。它们均被冻结,没有进行微调,甚至隐藏状态的宽度也各不相同:分别为 5 376、5 120、2 560 和 2 048 维。按理说,在其中一个模型上学到的探针不应能在另一个模型上运行,但它确实可以。
实验方案极为简洁。一个线性探针——仅包含单个权重矩阵——学习根据某个模型的状态预测图像标签,随后无需重新训练,便可直接用于另一个模型的状态;两个空间之间的映射仅以训练数据行作为桥梁,通过 ridge regression 估算。
| 评估领域 | 原生 AUROC | 迁移 AUROC | 迁移代价 |
|---|---|---|---|
| 卫星图像,17 类土地用途 | 0.9507 | 0.9484 | 0.0024 |
| ChestX-ray14 胸部 X 光片,4 个模型中的 3 个 | 0.7440 | 0.7511 | 负值 |
在胸部 X 光片任务中——使用官方测试列表,包含从未在训练中出现过的患者的 25 596 张影像——迁移后的得分超过原生得分,六个跨模型方向中有四个胜过目标模型自身的探针。严谨的测量方式说明了为何这一结果值得认真对待:校正前,无关元素之间的原始余弦相似度最高达到 0.998;经过中心化后,四家供应商的数据均降至 0.005 或以下;而且每项结论都同时公布了其随机基线——在卫星测试集上打乱标签后为 0.5014。
Together AI 称 GLM-5.3 的幻觉率优于两个闭源模型,但未说明 benchmark 名称
8 月 30 日——Together AI 将 GLM-5.3 的低幻觉率称为该模型被低估的一个方面,并将其与两个领先的闭源模型进行比较。
| 对比模型 | 相对于 GLM-5.3 的幻觉率 |
|---|---|
| GLM-5.3 | 基准 |
| Claude Fable 5 | 高出 2 倍以上 |
| GPT-5.6 Luna | 高出 3 倍以上 |
这一测量结果应结合其背景理解。Together AI 托管 GLM-5.3 并销售其推理服务,因此该来源并不中立。帖子既未说明所用 benchmark,也未提供绝对数值或幻觉统计方法,只给出了比率。帖子还附有一段短视频,但发布的文字中没有任何原始数据。因此,它只能被视为相对排名,而非独立评估。
这一角度仍值得关注,因为它补充了前几日描绘的模型画像:29 日发布的 DeepSWE 对比衡量的是编码能力和成本,而不是生产环境中的事实可靠性。
an underrated part of glm-5.3 is its low hallucination rate
claude fable 5 is over 2x higher, while gpt-5.6 luna is over 3x higher
🇨🇳 GLM-5.3 被低估的一点是它的幻觉率很低。Claude Fable 5 的幻觉率高出 2 倍以上,而 GPT-5.6 Luna 则高出 3 倍以上。 — @togethercompute 在 X 上
简讯
- Reflexive Role Routing:一种在 agent 生成过程中将其中断的方法——一个单线性层探针在生成期间读取两个数值:prompt 目标与当前轨迹之间的偏移,以及输出通过审查的估算概率;冻结的控制器利用这两个数值决定是否中断。该过程被形式化为半马尔可夫决策,以免丢弃已经生成的上下文。预印本已以 DOI 10.5281/zenodo.22171581 提交。🔗 Hugging Face 博文
- 由前沿模型生成的一次性风险评估——一个 prompt 让强大模型创建全新的 benchmark,其评分标准在对话中保持私密;受评模型完成测试后,其回答被送回对话进行评分,随后该 benchmark 即被丢弃——作者不认为这能解决数据污染问题,只是减少了对相同公开问题的依赖。其主要价值在于强制将结果区分为意愿(willingness)、能力(capability)和促进作用(enablement)。🔗 Hugging Face 博文
- CUDA 的默认失败模式是沉默——这是一篇 GPU 编程第一周的学习笔记,以最简单的程序为基础:将两个各含一千个数字的列表相加。真正令作者印象深刻的不是 GPU 如何工作,而是它发生故障时悄无声息。没有任何公告,也没有发布模型。🔗 Hugging Face 博文
- GitHub 再次推广 Dependabot 更新分组功能——在 Microsoft 的 GCToolkit 项目中,大约每六个 commit 就有一个只是升级单项依赖;仅对
dependabot.yml文件进行三处修改,就通过将更新分组并降低其频率解决了噪声问题,同时不延误安全修复。所指文章发布于 2026 年 7 月 29 日,只有转发发生在 8 月 30 日。🔗 @github 的帖子 - WebMCP Challenge:9 月 3 日截止提交,8 月 31 日举行问答活动——OpenAI Developers 提醒,WebMCP 黑客松项目可在 9 月 3 日前提交;同一动态中还宣布,将于 8 月 31 日星期一上午 11 时(PT)在 Discord 举行问答活动(office hours),并由竞赛合作伙伴 Chrome、Cloudflare、Shopify、Vercel、Render 和 Netlify 参与。该黑客松本身已于 8 月 25 日公布。🔗 @OpenAIDevs 的帖子
- Cohere 发布三张 Waterloo 照片,但没有相关公告——官方账号继续强化该公司的加拿大定位,没有产品发布、没有数据,也没有链接。不存在可供报道的事实内容;在此列出仅为保证时间窗口的完整性。🔗 @cohere 的帖子
这意味着什么
消费级硬件再次成为设计约束,而非只能被动承受的限制。 周末发布的两项工作基于同一前提:由可用机器决定架构,而不是反过来。Gala 专为 Mac 设计——内存充裕,FLOPs 稀缺——因此它选择增加参数和状态,而不是增加每个 token 的计算量;其结果是,在上下文长度从 32,768 个 token 增加到 1,050 万个 token 时,解码速度不会下降。Leech 网络量化则着眼于链条的另一端:将一个拥有 700 亿参数的模型从 140 GB 压缩到约 18 GB,也就是让它能够装进普通个人拥有的显卡。两者都没有声称能与前沿模型竞争,而这也并非重点:它们都把问题从模型有多大,转向哪类机器能够承载它。
在一个模型上训练的探针,可以在相邻模型上读取。 当天最令人意外的结果,也是最低调的结果。如果来自四家公司的四个冻结模型对图像的编码方式足够相似,以至于仅用一个权重矩阵就能从一个模型迁移到另一个模型,AUROC 损失仅为 0.0024——甚至可能出现负损失——那么,构建在这些表征之上的工具便不再受制于其校准时所用的供应商。论文自身也给出了这种实际解读,但随即指出了阻碍它成为现成方法的限制:迁移映射是针对每一对模型分别拟合的,没有任何证据表明其中任意一个映射能适用于未参与该拟合的模型。其测量规范始终严谨:任何比较之前都会校正各向异性,并在每项分数旁公布随机基线。
可靠性主张并未附带计量依据。 Together AI 宣称 GLM-5.3 的幻觉率优于两个闭源模型,却没有指出任何 benchmark、公布任何绝对数值,也没有描述其统计方法——与此同时,它还在销售被自己列为第一名的模型的推理服务。与同一周末发布的研究文章相比,反差十分鲜明:后者会在结果旁公布随机基线,并详细说明实验协议。没有参照标准的报告不算测量,只是商业论点,理应按商业宣传归类。
在产品方面,这个周末交付的只有基础设施管道——而这恰恰是 agent 成败的关键。 xAI 没有发布模型:它把 Grok Bot 接入 X,代替用户创建开发者账户,并发放 API 额度以降低入门门槛。GitHub 也没有宣布令人惊艳的功能:它只是让 Issues 依赖关系的 REST API 能够感知作用域。在这两种情况下,改变的都是访问权限和可查询范围,而非模型能力。对于构建需要读取社交网络或工单跟踪系统的 agent 的人而言,这类工作最不显眼,却也最具决定性。
来源
- xAI——Grok Bot 现已可与 X 配合使用
- GitHub——GitHub Issues 的五项新功能
- Gala:在 MacBook 上训练的 post-transformer 模型
- Leech 网络量化与融合 CUDA 解码器
- 在冻结视觉模型之间迁移的线性探针
- Together AI——GLM-5.3 的幻觉率
- Reflexive Role Routing
- 由前沿模型生成的一次性风险评估
- 关于 CUDA 静默失败的学习笔记
- GitHub——合并 Dependabot 更新
- OpenAI Developers——WebMCP Challenge 与问答环节
- Cohere——Waterloo 照片