搜索

Grok Bot 接入 X,GitHub 宣布 Issues 的五项新功能,一款在 MacBook 上训练的后 Transformer 模型可读取 1000 万个 token

由人工智能生成的文章
Grok Bot 接入 X,GitHub 宣布 Issues 的五项新功能,一款在 MacBook 上训练的后 Transformer 模型可读取 1000 万个 token

ai-powered-markdown-translator

使用 gpt-5.6-sol 将文章从法语翻译成中文。

在 GitHub 上查看项目 ↗

整个 8 月 29 日和 30 日的周末只有十二条公告,涉及五个领域——相比之下,前一天有二十二条,28 日则有四十二条。这是两个因素叠加的结果,而两者都不应被掩盖。29 日是星期六,30 日是星期日:几乎所有官方博客都没有发布任何内容。此外,采集期间 X 发生故障,用于提供个人资料动态流的接口停止响应;二十三个受关注的账号——包括图像与视频生成领域以及开发工具领域的账号——始终无法访问。因此,仅通过推文发布的公告可能躲过了扫描。

当天的内容分为两类。产品方面,xAI 将 Grok Bot 接入 X 网络,GitHub 则详细介绍了 Issues 的五项改进。研究方面,所有成果都来自 Hugging Face 博客及个人贡献者:一种可以从一个视觉模型迁移到竞争对手模型的线性探针、一款仅在一台 MacBook 上完成预训练的后 Transformer 模型、一个能让 Qwen3-4B 装入 2.60 GB VRAM 的 Leech 格网络,以及一种在 agent 生成过程中将其中断的方法。这些都是研究成果,并非产品发布。


Grok Bot 接入 X

8 月 29 日——xAI 在其新闻动态中发布了自主 agent 产品 Grok Bot 的更新:该产品如今与 X 实现了更紧密的集成。

其机制只需连接账号。用户从 Grok Bot 关联自己的 X 账号;如果尚无开发者账号,xAI 会自动为其创建一个——这是以编程方式访问该网络的必要条件。此外,Grok Bot 付费订阅者还会获得免费的 X API 初始额度,但 xAI 并未说明额度大小及有效期限。

启用连接器后,Bot 可以搜索帖子、读取其所有者的新闻动态、查看提及,并汇总网络上正在传播的内容。开始使用只需打开 Grok Bot,再通过 X 连接器完成连接。

xAI 明确将此次发布称为该集成的首个版本,并表示将继续简化 Grok Bot 在 X 上的工作流程。

🔗 Grok Bot 现已支持 X


GitHub Issues:五项新功能,包括支持作用域感知的依赖项 REST API

8 月 29 日——GitHub 详细介绍了 GitHub Issues 的五项改进。这些改进直接在 X 上公布,没有对应的更新日志条目,因此该帖子本身就是一手来源。

其中四项旨在提升导航体验。视图现在可以固定在侧边栏中,无需每次会话都重新构建筛选器。反应区域如今会显示个人资料头像,而不再只是数量。仪表板的显示密度变得可调,这对于包含大量条目的仓库很实用。已关闭的子 issue 可以隐藏,从而简化用作项目进度跟踪的父 issue。

第五项对自动化最具结构性意义:issue 依赖项 REST API 现在支持作用域感知(scope-aware)。issue 之间的依赖关系描述了任务应按何种顺序处理,如今可以在考虑作用域的情况下进行查询——这直接关系到根据仓库跟踪信息构建工作计划的 agent 和脚本。GitHub 尚未说明这五项改动的可用范围。

公布的新功能改动范围
在侧边栏中固定视图Issues 导航
在反应区域显示个人资料头像反应显示
可调节仪表板密度仪表板
隐藏已关闭的子 issue父 issue 与子 issue
支持作用域感知的依赖项 REST APIREST API、issue 之间的依赖关系

🔗 @github 的帖子


Gala:一款仅在一台 MacBook 上预训练的后 Transformer 模型,能以恒定速度读取 1000 万个 token

8 月 29 日——一个工作名称为 Gala 的小型语言模型家族,仅使用一台 MacBook——M3 Max、40 核 GPU、128 GB 统一内存——通过纯 MLX 从零开始完成预训练,耗时五天。

该实验源于一次视角反转。Transformer 是为稠密矩阵乘法资源充裕、而高带宽内存稀缺的硬件设计的;Mac 则恰好相反。因此,所选架构会积累参数和状态,同时严格控制每个 token 所需的 FLOPs。

最终测试是在这台笔记本电脑上以批量大小 1 处理 1050 万个来自 FineWeb 的真实文本 token。各项指标均未增长:在整个范围内,循环状态始终固定为 3.07 MB,解码速度也没有下降。随后 2000 个 token 的损失同样没有上升。使用相同数据训练的基准 Transformer,在上下文达到 32k 时解码速度便只有 134 tokens/s;若上下文达到 100 万个 token,则需要约 33 GB 的 KV cache。

达到的上下文长度解码速度随后 2000 个 token 的损失循环状态
32 768382.3 tokens/s3.6303.07 MB
1 048 576388.1 tokens/s3.5343.07 MB
5 242 880386.2 tokens/s3.5903.07 MB
10 485 760385.8 tokens/s3.2963.07 MB

输入处理速度仍与数据量呈线性关系,约为 28 000 tokens/s,处理 1000 万个 token 约需六分钟。该模型连同运行日志一并发布,文章还专门用一个章节说明了它无法做到的事情。

A post-transformer language model, pretrained from scratch on one MacBook in pure MLX, that reads 10M tokens of context at constant speed. Five days, every number measured, everything released.

🇨🇳 一款后 Transformer 语言模型,仅用一台 MacBook 和纯 MLX 从零开始预训练,能以恒定速度读取 1000 万个上下文 token。历时五天,每项数据均经过实测,所有内容全部公开。Arjun Reddy,发表于 Hugging Face 博客

🔗 Hugging Face 博文


CUDA kernel 中的 Leech 格网络让 Qwen3-4B 装入 2.60 GB VRAM

8 月 29 日——每个权重的 bit 数,是唯一能改变可承载模型之机器类别的因素:采用 2-bit 时,一个 700 亿参数模型的体积会从 140 GB 降至约 18 GB,从而可装入一块 24 GB 显卡。但质量仍须得到保证,而在这一压缩级别下,已报告的最佳质量来自 Qualcomm AI Research 的研究成果:在 Leech 格网络上采用 24 元素分块向量量化。

瓶颈在软件。出于简化考虑,随论文发布的 CUDA kernel 只能解码该格网络的一层,速度仍慢于竞争方法。然而,2-bit 真正需要的码本是多个层的并集:包含 301 个等价类,以及一个 47-bit 索引,用于指向 1.1 × 10¹⁴ 个点中的某一点。作者没有在任何地方找到适用于该索引的解码器。

于是他亲自编写了一个。该项目的数学核心——格网络、精确最近邻搜索、48-bit 双射索引、球面 GPTQ——全部用 Rust 实现,不依赖任何外部库,并配备了此前缺失的融合 CUDA 解码器。

测量项目测得数值
量化模型Qwen3-4B
VRAM 占用2.60 GB
生成吞吐量87 tokens/s
2-bit 等价类301
索引大小47 bits,涵盖 1.1 × 10¹⁴ 个点
2-bit 的 700 亿参数模型从 140 GB 降至约 18 GB

在贪心解码中,该量化模型生成的 token 与稠密模型相同,仅在相等值的决胜规则上存在细微差异。作者本人提出了两点保留意见:其解码器仍慢于竞争对手的 QTIP kernel,后者读取的字节数少 2.40 倍,运行速度快 2.27 倍;此外,该预印本由作者自行上传,尚未经过同行评审。代码和数据均已公开。

🔗 Hugging Face 博文


在一个视觉模型上训练的线性探针可用于竞争对手的模型

8 月 30 日——来自四家不同公司的四个多模态模型对相同图像进行编码。它们均被冻结,没有进行微调,甚至隐藏状态的宽度也各不相同:分别为 5 376、5 120、2 560 和 2 048 维。按理说,在其中一个模型上学到的探针不应能在另一个模型上运行,但它确实可以。

实验方案极为简洁。一个线性探针——仅包含单个权重矩阵——学习根据某个模型的状态预测图像标签,随后无需重新训练,便可直接用于另一个模型的状态;两个空间之间的映射仅以训练数据行作为桥梁,通过 ridge regression 估算。

评估领域原生 AUROC迁移 AUROC迁移代价
卫星图像,17 类土地用途0.95070.94840.0024
ChestX-ray14 胸部 X 光片,4 个模型中的 3 个0.74400.7511负值

在胸部 X 光片任务中——使用官方测试列表,包含从未在训练中出现过的患者的 25 596 张影像——迁移后的得分超过原生得分,六个跨模型方向中有四个胜过目标模型自身的探针。严谨的测量方式说明了为何这一结果值得认真对待:校正前,无关元素之间的原始余弦相似度最高达到 0.998;经过中心化后,四家供应商的数据均降至 0.005 或以下;而且每项结论都同时公布了其随机基线——在卫星测试集上打乱标签后为 0.5014。

🔗 Hugging Face 博文


Together AI 称 GLM-5.3 的幻觉率优于两个闭源模型,但未说明 benchmark 名称

8 月 30 日——Together AI 将 GLM-5.3 的低幻觉率称为该模型被低估的一个方面,并将其与两个领先的闭源模型进行比较。

对比模型相对于 GLM-5.3 的幻觉率
GLM-5.3基准
Claude Fable 5高出 2 倍以上
GPT-5.6 Luna高出 3 倍以上

这一测量结果应结合其背景理解。Together AI 托管 GLM-5.3 并销售其推理服务,因此该来源并不中立。帖子既未说明所用 benchmark,也未提供绝对数值或幻觉统计方法,只给出了比率。帖子还附有一段短视频,但发布的文字中没有任何原始数据。因此,它只能被视为相对排名,而非独立评估。

这一角度仍值得关注,因为它补充了前几日描绘的模型画像:29 日发布的 DeepSWE 对比衡量的是编码能力和成本,而不是生产环境中的事实可靠性。

an underrated part of glm-5.3 is its low hallucination rate

claude fable 5 is over 2x higher, while gpt-5.6 luna is over 3x higher

🇨🇳 GLM-5.3 被低估的一点是它的幻觉率很低。Claude Fable 5 的幻觉率高出 2 倍以上,而 GPT-5.6 Luna 则高出 3 倍以上。@togethercompute 在 X 上

🔗 @togethercompute 的帖子


简讯

  • Reflexive Role Routing:一种在 agent 生成过程中将其中断的方法——一个单线性层探针在生成期间读取两个数值:prompt 目标与当前轨迹之间的偏移,以及输出通过审查的估算概率;冻结的控制器利用这两个数值决定是否中断。该过程被形式化为半马尔可夫决策,以免丢弃已经生成的上下文。预印本已以 DOI 10.5281/zenodo.22171581 提交。🔗 Hugging Face 博文
  • 由前沿模型生成的一次性风险评估——一个 prompt 让强大模型创建全新的 benchmark,其评分标准在对话中保持私密;受评模型完成测试后,其回答被送回对话进行评分,随后该 benchmark 即被丢弃——作者不认为这能解决数据污染问题,只是减少了对相同公开问题的依赖。其主要价值在于强制将结果区分为意愿(willingness)、能力(capability)和促进作用(enablement)。🔗 Hugging Face 博文
  • CUDA 的默认失败模式是沉默——这是一篇 GPU 编程第一周的学习笔记,以最简单的程序为基础:将两个各含一千个数字的列表相加。真正令作者印象深刻的不是 GPU 如何工作,而是它发生故障时悄无声息。没有任何公告,也没有发布模型。🔗 Hugging Face 博文
  • GitHub 再次推广 Dependabot 更新分组功能——在 Microsoft 的 GCToolkit 项目中,大约每六个 commit 就有一个只是升级单项依赖;仅对 dependabot.yml 文件进行三处修改,就通过将更新分组并降低其频率解决了噪声问题,同时不延误安全修复。所指文章发布于 2026 年 7 月 29 日,只有转发发生在 8 月 30 日。🔗 @github 的帖子
  • WebMCP Challenge:9 月 3 日截止提交,8 月 31 日举行问答活动——OpenAI Developers 提醒,WebMCP 黑客松项目可在 9 月 3 日前提交;同一动态中还宣布,将于 8 月 31 日星期一上午 11 时(PT)在 Discord 举行问答活动(office hours),并由竞赛合作伙伴 Chrome、Cloudflare、Shopify、Vercel、Render 和 Netlify 参与。该黑客松本身已于 8 月 25 日公布。🔗 @OpenAIDevs 的帖子
  • Cohere 发布三张 Waterloo 照片,但没有相关公告——官方账号继续强化该公司的加拿大定位,没有产品发布、没有数据,也没有链接。不存在可供报道的事实内容;在此列出仅为保证时间窗口的完整性。🔗 @cohere 的帖子

这意味着什么

消费级硬件再次成为设计约束,而非只能被动承受的限制。 周末发布的两项工作基于同一前提:由可用机器决定架构,而不是反过来。Gala 专为 Mac 设计——内存充裕,FLOPs 稀缺——因此它选择增加参数和状态,而不是增加每个 token 的计算量;其结果是,在上下文长度从 32,768 个 token 增加到 1,050 万个 token 时,解码速度不会下降。Leech 网络量化则着眼于链条的另一端:将一个拥有 700 亿参数的模型从 140 GB 压缩到约 18 GB,也就是让它能够装进普通个人拥有的显卡。两者都没有声称能与前沿模型竞争,而这也并非重点:它们都把问题从模型有多大,转向哪类机器能够承载它。

在一个模型上训练的探针,可以在相邻模型上读取。 当天最令人意外的结果,也是最低调的结果。如果来自四家公司的四个冻结模型对图像的编码方式足够相似,以至于仅用一个权重矩阵就能从一个模型迁移到另一个模型,AUROC 损失仅为 0.0024——甚至可能出现负损失——那么,构建在这些表征之上的工具便不再受制于其校准时所用的供应商。论文自身也给出了这种实际解读,但随即指出了阻碍它成为现成方法的限制:迁移映射是针对每一对模型分别拟合的,没有任何证据表明其中任意一个映射能适用于未参与该拟合的模型。其测量规范始终严谨:任何比较之前都会校正各向异性,并在每项分数旁公布随机基线。

可靠性主张并未附带计量依据。 Together AI 宣称 GLM-5.3 的幻觉率优于两个闭源模型,却没有指出任何 benchmark、公布任何绝对数值,也没有描述其统计方法——与此同时,它还在销售被自己列为第一名的模型的推理服务。与同一周末发布的研究文章相比,反差十分鲜明:后者会在结果旁公布随机基线,并详细说明实验协议。没有参照标准的报告不算测量,只是商业论点,理应按商业宣传归类。

在产品方面,这个周末交付的只有基础设施管道——而这恰恰是 agent 成败的关键。 xAI 没有发布模型:它把 Grok Bot 接入 X,代替用户创建开发者账户,并发放 API 额度以降低入门门槛。GitHub 也没有宣布令人惊艳的功能:它只是让 Issues 依赖关系的 REST API 能够感知作用域。在这两种情况下,改变的都是访问权限和可查询范围,而非模型能力。对于构建需要读取社交网络或工单跟踪系统的 agent 的人而言,这类工作最不显眼,却也最具决定性。


来源