搜索

微软 ThinkingBox 基准登陆 OpenEnv 并对每项任务进行 20 次测试,Exgentic 数据集汇集 10 000 条 OpenTelemetry 格式追踪记录

由人工智能生成的文章
微软 ThinkingBox 基准登陆 OpenEnv 并对每项任务进行 20 次测试,Exgentic 数据集汇集 10 000 条 OpenTelemetry 格式追踪记录

ai-powered-markdown-translator

使用 gemini-3.8-flash-high 从法语翻译为中文的文章。

在 GitHub 上查看项目 ↗

在周六至周日的夜间,微软与 Hugging Face 将 ThinkingBox 接入了 OpenEnv:该基准测试将 507 项业务任务各自重放 20 次,并根据数据库的最终状态来评估 Agent,而重复测试改变了排名。10 月 4 日周日,三位作者介绍了 Exgentic Agent LLM Traces——在 Hub 的 Exgentic 组织下发布的 10 000 条 OpenTelemetry 格式的 Agent 执行记录。快讯方面,Claude Code 2.1.289 和 Copilot CLI 1.0.92-4 增强了安全护栏,Feyn 推出了基于 Meta SAM 3 构建的抠图模型 MultiMatte,而 ChatGPT Enterprise 自 10 月 1 日起可在 Admin console 中管理其插件。


微软与 Hugging Face 将 ThinkingBox 接入 OpenEnv:每项任务 20 次测试,排名发生变动

10 月 3 日 — 在一篇由微软与 Hugging Face 联合发布的博文中,Tuhin Kundu(微软)介绍了 ThinkingBox。这是一个根据 AI Agent 在数据库中留下的状态而非其回答来评估 Agent 的基准测试。该基准由 Microsoft Copilot Studio 团队与 Toloka 共同构建,并非全新产物(研究论文发表于 8 月 20 日,数据集于 8 月底发布):其新颖之处在于接入了由 Hugging Face 托管的开放 Agent 环境接口 OpenEnv,并公布了 18 个模型的结果。

其 507 个合成业务工作流(workflows)各自从干净状态开始重放 20 次,确定性裁判会将数据库的最终状态与预期状态进行比对。以下为作者给出的结果;其成本根据 OpenRouter 的标价(Claude Opus 5.5 采用 Anthropic 的价格)进行估算,仅供对比参考,并非实际账单:

评估模型总体 pass@120 次测试全部成功的任务数(共 507 项)每项可靠任务的成本
Claude Opus 5.567,16 %2417,80 美元
Claude Opus 566,50 %24113,30 美元
GPT-5.465,36 %1286,80 美元
GPT-5.6 Sol61,91 %829,76 美元
GPT-6 Astra58,31 %2317,45 美元
Kimi-K3 (开源权重)57,37 %6820,68 美元

重复测试改变了排名:作为表现最佳的开源权重模型,Kimi-K3 在 507 项任务中至少成功解决过 476 项,但在全部 20 次测试中每次都能成功的仅有 68 项;相比之下,Claude Opus 5 和 Claude Opus 5.5 均达到了 241 项。据该团队称,大约五分之四的失败源于工具的使用而非推理问题。代码采用 MIT 许可证,数据采用 CDLA-Permissive-2.0 许可证。

A trajectory is a claim. Database state is the evidence. Repetition is the trust test.

🇨🇳 轨迹是一种主张。数据库的状态才是证明。重复则是信任的检验。 — 微软与 Hugging Face 的博文

🔗 ThinkingBox-Bench 数据集 · OpenEnv 中的 ThinkingBox


Exgentic Agent LLM Traces:以 OpenTelemetry 格式保留的 10 000 条 Agent 执行记录

10 月 4 日 — 在 Hugging Face 社区博客上,Lena Dankin、Elron Bandel 和 Michal Shmueli-Scheuer 介绍了 Exgentic Agent LLM Traces,这是在 Hub 的 Exgentic 组织下发布的数据集:包含 10 000 条 Agent 执行记录和 242 000 次模型调用,每条记录均遵循 OpenTelemetry 的 GenAI 规范进行保存,并附有每次执行的得分与成本。

这些执行记录涵盖了六个基准测试(SWE-bench、BrowseComp Plus、AppWorld 以及 τ²-bench 的三种变体)和多达五种 Agent 架构设计。平均而言,Claude Opus 4.5 每次执行消耗 240 万个 token,而 GPT-5.2 为 552 000 个。

存在两点保留意见:评估的五款模型均属于上一代(DeepSeek-V3.2、Kimi-K2.5、GPT-5.2、Claude Opus 4.5 和 Gemini 3 Pro),且该博文将一个创建于 6 月 10 日且卡片中未声明许可证的仓库描述为当日发布。

🔗 博文 · Hugging Face 上的数据集


快讯

  • Claude Code 2.1.289 — 此版本包含 27 项更新,修复了 deny 和 ask 权限规则未能生效的四种情况;用户安装的插件无法再重写受管 MCP 服务器的连接工具描述,另外 18 项更新涉及 mod 和插件。🔗 来源
  • Copilot CLI 1.0.92-4 与 Copilot SDK 1.0.17-preview.4 — 处于预览版的 CLI(最新稳定版为 1.0.91)新增了用于列出、读取、设置和删除配置项的子命令 copilot config,且除非显式配置,否则不再将外层的 GITHUB_TOKEN 传递给沙箱 shell;SDK 引入了 OnSubagentStart 与 OnSubagentStop 钩子,用于丰富子 Agent 的首个 prompt,随后检查或替换其响应。🔗 CLI · 🔗 SDK
  • Feyn 的 MultiMatte — 这款抠图模型由文本引导:用户指定要保留的对象,模型便会移除其余部分,并通过 Alpha 遮罩(alpha matte)更好地呈现毛发和模糊区域。该模型基于 Meta 的 SAM 3 构建,并通过 LoRA 适配器进行微调,据作者称,其在 DIS-VD 上的 S-measure 达到 0,901,而 SAM 3 仅为 0,667;根据其卡片,其权重采用 Apache 2.0 许可证,自 8 月 20 日起便已上线。🔗 来源
  • ChatGPT Enterprise 插件进入 Admin console — 10 月 1 日,Enterprise 与 Edu 的版本说明宣布,ChatGPT Enterprise 工作区的所有者和管理员现在可在 Admin console 的 Plugins 和 Marketplaces 页面中管理插件及其市场(marketplaces);应用程序仍保留在 Workspace settings > Apps 中,并遵循既有权限。🔗 来源

这意味着什么

ThinkingBox 改变了对 Agent 提出的核心问题:不再是它能否完成某项任务,而是它能否每一次都能完成。单次尝试中,Kimi-K3 与 GPT-6 Astra 的差距不到 1 个百分点;而在 20 次测试中,它能够每次都成功的任务仅有 68 项,而后者达到 231 项。对于将修改数据库的操作托付给 Agent 的人来说,真正重要的是后一个数字,而该基准根据数据库的最终状态来衡量,而非 Agent 自称完成的工作。

成本同样遵循这一逻辑。仅折算到每次测试都能成功的任务上,GPT-5.4 是成本最低的(每项可靠任务 6,80 美元),而非单次成功测试成本最低(0,127 美元)的 GPT-5.6 Sol;相比之下,Kimi-K3 每项可靠任务的成本为 20,68 美元,是 GPT-5.4 的三倍多。作者提醒,这些金额仍是指标性对比,并非实际账单。

Exgentic Agent LLM Traces 的作者则指出了一个相似的局限:基准测试往往将一次执行简化为一个分数,而追踪记录则能展示所选工具、上下文的膨胀以及错误后的恢复过程。通过以标准格式保存每一次调用,他们认为这可以用来对照基准调试 Agent、用另一个模型重放某一环节,或在真实的 Agent 负载下测试推理基础设施;已有团队正在使用 Kubernetes SIG 的基准测试工具 inference-perf 进行此项尝试,其结果将在稍后公布。


来源