검색

Microsoft의 ThinkingBox 벤치마크, 작업당 20회 시도와 함께 OpenEnv에 등장, Exgentic 데이터셋은 OpenTelemetry 형식의 트레이스 10,000개 수집

인공지능으로 생성된 기사
Microsoft의 ThinkingBox 벤치마크, 작업당 20회 시도와 함께 OpenEnv에 등장, Exgentic 데이터셋은 OpenTelemetry 형식의 트레이스 10,000개 수집

ai-powered-markdown-translator

gemini-3.8-flash-high로 프랑스어에서 한국어로 번역된 기사.

GitHub에서 프로젝트 보기 ↗

토요일 밤부터 일요일 새벽 사이, Microsoft와 Hugging Face는 ThinkingBox를 OpenEnv에 연결했습니다. 이 벤치마크는 507개의 비즈니스 작업을 각각 20회씩 다시 실행하여 데이터베이스의 최종 상태를 기준으로 에이전트를 평가하며, 반복 실행에 따라 순위가 바뀝니다. 10월 4일 일요일, 세 명의 저자가 Hub의 Exgentic 조직을 통해 공개된 OpenTelemetry 형식의 10,000개 에이전트 실행 기록인 Exgentic Agent LLM Traces를 소개했습니다. 단신으로는 Claude Code 2.1.289 및 Copilot CLI 1.0.92-4가 가드레일을 강화했고, Feyn은 Meta의 SAM 3 기반 배경 분리 모델인 MultiMatte를 선보였으며, ChatGPT Enterprise는 10월 1일부터 Admin console에서 플러그인을 관리합니다.


Microsoft와 Hugging Face, OpenEnv에 ThinkingBox 연결: 작업당 20회 시도로 달라진 순위

10월 3일 — Microsoft와 Hugging Face의 공동 게시물로 소개된 글에서, Tuhin Kundu(Microsoft)는 AI 에이전트의 응답이 아닌 데이터베이스에 남긴 최종 상태를 기준으로 평가하는 벤치마크인 ThinkingBox를 설명합니다. Microsoft Copilot Studio 팀이 Toloka와 함께 구축한 이 벤치마크는 완전히 새로운 것은 아닙니다(8월 20일 연구 논문 발표, 8월 말 데이터셋 공개). 이번의 새로운 점은 Hugging Face가 호스팅하는 오픈 에이전트 환경 인터페이스인 OpenEnv를 통해 제공된다는 것과 18개 모델의 평가 결과가 공개되었다는 점입니다.

깨끗한 상태에서 시작하여 507개의 합성 비즈니스 워크플로(workflows)를 각각 20회씩 다시 실행하며, 결정론적 평가자가 데이터베이스의 최종 상태를 기대치와 비교합니다. 저자들에 따른 결과는 다음과 같으며, 비용은 OpenRouter 정가(Claude Opus 5.5의 경우 Anthropic 요금)를 기준으로 추정한 것으로 실제 청구서가 아닌 비교 지표입니다.

평가 모델전체 pass@120회 중 20회 모두 성공한 작업 (총 507개 중)신뢰할 수 있는 작업당 비용
Claude Opus 5.567.16%2417.80달러
Claude Opus 566.50%24113.30달러
GPT-5.465.36%1286.80달러
GPT-5.6 Sol61.91%829.76달러
GPT-6 Astra58.31%2317.45달러
Kimi-K3 (오픈 가중치)57.37%6820.68달러

반복 실행은 순위를 바꿉니다. 최고의 오픈 가중치 모델인 Kimi-K3는 507개 작업 중 476개를 한 번 이상 해결했지만, 20회 시도 모두에서 성공한 것은 68개에 불과했습니다. 반면 Claude Opus 5와 Claude Opus 5.5는 모두 241개를 기록했습니다. 연구팀에 따르면 실패 원인의 약 5분의 4는 추론보다는 도구 사용에서 비롯되었습니다. 코드는 MIT 라이선스, 데이터는 CDLA-Permissive-2.0 라이선스로 제공됩니다.

A trajectory is a claim. Database state is the evidence. Repetition is the trust test.

🇰🇷 궤적은 주장입니다. 데이터베이스의 상태가 증거입니다. 반복은 신뢰에 대한 시험입니다. — Microsoft와 Hugging Face 블로그 글

🔗 ThinkingBox-Bench 데이터셋 · OpenEnv 내 ThinkingBox


Exgentic Agent LLM Traces: OpenTelemetry 형식으로 저장된 10,000건의 에이전트 실행 기록

10월 4일 — Hugging Face 커뮤니티 블로그에서 Lena Dankin, Elron Bandel, Michal Shmueli-Scheuer가 Hub의 Exgentic 조직을 통해 공개된 데이터셋인 Exgentic Agent LLM Traces를 발표했습니다. 이 데이터셋은 각 실행의 점수와 비용을 포함하여 OpenTelemetry의 GenAI 규약에 따라 보존된 10,000건의 에이전트 실행 기록 및 242,000건의 모델 호출을 담고 있습니다.

이 실행 기록들은 6개 벤치마크(SWE-bench, BrowseComp Plus, AppWorld 및 τ²-bench의 3가지 변형)와 최대 5가지 에이전트 설계를 포괄합니다. 실행당 평균 토큰 소비량은 Claude Opus 4.5가 240만 토큰인 반면, GPT-5.2는 552,000토큰이었습니다.

두 가지 유의할 점이 있습니다. 5개 모델이 이전 세대(DeepSeek-V3.2, Kimi-K2.5, GPT-5.2, Claude Opus 4.5, Gemini 3 Pro) 모델이라는 점과, 블로그 게시물에서 당일 출시된 것으로 소개된 저장소가 실제로는 6월 10일에 생성되었으며 카드에 명시된 라이선스가 없다는 점입니다.

🔗 블로그 글 · Hugging Face 데이터셋


단신

  • Claude Code 2.1.289 — 27개 항목이 포함된 이번 버전에서는 deny 및 ask 권한 규칙이 적용되지 않던 네 가지 경우를 수정했습니다. 사용자가 설치한 플러그인이 관리형 MCP 서버의 연결 도구 설명을 덮어쓸 수 없도록 변경되었으며, 나머지 18개 항목은 모드(mod) 및 플러그인에 관한 내용입니다. 🔗 출처
  • Copilot CLI 1.0.92-4 및 Copilot SDK 1.0.17-preview.4 — 프리뷰 버전인 CLI(최신 안정 버전: 1.0.91)는 설정을 조회, 읽기, 설정, 삭제하기 위한 하위 명령어 copilot config를 추가하고, 명시적으로 구성하지 않는 한 주변의 GITHUB_TOKEN를 샌드박스 셸에 더 이상 전달하지 않습니다. SDK에는 하위 에이전트의 첫 번째 프롬프트를 보강한 다음 그 응답을 검사하거나 대체할 수 있는 훅인 OnSubagentStart 및 OnSubagentStop가 추가되었습니다. 🔗 CLI · 🔗 SDK
  • Feyn의 MultiMatte — 이 누끼(배경 분리) 모델은 텍스트 안내 기반으로 작동합니다. 유지할 객체를 지정하면 모델이 머리카락과 흐릿한 영역을 더 잘 표현하는 알파 매트(alpha matte)를 생성하여 나머지를 제거합니다. Meta의 SAM 3를 기반으로 구축되고 LoRA 어댑터로 미세 조정되었으며, 저자들에 따르면 DIS-VD에서 SAM 3의 0.667 대비 0.901의 S-measure를 달성했습니다. 카드에 명시된 Apache 2.0 라이선스 기반의 가중치는 8월 20일부터 온라인에 공개되어 있습니다. 🔗 출처
  • Admin console 내 ChatGPT Enterprise 플러그인 관리 — 10월 1일, Enterprise 및 Edu 릴리스 노트에 따르면 ChatGPT Enterprise 워크스페이스 소유자 및 관리자는 이제 Admin console의 Plugins 및 Marketplaces 페이지에서 플러그인과 플러그인 마켓플레이스(marketplaces)를 관리할 수 있습니다. 앱은 기존 권한을 유지한 채 Workspace settings > Apps에 그대로 유지됩니다. 🔗 출처

이것이 의미하는 바

ThinkingBox는 에이전트에게 묻는 질문을 바꿉니다. 작업을 수행할 수 있는가가 아니라, 매번 수행해 낼 수 있는가를 묻는 것입니다. 단 1회의 시도에서는 Kimi-K3가 GPT-6 Astra와 1점 미만의 차이를 보이지만, 20회 시도에서는 GPT-6 Astra가 231개 작업을 매번 성공한 반면 Kimi-K3는 68개에 그쳤습니다. 데이터베이스를 수정하는 작업을 에이전트에게 맡기려는 이들에게는 바로 이 두 번째 수치가 중요하며, 이 벤치마크는 에이전트가 무엇을 했다고 말하는지가 아니라 데이터베이스의 최종 상태를 기준으로 이를 측정합니다.

비용 역시 동일한 논리를 따릅니다. 매 시도마다 성공한 작업만을 기준으로 환산하면, 성공적인 시도당 비용이 가장 저렴했던(0.127달러) GPT-5.6 Sol이 아니라 GPT-5.4가 가장 저렴한 모델(신뢰할 수 있는 작업당 6.80달러)로 나타납니다. 반면 Kimi-K3는 신뢰할 수 있는 작업당 20.68달러로 GPT-5.4보다 세 배나 비쌉니다. 저자들이 상기시키듯, 이러한 금액은 실제 청구서가 아닌 비교 지표일 뿐입니다.

Exgentic Agent LLM Traces의 저자들도 이와 유사한 한계점에서 출발합니다. 트레이스가 선택된 도구, 컨텍스트 증가, 오류 복구 과정을 보여주는 반면, 벤치마크는 단일 실행을 단순 점수로 축약해 버립니다. 표준 형식으로 모든 호출이 저장되어 있으므로, 저자들은 이를 기준 삼아 에이전트를 디버깅하거나, 다른 모델로 특정 단계를 재현하거나, 실제 에이전트 부하 환경에서 추론 인프라를 테스트하는 데 활용할 수 있을 것으로 봅니다. 이미 한 팀이 Kubernetes SIG의 벤치마크 도구인 inference-perf를 활용해 이를 진행 중이며, 그 결과는 추후 발표될 예정입니다.


출처