Buscar

El banco de pruebas ThinkingBox de Microsoft llega a OpenEnv con 20 intentos por tarea, el conjunto de datos Exgentic reúne 10 000 trazas en formato OpenTelemetry

Artículo generado por inteligencia artificial
El banco de pruebas ThinkingBox de Microsoft llega a OpenEnv con 20 intentos por tarea, el conjunto de datos Exgentic reúne 10 000 trazas en formato OpenTelemetry

ai-powered-markdown-translator

Artículo traducido del fr al es con gemini-3.8-flash-high.

Ver proyecto en GitHub ↗

En la noche del sábado al domingo, Microsoft y Hugging Face conectaron ThinkingBox a OpenEnv: este banco de pruebas reproduce 507 tareas empresariales 20 veces cada una y evalúa a los agentes según el estado final de la base de datos, y la repetición altera la clasificación. El domingo 4 de octubre, tres autores describen Exgentic Agent LLM Traces, 10 000 ejecuciones de agentes en formato OpenTelemetry publicadas bajo la organización Exgentic del Hub. En breve, Claude Code 2.1.289 y Copilot CLI 1.0.92-4 refuerzan sus medidas de seguridad, Feyn presenta MultiMatte, un modelo de recorte basado en SAM 3 de Meta, y ChatGPT Enterprise gestiona sus plugins en la Admin console desde el 1 de octubre.


Microsoft y Hugging Face conectan ThinkingBox a OpenEnv: 20 intentos por tarea y la clasificación cambia

3 de octubre — En una publicación presentada como conjunta entre Microsoft y Hugging Face, Tuhin Kundu (Microsoft) describe ThinkingBox, un banco de pruebas que evalúa a los agentes de IA por lo que dejan en la base de datos, no por sus respuestas. Desarrollado por el equipo de Microsoft Copilot Studio junto con Toloka, no es nuevo (artículo de investigación del 20 de agosto, conjunto de datos publicado a finales de agosto): la novedad es su integración detrás de OpenEnv, la interfaz abierta de entornos para agentes alojada por Hugging Face, y la publicación de los resultados de 18 modelos.

Sus 507 flujos de trabajo (workflows) empresariales sintéticos se reproducen 20 veces cada uno desde un estado limpio, y jueces deterministas comparan el estado final de la base con el esperado. Resultados según los autores; sus costes, estimados a partir de las tarifas de catálogo de OpenRouter (las de Anthropic para Claude Opus 5.5), son un índice comparativo, no una factura:

Modelo evaluadopass@1 globalTareas superadas 20 veces de 20 (de 507)Coste por tarea fiable
Claude Opus 5.567,16 %2417,80 dólares
Claude Opus 566,50 %24113,30 dólares
GPT-5.465,36 %1286,80 dólares
GPT-5.6 Sol61,91 %829,76 dólares
GPT-6 Astra58,31 %2317,45 dólares
Kimi-K3 (pesos abiertos)57,37 %6820,68 dólares

La repetición cambia la clasificación: Kimi-K3, el mejor modelo de pesos abiertos, resuelve 476 de las 507 tareas al menos una vez, pero solo 68 en cada uno de los 20 intentos, frente a 241 tanto para Claude Opus 5 como para Claude Opus 5.5. Según el equipo, aproximadamente cuatro de cada cinco fallos se deben al uso de herramientas más que al razonamiento. El código está bajo licencia MIT y los datos bajo CDLA-Permissive-2.0.

A trajectory is a claim. Database state is the evidence. Repetition is the trust test.

🇪🇸 Una trayectoria es una afirmación. El estado de la base de datos es la prueba. La repetición es la prueba de confianza. — Publicación de Microsoft y Hugging Face

🔗 Conjunto de datos ThinkingBox-Bench · ThinkingBox en OpenEnv


Exgentic Agent LLM Traces: 10 000 ejecuciones de agentes conservadas en formato OpenTelemetry

4 de octubre — En el blog comunitario de Hugging Face, Lena Dankin, Elron Bandel y Michal Shmueli-Scheuer presentan Exgentic Agent LLM Traces, un conjunto de datos publicado bajo la organización Exgentic del Hub: 10 000 ejecuciones de agentes y 242 000 llamadas al modelo, cada una conservada según las convenciones GenAI de OpenTelemetry, con la puntuación y el coste de cada ejecución.

Estas ejecuciones cubren seis bancos de pruebas (SWE-bench, BrowseComp Plus, AppWorld y tres variantes de τ²-bench) y hasta cinco diseños de agente. De media, Claude Opus 4.5 consume 2,4 millones de tokens por ejecución, frente a 552 000 para GPT-5.2.

Dos salvedades: los cinco modelos pertenecen a generaciones anteriores (DeepSeek-V3.2, Kimi-K2.5, GPT-5.2, Claude Opus 4.5 y Gemini 3 Pro), y la publicación presenta como un lanzamiento del día un repositorio creado el 10 de junio, sin licencia declarada en su ficha.

🔗 Publicación · Conjunto de datos en Hugging Face


Breves

  • Claude Code 2.1.289 — Esta versión de 27 entradas corrige cuatro casos en los que las reglas de permisos deny y ask no se aplicaban; un plugin instalado por el usuario ya no puede reescribir las descripciones de las herramientas de conexión de un servidor MCP gestionado, y otras 18 entradas se refieren a los mods y los plugins. 🔗 fuente
  • Copilot CLI 1.0.92-4 y SDK Copilot 1.0.17-preview.4 — La CLI, en versión preliminar (última estable: 1.0.91), añade los subcomandos copilot config para listar, leer, definir y eliminar un ajuste, y ya no transmite el GITHUB_TOKEN ambiental a las shells del sandbox, salvo configuración explícita; el SDK recibe los hooks OnSubagentStart y OnSubagentStop, para enriquecer el primer prompt de un subagente y luego inspeccionar o sustituir su respuesta. 🔗 CLI · 🔗 SDK
  • MultiMatte de Feyn — Este modelo de recorte se guía mediante texto: se nombra el objeto que se desea conservar y el modelo elimina el resto, con una máscara alfa (alpha matte) que reproduce mejor el cabello y las zonas desenfocadas. Basado en SAM 3 de Meta y ajustado mediante un adaptador LoRA, alcanza según los autores 0,901 de S-measure en DIS-VD, frente a 0,667 para SAM 3; sus pesos, bajo Apache 2.0 según su ficha, están en línea desde el 20 de agosto. 🔗 fuente
  • Plugins de ChatGPT Enterprise en la Admin console — El 1 de octubre, las notas de la versión para Enterprise y Edu anunciaron que los propietarios y administradores de espacios de ChatGPT Enterprise ahora gestionan los plugins y sus mercados (marketplaces) en la Admin console, en las páginas Plugins y Marketplaces; las aplicaciones permanecen en Workspace settings > Apps, con los permisos existentes. 🔗 fuente

Qué significa esto

ThinkingBox cambia la pregunta que se le plantea a un agente: ya no si sabe realizar una tarea, sino si la realiza en cada ocasión. En un solo intento, Kimi-K3 se sitúa a menos de un punto de GPT-6 Astra; en veinte, solo logra superar invariablemente 68 tareas, frente a 231. Para quien confía a un agente operaciones que modifican una base de datos, es esta segunda cifra la que importa, y el banco de pruebas la mide a partir del estado final de la base en lugar de lo que el agente dice haber hecho.

El coste sigue la misma lógica. Calculado únicamente sobre las tareas superadas en cada intento, sitúa a GPT-5.4 como el más económico (6,80 dólares por tarea fiable), y no a GPT-5.6 Sol, a pesar de ser el más barato por intento superado (0,127 dólares); Kimi-K3, por su parte, sale a 20,68 dólares por tarea fiable, tres veces más que GPT-5.4. Estos importes siguen siendo, recuerdan los autores, un índice comparativo y no una factura.

Los autores de Exgentic Agent LLM Traces parten de una limitación similar: un banco de pruebas reduce una ejecución a una puntuación, mientras que la traza muestra las herramientas elegidas, el crecimiento del contexto y las recuperaciones tras un error. Al conservarse cada llamada en un formato estándar, ven en ello la posibilidad de depurar un agente frente a una referencia, reproducir un paso con otro modelo o probar una infraestructura de inferencia bajo una carga real de agentes; un equipo ya lo está haciendo con inference-perf, la herramienta de benchmark del SIG Kubernetes, y sus resultados se anunciarán más adelante.


Fuentes