Saltar al contenido

Microsoft ThinkingBox evalúa a los agentes de IA por la base de datos

ThinkingBox, de Microsoft, comprueba lo que un agente de IA escribió en la base de datos. El 67,24 % de 79.853 ejecuciones fallidas terminó limpiamente, con llamadas a herramientas válidas y datos erróneos.

Por Tech AI Wire Team

3 min de lectura

XLinkedIn
A screenshot of Microsoft's ThinkingBox-Bench dataset page on Hugging Face, with the dataset viewer listing retail and e-commerce tasks.

En cifras

tasks across five business domains
507
runs of every task, to separate luck from reliability
20
of failed runs ended cleanly with valid tool calls
67.24%
of failures came from tool handling, not reasoning
79.9%
ThinkingBox pass@1 (single-attempt success)
Claude Opus 5.5
67.16%
Claude Opus 5
66.5%
GPT-5.4
65.36%
GPT-6 Astra
58.31%
Kimi-K3
57.37%

Microsoft ha publicado ThinkingBox, una prueba para agentes de IA que ignora lo que dice el agente y comprueba lo que realmente cambió. Microsoft lo anunció el 3 de octubre de 2026 en una entrada del blog de Hugging Face. Su hallazgo central debería preocupar a cualquiera que lance agentes. De 79.853 intentos fallidos, el 67,24 % terminó limpiamente, con llamadas a herramientas válidas y sin errores. Aun así, los datos de fondo eran incorrectos.

Cómo pone a prueba ThinkingBox a un agente

Un agente de IA es un modelo que realiza acciones mediante herramientas, como actualizar un pedido o cambiar una reserva. La mayoría de las pruebas juzgan la respuesta final del agente o comprueban que sus llamadas a herramientas estaban bien formadas. ThinkingBox, en cambio, examina la base de datos del back-end cuando termina la tarea.

RuntimeWire lo describe como un benchmark en el que la base de datos tiene la última palabra. Cada una de sus 507 tareas simula un flujo de trabajo empresarial real. Cada tarea se ejecuta 20 veces, para que un único éxito por suerte no cuente como fiable.

Las tareas abarcan cinco ámbitos, según la entrada de Microsoft:

ÁmbitoTareas
Comercio minorista98
Seguros de automóvil100
Consultoría (soporte de TI y RR. HH.)101
Viajes104
Soporte de neobanco104

Las tres puntuaciones

ThinkingBox da tres cifras por modelo, explica RuntimeWire. Pass@1 es la probabilidad de éxito en un solo intento. Pass@20 significa que la tarea tuvo éxito al menos una vez en 20 ejecuciones. «Observed 20/20» cuenta las tareas que el modelo superó todas y cada una de las veces.

La diferencia entre esas cifras es lo importante. Claude Opus 5.5 lideró en pass@1 con un 67,16 %, pero superó las 20 ejecuciones solo en el 47,53 % de las tareas, es decir, 241. Kimi-K3 obtuvo un 57,37 % en pass@1 y superó las 20 ejecuciones solo en el 13,41 %, es decir, 68 tareas.

Según la entrada de Microsoft, solo tres modelos mantuvieron más del 70 % de su puntuación pass@1 a lo largo de los 20 intentos.

Por qué los agentes fallan en silencio

Microsoft descubrió que aproximadamente cuatro de cada cinco fallos, el 79,9 %, se debían al manejo de herramientas y no al razonamiento. El modelo entendía la tarea, pero llamaba a una herramienta de forma incorrecta, sobre el registro equivocado o solo en parte.

Así es como una ejecución puede parecer perfecta y aun así ser errónea. «El mensaje final de un agente es un indicio de lo que cree que ocurrió, no una prueba de lo que el software registró realmente», escribe Remio. El medio advierte de que las confirmaciones falsas sobre pedidos, suscripciones o permisos causan problemas más tarde, cuando otros sistemas actúan en función de ellas.

Barato por intento no es barato por tarea

Microsoft también puso precio a la fiabilidad. GPT-5.6 Sol cuesta 0,127 dólares por intento exitoso. Contado por tarea que completa de forma fiable, el coste sube a 9,76 dólares. Un modelo barato por llamada puede salir caro cuando pagas los reintentos y los fallos.

Qué significa para los desarrolladores

Pon a prueba tu agente como lo hace ThinkingBox. Tras cada ejecución de prueba, consulta la base de datos y comprueba con aserciones los campos exactos que debían cambiar. Comprueba también que nada más cambió. Una respuesta correcta y unos registros de herramientas limpios demuestran muy poco por sí solos.

Ejecuta cada caso de prueba muchas veces, no solo una. Una tarea que se supera una vez puede fallar a menudo en producción, como muestran las cifras de Kimi-K3. Sigue la proporción de tareas que se superan en todas las ejecuciones, no solo la media.

Dedica tu esfuerzo a la capa de herramientas. Si la mayoría de los fallos vienen del manejo de herramientas, las soluciones suelen ser ingeniería sencilla. Escribe descripciones de herramientas más claras, usa esquemas de argumentos más estrictos y devuelve mensajes de error con los que el modelo pueda actuar.

Añade una comprobación fuera del modelo en producción. Antes de decirle a un usuario que un pedido cambió, vuelve a leer el pedido en el sistema de registro. El argumento de Remio se sostiene: el propio informe del agente es una afirmación, no una prueba.

Presupuesta por tarea fiable, no por token. Las cifras de Microsoft sobre GPT-5.6 Sol muestran que el precio por llamada puede subestimar el coste real por un amplio margen.

Fuentes

  1. The Agent Said It Was Done. The Database Disagreed. - Hugging Face Blog
  2. Microsoft releases an agent benchmark where the database gets the final vote - RuntimeWire
  3. Microsoft ThinkingBox Benchmark Exposes the Gap Between Agent Claims and Database Reality - Remio

Artículos relacionados