Microsoft ThinkingBox evalúa a los agentes de IA por la base de datos
ThinkingBox, de Microsoft, comprueba lo que un agente de IA escribió en la base de datos. El 67,24 % de 79.853 ejecuciones fallidas terminó limpiamente, con llamadas a herramientas válidas y datos erróneos.
3 min de lectura

En cifras
- tasks across five business domains
- 507
- runs of every task, to separate luck from reliability
- 20
- of failed runs ended cleanly with valid tool calls
- 67.24%
- of failures came from tool handling, not reasoning
- 79.9%
- Claude Opus 5.5
- 67.16%
- Claude Opus 5
- 66.5%
- GPT-5.4
- 65.36%
- GPT-6 Astra
- 58.31%
- Kimi-K3
- 57.37%
Microsoft ha publicado ThinkingBox, una prueba para agentes de IA que ignora lo que dice el agente y comprueba lo que realmente cambió. Microsoft lo anunció el 3 de octubre de 2026 en una entrada del blog de Hugging Face. Su hallazgo central debería preocupar a cualquiera que lance agentes. De 79.853 intentos fallidos, el 67,24 % terminó limpiamente, con llamadas a herramientas válidas y sin errores. Aun así, los datos de fondo eran incorrectos.
Cómo pone a prueba ThinkingBox a un agente
Un agente de IA es un modelo que realiza acciones mediante herramientas, como actualizar un pedido o cambiar una reserva. La mayoría de las pruebas juzgan la respuesta final del agente o comprueban que sus llamadas a herramientas estaban bien formadas. ThinkingBox, en cambio, examina la base de datos del back-end cuando termina la tarea.
RuntimeWire lo describe como un benchmark en el que la base de datos tiene la última palabra. Cada una de sus 507 tareas simula un flujo de trabajo empresarial real. Cada tarea se ejecuta 20 veces, para que un único éxito por suerte no cuente como fiable.
Las tareas abarcan cinco ámbitos, según la entrada de Microsoft:
| Ámbito | Tareas |
|---|---|
| Comercio minorista | 98 |
| Seguros de automóvil | 100 |
| Consultoría (soporte de TI y RR. HH.) | 101 |
| Viajes | 104 |
| Soporte de neobanco | 104 |
Las tres puntuaciones
ThinkingBox da tres cifras por modelo, explica RuntimeWire. Pass@1 es la probabilidad de éxito en un solo intento. Pass@20 significa que la tarea tuvo éxito al menos una vez en 20 ejecuciones. «Observed 20/20» cuenta las tareas que el modelo superó todas y cada una de las veces.
La diferencia entre esas cifras es lo importante. Claude Opus 5.5 lideró en pass@1 con un 67,16 %, pero superó las 20 ejecuciones solo en el 47,53 % de las tareas, es decir, 241. Kimi-K3 obtuvo un 57,37 % en pass@1 y superó las 20 ejecuciones solo en el 13,41 %, es decir, 68 tareas.
Según la entrada de Microsoft, solo tres modelos mantuvieron más del 70 % de su puntuación pass@1 a lo largo de los 20 intentos.
Por qué los agentes fallan en silencio
Microsoft descubrió que aproximadamente cuatro de cada cinco fallos, el 79,9 %, se debían al manejo de herramientas y no al razonamiento. El modelo entendía la tarea, pero llamaba a una herramienta de forma incorrecta, sobre el registro equivocado o solo en parte.
Así es como una ejecución puede parecer perfecta y aun así ser errónea. «El mensaje final de un agente es un indicio de lo que cree que ocurrió, no una prueba de lo que el software registró realmente», escribe Remio. El medio advierte de que las confirmaciones falsas sobre pedidos, suscripciones o permisos causan problemas más tarde, cuando otros sistemas actúan en función de ellas.
Barato por intento no es barato por tarea
Microsoft también puso precio a la fiabilidad. GPT-5.6 Sol cuesta 0,127 dólares por intento exitoso. Contado por tarea que completa de forma fiable, el coste sube a 9,76 dólares. Un modelo barato por llamada puede salir caro cuando pagas los reintentos y los fallos.
Qué significa para los desarrolladores
Pon a prueba tu agente como lo hace ThinkingBox. Tras cada ejecución de prueba, consulta la base de datos y comprueba con aserciones los campos exactos que debían cambiar. Comprueba también que nada más cambió. Una respuesta correcta y unos registros de herramientas limpios demuestran muy poco por sí solos.
Ejecuta cada caso de prueba muchas veces, no solo una. Una tarea que se supera una vez puede fallar a menudo en producción, como muestran las cifras de Kimi-K3. Sigue la proporción de tareas que se superan en todas las ejecuciones, no solo la media.
Dedica tu esfuerzo a la capa de herramientas. Si la mayoría de los fallos vienen del manejo de herramientas, las soluciones suelen ser ingeniería sencilla. Escribe descripciones de herramientas más claras, usa esquemas de argumentos más estrictos y devuelve mensajes de error con los que el modelo pueda actuar.
Añade una comprobación fuera del modelo en producción. Antes de decirle a un usuario que un pedido cambió, vuelve a leer el pedido en el sistema de registro. El argumento de Remio se sostiene: el propio informe del agente es una afirmación, no una prueba.
Presupuesta por tarea fiable, no por token. Las cifras de Microsoft sobre GPT-5.6 Sol muestran que el precio por llamada puede subestimar el coste real por un amplio margen.
Fuentes
Artículos relacionados

Holo4: los modelos de agentes de pesos abiertos logran un 61,7 % en OSWorld 2.0
Holo4-27B de H Company logra un 61,7 % en OSWorld 2.0 a 1,22 dólares por tarea, pero solo su modelo hermano bajo Apache 2.0, 35B-A3B, puede autoalojarse con fines comerciales.

NVIDIA Kumo Tabular encabeza TabArena con pesos abiertos
Kumo Tabular de NVIDIA predice a partir de una tabla etiquetada en una sola pasada, sin ningún entrenamiento. Ocupa el primer puesto en TabArena con 1.950 Elo, en tamaños de 28M a 215M.

Liquid AI LFM2.5-VL-DSpark acelera su modelo de visión 3B
El modelo borrador LFM2.5-VL-DSpark de Liquid AI, de 280M de parámetros, decodifica su modelo de visión 3B hasta 3.13x más rápido en un M5 Max, con una salida idéntica.