Microsoft ThinkingBox avalia agentes de IA pelo banco de dados
O ThinkingBox, da Microsoft, verifica o que um agente de IA gravou no banco de dados. 67,24% de 79.853 execuções com falha terminaram de forma limpa, com chamadas de ferramentas válidas e dados errados.
3 min de leitura

Em números
- tasks across five business domains
- 507
- runs of every task, to separate luck from reliability
- 20
- of failed runs ended cleanly with valid tool calls
- 67.24%
- of failures came from tool handling, not reasoning
- 79.9%
- Claude Opus 5.5
- 67.16%
- Claude Opus 5
- 66.5%
- GPT-5.4
- 65.36%
- GPT-6 Astra
- 58.31%
- Kimi-K3
- 57.37%
A Microsoft lançou o ThinkingBox, um teste para agentes de IA que ignora o que o agente diz e verifica o que ele realmente alterou. A Microsoft o anunciou em 3 de outubro de 2026, em um post no blog do Hugging Face. Sua principal descoberta deve preocupar qualquer pessoa que lance agentes. De 79.853 tentativas com falha, 67,24% terminaram de forma limpa, com chamadas de ferramentas válidas e sem erro. Mesmo assim, os dados por trás estavam errados.
Como o ThinkingBox testa um agente
Um agente de IA é um modelo que executa ações por meio de ferramentas, como atualizar um pedido ou alterar uma reserva. A maioria dos testes julga a resposta final do agente ou verifica se suas chamadas de ferramentas estavam bem formadas. O ThinkingBox, em vez disso, examina o banco de dados do back-end depois que a tarefa termina.
O RuntimeWire o descreve como um benchmark em que o banco de dados dá a palavra final. Cada uma de suas 507 tarefas simula um fluxo de trabalho empresarial real. Cada tarefa é executada 20 vezes, para que um único sucesso por sorte não conte como confiável.
As tarefas cobrem cinco áreas, segundo o post da Microsoft:
| Área | Tarefas |
|---|---|
| Varejo | 98 |
| Seguro de automóveis | 100 |
| Consultoria (suporte de TI e RH) | 101 |
| Viagens | 104 |
| Suporte de neobanco | 104 |
As três pontuações
O ThinkingBox informa três números por modelo, explica o RuntimeWire. Pass@1 é a chance de sucesso em uma única tentativa. Pass@20 significa que a tarefa teve sucesso pelo menos uma vez em 20 execuções. "Observed 20/20" conta as tarefas que o modelo acertou em todas as vezes, sem exceção.
A diferença entre esses números é o ponto central. O Claude Opus 5.5 liderou em pass@1 com 67,16%, mas passou nas 20 execuções em apenas 47,53% das tarefas, ou 241 delas. O Kimi-K3 marcou 57,37% em pass@1 e passou nas 20 execuções em apenas 13,41%, ou 68 tarefas.
Segundo o post da Microsoft, apenas três modelos mantiveram mais de 70% de sua pontuação pass@1 ao longo das 20 tentativas.
Por que os agentes falham em silêncio
A Microsoft constatou que cerca de quatro em cada cinco falhas, 79,9%, vieram do manuseio de ferramentas, e não do raciocínio. O modelo entendeu a tarefa, mas chamou uma ferramenta do jeito errado, no registro errado ou só em parte.
É assim que uma execução pode parecer perfeita e ainda estar errada. "A mensagem final de um agente é um indício do que ele acredita que aconteceu, não uma prova do que o software realmente registrou", escreve o Remio. O site alerta que confirmações falsas sobre pedidos, assinaturas ou permissões causam problemas depois, quando outros sistemas agem com base nelas.
Barato por tentativa não é barato por tarefa
A Microsoft também calculou o preço da confiabilidade. O GPT-5.6 Sol custa US$ 0,127 por tentativa bem-sucedida. Contado por tarefa que ele conclui de forma confiável, o custo sobe para US$ 9,76. Um modelo barato por chamada pode sair caro quando você paga pelas novas tentativas e pelas falhas.
O que isso significa para desenvolvedores
Teste seu agente do jeito que o ThinkingBox faz. Depois de cada execução de teste, consulte o banco de dados e verifique com asserções os campos exatos que deveriam ter mudado. Verifique também que nada mais mudou. Uma resposta aprovada e logs de ferramentas limpos provam muito pouco por si sós.
Execute cada caso de teste muitas vezes, não apenas uma. Uma tarefa que passa uma vez ainda pode falhar com frequência em produção, como mostram os números do Kimi-K3. Acompanhe a parcela de tarefas que passam em todas as execuções, não apenas a média.
Concentre seu esforço na camada de ferramentas. Se a maioria das falhas vem do manuseio de ferramentas, as correções costumam ser engenharia simples. Escreva descrições de ferramentas mais claras, use esquemas de argumentos mais rígidos e retorne mensagens de erro com as quais o modelo possa agir.
Adicione uma verificação fora do modelo em produção. Antes de dizer a um usuário que um pedido mudou, leia o pedido de volta no sistema de registro. O argumento do Remio se sustenta: o próprio relato do agente é uma alegação, não uma prova.
Faça o orçamento por tarefa confiável, não por token. Os números da Microsoft para o GPT-5.6 Sol mostram que o preço por chamada pode subestimar o custo real por uma ampla margem.
Fontes
Artigos relacionados

Holo4: modelos de agentes de pesos abertos atingem 61,7% no OSWorld 2.0
O Holo4-27B da H Company atinge 61,7% no OSWorld 2.0 a US$ 1,22 por tarefa, mas só o modelo irmão sob Apache 2.0, o 35B-A3B, pode ser auto-hospedado para uso comercial.

NVIDIA Kumo Tabular lidera o TabArena com pesos abertos
O Kumo Tabular da NVIDIA faz previsões a partir de uma tabela rotulada em uma única passada, sem nenhum treinamento. Ele fica em primeiro no TabArena com 1.950 de Elo, em tamanhos de 28M a 215M.

Liquid AI LFM2.5-VL-DSpark acelera seu modelo de visão 3B
O modelo de rascunho LFM2.5-VL-DSpark da Liquid AI, com 280M de parâmetros, decodifica seu modelo de visão 3B até 3.13x mais rápido em um M5 Max, com saída idêntica.