Skip to content
Tech AI Wire

Claude Code, Codex e Cursor concordam numa ferramenta só 42% das vezes

Um estudo com 16.893 sessões de agentes de código descobriu que Claude Code, Codex e Cursor escolhem a mesma ferramenta de terceiros só 42% das vezes. O Stripe venceu o PayPal em toda sessão em que os dois eram elegíveis.

Por Tech AI Wire Team

3 min de leitura

XLinkedIn
The Armature study's own blog post headline, showing the 16,893-session count and the 42% agreement statistic.

Em números

coding-agent sessions measured across 75 synthetic repositories
16,893
of sessions where all three agents picked the same tool
42%
of Codex sessions that used web search, versus about 30% for Claude Code
94%

Claude Code, Codex e Cursor escolhem a mesma ferramenta de terceiros em apenas 42% das situações comparáveis. Esse número vem de um estudo com 16.893 sessões de código, publicado pela Armature em 3 de setembro de 2026. Um agente de código muitas vezes escolhe, em seu nome, um processador de pagamentos, uma API de voz ou um serviço de autenticação. Qual agente você usou decide mais desse resultado do que se poderia esperar.

A Armature constrói ferramentas para empresas que querem que seu produto seja escolhido por agentes de código. O estudo mediu como os agentes se comportam quando ninguém está olhando.

Como o teste foi montado

Os pesquisadores construíram 75 repositórios sintéticos em 10 linguagens de programação e 51 bases de código válidas, cobrindo 18 setores. Cada repositório usava um nome de empresa fictício e um histórico de commits fictício. Os arquivos de lock eram reais, verificados contra registros de pacotes de verdade, como o npm, então os agentes trabalhavam com dados de dependência genuínos.

Ao longo desses repositórios, a equipe rodou 1.163 variações de prompt, produzindo 16.893 sessões no total. O Ecosistema Startup relata que a montagem também passou por quatro personas de usuário e três ambientes de sandbox, e usou um modelo de IA à parte para simular revisão humana de código.

As próprias ferramentas divergiram bastante

O número de destaque é essa taxa de concordância de 42%. No resto do tempo, os três agentes fizeram três escolhas diferentes.

Um exemplo concreto, relatado de forma idêntica pelas duas fontes: o PayPal apareceu como opção elegível em 139 sessões. Nunca foi escolhido. O Stripe venceu em 124 dessas mesmas sessões.

ComportamentoCodexClaude Code
Usa busca na web94% das sessõesCerca de 30% das sessões
Estilo de buscaRestringe com operadores site:Consultas mais amplas, sem restrição
Páginas navegadas por buscaReferênciaCerca de 3x mais que o Codex
Constrói solução própria10% das sessões19% das sessões

A alta taxa de busca do Codex, combinada com consultas estreitas e restritas por operadores, sugere que ele se apoia na web aberta para confirmar rapidamente uma resposta específica. O Claude Code busca com menos frequência, mas, quando busca, lê de forma mais ampla antes de decidir.

O número de "feito em casa" merece atenção

O Claude Code optou por escrever código próprio em vez de adotar uma ferramenta de terceiros em 19% das sessões, contra 10% no Codex e no Cursor.

Não é uma diferença pequena. Em quase uma a cada cinco vezes em que existia uma opção de terceiros, o Claude Code construiu sua própria versão no lugar dela. Se isso reflete um julgamento melhor, ou apenas uma tendência a gerar código em vez de pesquisar alternativas, é algo que este estudo sozinho não consegue resolver. Ele mediu resultados, não raciocínio.

O que isso significa para desenvolvedores

Não presuma que a escolha de ferramenta do seu agente de código é neutra ou universal. Se você pedir a um agente diferente para resolver o mesmo problema de integração, espere uma chance real de um resultado diferente. Pode ser um fornecedor diferente, uma biblioteca diferente, ou uma implementação feita do zero, não só um estilo de código diferente.

Trate uma dependência escolhida por um agente como uma decisão a ser revisada, não como um padrão a ser aceito. Uma taxa de concordância de 42% entre três agentes conhecidos diz alguma coisa. Nos outros 58% do tempo, a escolha veio de algo mais parecido com um estilo da casa do que com uma avaliação criteriosa das suas opções. Verifique licenciamento, custo e estado de manutenção antes dessa dependência ir para produção.

Se você mesmo constrói uma ferramenta ou API para desenvolvedores, este estudo é uma prévia de um canal de aquisição real. A resposta padrão de um agente para "o que devo usar para X" está virando um caminho de aquisição de verdade. O estudo sugere que a qualidade da documentação e a facilidade de encontrar o produto na web moldam essa resposta tanto quanto o próprio produto.

Fique de olho na divisão entre construir em casa e adotar ferramentas externas conforme o agente, se você padronizar ferramentas numa equipe. Uma equipe que mistura Claude Code com Codex ou Cursor deve esperar mais código próprio, feito em casa, do lado do Claude Code dessa divisão. Essa divisão vem de qual agente escreveu o código, não da dificuldade da tarefa.

Fontes

  1. Which tools do Claude Code, Codex and Cursor choose? We measured 16,893 sessions to find out - Armature
  2. Claude, Codex y Cursor: 16.893 tests revelan qué eligen - Ecosistema Startup

Artigos relacionados