Claude Code, Codex e Cursor concordam numa ferramenta só 42% das vezes
Um estudo com 16.893 sessões de agentes de código descobriu que Claude Code, Codex e Cursor escolhem a mesma ferramenta de terceiros só 42% das vezes. O Stripe venceu o PayPal em toda sessão em que os dois eram elegíveis.
3 min de leitura

Em números
- coding-agent sessions measured across 75 synthetic repositories
- 16,893
- of sessions where all three agents picked the same tool
- 42%
- of Codex sessions that used web search, versus about 30% for Claude Code
- 94%
Claude Code, Codex e Cursor escolhem a mesma ferramenta de terceiros em apenas 42% das situações comparáveis. Esse número vem de um estudo com 16.893 sessões de código, publicado pela Armature em 3 de setembro de 2026. Um agente de código muitas vezes escolhe, em seu nome, um processador de pagamentos, uma API de voz ou um serviço de autenticação. Qual agente você usou decide mais desse resultado do que se poderia esperar.
A Armature constrói ferramentas para empresas que querem que seu produto seja escolhido por agentes de código. O estudo mediu como os agentes se comportam quando ninguém está olhando.
Como o teste foi montado
Os pesquisadores construíram 75 repositórios sintéticos em 10 linguagens de programação e 51 bases de código válidas, cobrindo 18 setores. Cada repositório usava um nome de empresa fictício e um histórico de commits fictício. Os arquivos de lock eram reais, verificados contra registros de pacotes de verdade, como o npm, então os agentes trabalhavam com dados de dependência genuínos.
Ao longo desses repositórios, a equipe rodou 1.163 variações de prompt, produzindo 16.893 sessões no total. O Ecosistema Startup relata que a montagem também passou por quatro personas de usuário e três ambientes de sandbox, e usou um modelo de IA à parte para simular revisão humana de código.
As próprias ferramentas divergiram bastante
O número de destaque é essa taxa de concordância de 42%. No resto do tempo, os três agentes fizeram três escolhas diferentes.
Um exemplo concreto, relatado de forma idêntica pelas duas fontes: o PayPal apareceu como opção elegível em 139 sessões. Nunca foi escolhido. O Stripe venceu em 124 dessas mesmas sessões.
| Comportamento | Codex | Claude Code |
|---|---|---|
| Usa busca na web | 94% das sessões | Cerca de 30% das sessões |
| Estilo de busca | Restringe com operadores site: | Consultas mais amplas, sem restrição |
| Páginas navegadas por busca | Referência | Cerca de 3x mais que o Codex |
| Constrói solução própria | 10% das sessões | 19% das sessões |
A alta taxa de busca do Codex, combinada com consultas estreitas e restritas por operadores, sugere que ele se apoia na web aberta para confirmar rapidamente uma resposta específica. O Claude Code busca com menos frequência, mas, quando busca, lê de forma mais ampla antes de decidir.
O número de "feito em casa" merece atenção
O Claude Code optou por escrever código próprio em vez de adotar uma ferramenta de terceiros em 19% das sessões, contra 10% no Codex e no Cursor.
Não é uma diferença pequena. Em quase uma a cada cinco vezes em que existia uma opção de terceiros, o Claude Code construiu sua própria versão no lugar dela. Se isso reflete um julgamento melhor, ou apenas uma tendência a gerar código em vez de pesquisar alternativas, é algo que este estudo sozinho não consegue resolver. Ele mediu resultados, não raciocínio.
O que isso significa para desenvolvedores
Não presuma que a escolha de ferramenta do seu agente de código é neutra ou universal. Se você pedir a um agente diferente para resolver o mesmo problema de integração, espere uma chance real de um resultado diferente. Pode ser um fornecedor diferente, uma biblioteca diferente, ou uma implementação feita do zero, não só um estilo de código diferente.
Trate uma dependência escolhida por um agente como uma decisão a ser revisada, não como um padrão a ser aceito. Uma taxa de concordância de 42% entre três agentes conhecidos diz alguma coisa. Nos outros 58% do tempo, a escolha veio de algo mais parecido com um estilo da casa do que com uma avaliação criteriosa das suas opções. Verifique licenciamento, custo e estado de manutenção antes dessa dependência ir para produção.
Se você mesmo constrói uma ferramenta ou API para desenvolvedores, este estudo é uma prévia de um canal de aquisição real. A resposta padrão de um agente para "o que devo usar para X" está virando um caminho de aquisição de verdade. O estudo sugere que a qualidade da documentação e a facilidade de encontrar o produto na web moldam essa resposta tanto quanto o próprio produto.
Fique de olho na divisão entre construir em casa e adotar ferramentas externas conforme o agente, se você padronizar ferramentas numa equipe. Uma equipe que mistura Claude Code com Codex ou Cursor deve esperar mais código próprio, feito em casa, do lado do Claude Code dessa divisão. Essa divisão vem de qual agente escreveu o código, não da dificuldade da tarefa.
Fontes
Artigos relacionados

Claude Code põe um link de sessão nos commits, a menos que você desative
O Claude Code acrescenta aos commits e pull requests uma linha Claude-Session que aponta para o próprio chat. A opção vem ligada por padrão.

JetBrains: desenvolvedores dizem que agentes já escrevem 47% do seu código
Uma pesquisa da JetBrains com 15.509 desenvolvedores mostra que agentes escrevem por completo 47% do código, em média. 90% usam um agente toda semana, e o Claude Code lidera a adoção com 39%.

VS Code 1.136 adiciona Agent Merge para fechar pull requests
O VS Code 1.136 traz o Agent Merge em pré-visualização. Um agente responde a comentários de revisão, corrige verificações falhadas e resolve conflitos até o pull request ficar pronto.