Claude Code, Codex y Cursor coinciden en una herramienta solo el 42% de las veces
Un estudio de 16.893 sesiones de agentes de código encontró que Claude Code, Codex y Cursor eligen la misma herramienta externa solo el 42% de las veces. Stripe venció a PayPal en todas las sesiones donde ambos calificaban.
3 min de lectura

En cifras
- coding-agent sessions measured across 75 synthetic repositories
- 16,893
- of sessions where all three agents picked the same tool
- 42%
- of Codex sessions that used web search, versus about 30% for Claude Code
- 94%
Claude Code, Codex y Cursor eligen la misma herramienta externa solo en el 42% de las situaciones comparables. Ese dato viene de un estudio de 16.893 sesiones de código, publicado por Armature el 3 de septiembre de 2026. Un agente de código elige a menudo, en su nombre, un procesador de pagos, una API de voz o un servicio de autenticación. Qué agente usó determina más del resultado de lo que podría esperar.
Armature construye herramientas para empresas que quieren que su producto sea elegido por agentes de código. Su estudio midió cómo se comportan los agentes cuando nadie está mirando.
Cómo se construyó la prueba
Los investigadores construyeron 75 repositorios sintéticos en 10 lenguajes de programación y 51 bases de código válidas, que cubren 18 sectores. Cada repositorio usaba un nombre de empresa ficticio y un historial de commits ficticio. Los archivos de bloqueo eran reales, verificados contra registros de paquetes reales como npm, así que los agentes trabajaban con datos de dependencias genuinos.
A lo largo de esos repositorios, el equipo ejecutó 1.163 variantes de prompts, produciendo 16.893 sesiones en total. Ecosistema Startup informa de que el montaje también recorrió cuatro personas de usuario y tres entornos de sandbox, y usó un modelo de IA aparte para simular una revisión de código humana.
Las herramientas en sí divergieron mucho
La cifra destacada es esa tasa de acuerdo del 42%. El resto del tiempo, los tres agentes tomaron tres decisiones distintas.
Un ejemplo concreto, reportado de forma idéntica por ambas fuentes: PayPal apareció como opción elegible en 139 sesiones. Nunca fue elegido. Stripe ganó 124 de esas mismas sesiones.
| Comportamiento | Codex | Claude Code |
|---|---|---|
| Usa búsqueda web | 94% de las sesiones | Cerca del 30% de las sesiones |
| Estilo de búsqueda | Acota con operadores site: | Consultas más amplias, sin restricción |
| Páginas revisadas por búsqueda | Referencia | Cerca de 3 veces más que Codex |
| Construye una solución propia | 10% de las sesiones | 19% de las sesiones |
La alta tasa de búsqueda de Codex, combinada con consultas estrechas y restringidas por operadores, sugiere que se apoya en la web abierta para confirmar rápido una respuesta concreta. Claude Code busca con menos frecuencia, pero cuando lo hace, lee más ampliamente antes de decidir.
La cifra de "hecho en casa" merece detenerse en ella
Claude Code eligió escribir código a medida en lugar de adoptar una herramienta externa en el 19% de las sesiones, frente al 10% de Codex y Cursor.
No es una diferencia pequeña. Casi una de cada cinco veces que existía una opción externa, Claude Code construyó su propia versión en su lugar. Que eso refleje mejor criterio, o simplemente un sesgo hacia generar código en vez de investigar alternativas, es algo que este estudio no puede resolver por sí solo. Midió resultados, no razonamientos.
Qué significa esto para los desarrolladores
No dé por hecho que la elección de herramienta de su agente de código es neutral o universal. Si le pide a un agente distinto que resuelva el mismo problema de integración, espere una posibilidad real de un resultado distinto. Puede ser un proveedor diferente, una biblioteca diferente, o una implementación construida desde cero, no solo un estilo de código distinto.
Trate una dependencia elegida por un agente como una decisión que hay que revisar, no como un valor por defecto que se acepta. Una tasa de acuerdo del 42% entre tres agentes conocidos dice algo. El otro 58% del tiempo, la elección la hizo algo más parecido a un estilo de la casa que a una evaluación meditada de sus opciones. Revise la licencia, el coste y el estado de mantenimiento antes de que esa dependencia salga a producción.
Si usted mismo construye una herramienta o una API para desarrolladores, este estudio es un adelanto de un canal de adquisición real. La respuesta por defecto de un agente a "qué debería usar para X" se está convirtiendo en una vía de adquisición genuina. El estudio sugiere que la calidad de la documentación y la visibilidad en la web moldean esa respuesta tanto como el propio producto.
Vigile el reparto entre construir en casa y adoptar herramientas externas según el agente, si estandariza herramientas en un equipo. Un equipo que mezcla Claude Code con Codex o Cursor debería esperar más código propio, hecho en casa, del lado de Claude Code de ese reparto. Ese reparto viene de qué agente escribió el código, no de lo difícil que fuera la tarea.
Fuentes
Artículos relacionados

Claude Code pone un enlace de sesión en tus commits salvo que lo desactives
Claude Code añade a los commits y a las pull requests una línea Claude-Session que enlaza con su propio chat. La opción viene activada de fábrica.

JetBrains: los desarrolladores dicen que los agentes ya escriben el 47 % de su código
Una encuesta de JetBrains a 15.509 desarrolladores halla que los agentes escriben por completo el 47 % del código de media. El 90 % usa un agente cada semana, y Claude Code lidera la adopción con un 39 %.

VS Code 1.136 añade Agent Merge para cerrar pull requests
VS Code 1.136 incorpora Agent Merge en versión preliminar. Un agente responde a los comentarios de revisión, arregla comprobaciones fallidas y resuelve conflictos hasta dejar lista la pull request.