Skip to content
Tech AI Wire

Claude Code, Codex y Cursor coinciden en una herramienta solo el 42% de las veces

Un estudio de 16.893 sesiones de agentes de código encontró que Claude Code, Codex y Cursor eligen la misma herramienta externa solo el 42% de las veces. Stripe venció a PayPal en todas las sesiones donde ambos calificaban.

Por Tech AI Wire Team

3 min de lectura

XLinkedIn
The Armature study's own blog post headline, showing the 16,893-session count and the 42% agreement statistic.

En cifras

coding-agent sessions measured across 75 synthetic repositories
16,893
of sessions where all three agents picked the same tool
42%
of Codex sessions that used web search, versus about 30% for Claude Code
94%

Claude Code, Codex y Cursor eligen la misma herramienta externa solo en el 42% de las situaciones comparables. Ese dato viene de un estudio de 16.893 sesiones de código, publicado por Armature el 3 de septiembre de 2026. Un agente de código elige a menudo, en su nombre, un procesador de pagos, una API de voz o un servicio de autenticación. Qué agente usó determina más del resultado de lo que podría esperar.

Armature construye herramientas para empresas que quieren que su producto sea elegido por agentes de código. Su estudio midió cómo se comportan los agentes cuando nadie está mirando.

Cómo se construyó la prueba

Los investigadores construyeron 75 repositorios sintéticos en 10 lenguajes de programación y 51 bases de código válidas, que cubren 18 sectores. Cada repositorio usaba un nombre de empresa ficticio y un historial de commits ficticio. Los archivos de bloqueo eran reales, verificados contra registros de paquetes reales como npm, así que los agentes trabajaban con datos de dependencias genuinos.

A lo largo de esos repositorios, el equipo ejecutó 1.163 variantes de prompts, produciendo 16.893 sesiones en total. Ecosistema Startup informa de que el montaje también recorrió cuatro personas de usuario y tres entornos de sandbox, y usó un modelo de IA aparte para simular una revisión de código humana.

Las herramientas en sí divergieron mucho

La cifra destacada es esa tasa de acuerdo del 42%. El resto del tiempo, los tres agentes tomaron tres decisiones distintas.

Un ejemplo concreto, reportado de forma idéntica por ambas fuentes: PayPal apareció como opción elegible en 139 sesiones. Nunca fue elegido. Stripe ganó 124 de esas mismas sesiones.

ComportamientoCodexClaude Code
Usa búsqueda web94% de las sesionesCerca del 30% de las sesiones
Estilo de búsquedaAcota con operadores site:Consultas más amplias, sin restricción
Páginas revisadas por búsquedaReferenciaCerca de 3 veces más que Codex
Construye una solución propia10% de las sesiones19% de las sesiones

La alta tasa de búsqueda de Codex, combinada con consultas estrechas y restringidas por operadores, sugiere que se apoya en la web abierta para confirmar rápido una respuesta concreta. Claude Code busca con menos frecuencia, pero cuando lo hace, lee más ampliamente antes de decidir.

La cifra de "hecho en casa" merece detenerse en ella

Claude Code eligió escribir código a medida en lugar de adoptar una herramienta externa en el 19% de las sesiones, frente al 10% de Codex y Cursor.

No es una diferencia pequeña. Casi una de cada cinco veces que existía una opción externa, Claude Code construyó su propia versión en su lugar. Que eso refleje mejor criterio, o simplemente un sesgo hacia generar código en vez de investigar alternativas, es algo que este estudio no puede resolver por sí solo. Midió resultados, no razonamientos.

Qué significa esto para los desarrolladores

No dé por hecho que la elección de herramienta de su agente de código es neutral o universal. Si le pide a un agente distinto que resuelva el mismo problema de integración, espere una posibilidad real de un resultado distinto. Puede ser un proveedor diferente, una biblioteca diferente, o una implementación construida desde cero, no solo un estilo de código distinto.

Trate una dependencia elegida por un agente como una decisión que hay que revisar, no como un valor por defecto que se acepta. Una tasa de acuerdo del 42% entre tres agentes conocidos dice algo. El otro 58% del tiempo, la elección la hizo algo más parecido a un estilo de la casa que a una evaluación meditada de sus opciones. Revise la licencia, el coste y el estado de mantenimiento antes de que esa dependencia salga a producción.

Si usted mismo construye una herramienta o una API para desarrolladores, este estudio es un adelanto de un canal de adquisición real. La respuesta por defecto de un agente a "qué debería usar para X" se está convirtiendo en una vía de adquisición genuina. El estudio sugiere que la calidad de la documentación y la visibilidad en la web moldean esa respuesta tanto como el propio producto.

Vigile el reparto entre construir en casa y adoptar herramientas externas según el agente, si estandariza herramientas en un equipo. Un equipo que mezcla Claude Code con Codex o Cursor debería esperar más código propio, hecho en casa, del lado de Claude Code de ese reparto. Ese reparto viene de qué agente escribió el código, no de lo difícil que fuera la tarea.

Fuentes

  1. Which tools do Claude Code, Codex and Cursor choose? We measured 16,893 sessions to find out - Armature
  2. Claude, Codex y Cursor: 16.893 tests revelan qué eligen - Ecosistema Startup

Artículos relacionados