Skip to content
Tech AI Wire

Claude Code, Codex et Cursor ne s'accordent sur un outil que 42% du temps

Une étude portant sur 16 893 sessions d'agents de code a trouvé que Claude Code, Codex et Cursor choisissent le même outil tiers seulement 42% du temps. Stripe a battu PayPal dans toutes les sessions où les deux étaient éligibles.

Par Tech AI Wire Team

3 min de lecture

XLinkedIn
The Armature study's own blog post headline, showing the 16,893-session count and the 42% agreement statistic.

En chiffres

coding-agent sessions measured across 75 synthetic repositories
16,893
of sessions where all three agents picked the same tool
42%
of Codex sessions that used web search, versus about 30% for Claude Code
94%

Claude Code, Codex et Cursor choisissent le même outil tiers dans seulement 42% des situations comparables. Ce chiffre vient d'une étude portant sur 16 893 sessions de code, publiée par Armature le 3 septembre 2026. Un agent de code choisit souvent à votre place un processeur de paiement, une API vocale ou un service d'authentification. L'agent que vous avez utilisé détermine plus du résultat que vous ne l'imaginez.

Armature construit des outils pour les entreprises qui veulent que leur produit soit choisi par les agents de code. Son étude a mesuré comment les agents se comportent quand personne ne regarde.

Comment le test a été construit

Les chercheurs ont bâti 75 dépôts synthétiques dans 10 langages de programmation et 51 bases de code valides, couvrant 18 secteurs. Chaque dépôt utilisait un nom d'entreprise fictif et un historique de commits fictif. Les fichiers de verrouillage, eux, étaient réels, vérifiés contre de vrais registres de paquets comme npm, si bien que les agents travaillaient avec des données de dépendances authentiques.

Sur l'ensemble de ces dépôts, l'équipe a exécuté 1 163 variantes de prompts, produisant 16 893 sessions au total. Ecosistema Startup rapporte que le dispositif a aussi fait tourner quatre profils d'utilisateurs et trois environnements de bac à sable, et utilisé un modèle d'IA distinct pour simuler une relecture de code humaine.

Les outils eux-mêmes ont fortement divergé

Le chiffre phare est ce taux d'accord de 42%. Le reste du temps, les trois agents ont fait trois choix différents.

Un exemple concret, rapporté à l'identique par les deux sources : PayPal est apparu comme option éligible dans 139 sessions. Il n'a jamais été choisi. Stripe a remporté 124 de ces mêmes sessions.

ComportementCodexClaude Code
Utilise la recherche web94% des sessionsEnviron 30% des sessions
Style de rechercheRestreint avec des opérateurs site:Requêtes plus larges, sans restriction
Pages consultées par rechercheRéférenceEnviron 3 fois plus que Codex
Construit une solution maison10% des sessions19% des sessions

Le taux élevé de recherche de Codex, combiné à des requêtes étroites et restreintes par opérateurs, suggère qu'il s'appuie sur le web ouvert pour confirmer rapidement une réponse précise. Claude Code cherche moins souvent, mais lit plus largement quand il le fait, avant de décider.

Le chiffre du "fait maison" mérite qu'on s'y attarde

Claude Code a choisi d'écrire du code sur mesure plutôt que d'adopter un outil tiers dans 19% des sessions, contre 10% pour Codex et Cursor.

Ce n'est pas un petit écart. Près d'une fois sur cinq où une option tierce existait, Claude Code a construit sa propre version à la place. Que cela reflète un meilleur jugement, ou simplement un biais vers la génération de code plutôt que la recherche d'alternatives, cette étude ne peut pas le trancher seule. Elle a mesuré des résultats, pas des raisonnements.

Ce que cela signifie pour les développeurs

Ne présumez pas que le choix d'outil de votre agent de code est neutre ou universel. Si vous demandez à un agent différent de résoudre le même problème d'intégration, attendez-vous à une vraie chance d'obtenir un résultat différent. Cela peut être un fournisseur différent, une bibliothèque différente, ou une implémentation entièrement construite à partir de zéro, pas seulement un style de code différent.

Traitez une dépendance choisie par un agent comme une décision à examiner, pas comme un choix par défaut à accepter. Un taux d'accord de 42% entre trois agents connus dit quelque chose. Les 58% restants, le choix a été fait par quelque chose de plus proche d'un style maison que d'une évaluation réfléchie de vos options. Vérifiez la licence, le coût et l'état de maintenance avant que cette dépendance ne parte en production.

Si vous construisez vous-même un outil ou une API pour développeurs, cette étude est un aperçu d'un vrai canal d'acquisition. La réponse par défaut d'un agent à "que devrais-je utiliser pour X" devient un véritable chemin d'acquisition. L'étude suggère que la qualité de la documentation et la visibilité sur le web façonnent cette réponse autant que le produit lui-même.

Surveillez la répartition entre fabrication maison et adoption externe selon l'agent, si vous standardisez les outils au sein d'une équipe. Une équipe qui mélange Claude Code avec Codex ou Cursor doit s'attendre à plus de code maison venant du côté Claude Code de cette répartition. Cette répartition vient de l'agent qui a écrit le code, pas de la difficulté de la tâche.

Sources

  1. Which tools do Claude Code, Codex and Cursor choose? We measured 16,893 sessions to find out - Armature
  2. Claude, Codex y Cursor: 16.893 tests revelan qué eligen - Ecosistema Startup

Articles liés