Skip to content
Tech AI Wire

Claude Code, Codex und Cursor stimmen nur in 42% der Fälle bei der Werkzeugwahl überein

Eine Studie über 16.893 Coding-Agent-Sitzungen ergab: Claude Code, Codex und Cursor wählen nur in 42% der Fälle dasselbe Drittanbieter-Werkzeug. Stripe gewann jede Sitzung, in der auch PayPal infrage kam.

Von Tech AI Wire Team

3 Min. Lesezeit

XLinkedIn
The Armature study's own blog post headline, showing the 16,893-session count and the 42% agreement statistic.

Die Zahlen

coding-agent sessions measured across 75 synthetic repositories
16,893
of sessions where all three agents picked the same tool
42%
of Codex sessions that used web search, versus about 30% for Claude Code
94%

Claude Code, Codex und Cursor wählen nur in 42 Prozent vergleichbarer Situationen dasselbe Drittanbieter-Werkzeug. Das stammt aus einer Studie über 16.893 Coding-Sitzungen, veröffentlicht von Armature am 3. September 2026. Ein Coding-Agent entscheidet oft in Ihrem Namen über einen Zahlungsdienstleister, eine Sprach-API oder einen Authentifizierungsdienst. Welcher Agent das war, bestimmt mehr über das Ergebnis, als man erwarten würde.

Armature baut Werkzeuge für Unternehmen, deren Produkt von Coding-Agenten ausgewählt werden soll. Die Studie hat untersucht, wie sich Agenten verhalten, wenn niemand zusieht.

Wie der Test aufgebaut war

Die Forscher bauten 75 künstliche Repositories in 10 Programmiersprachen und 51 gültigen Codebasen, die 18 Branchen abdecken. Jedes Repository nutzte einen erfundenen Firmennamen und eine erfundene Commit-Historie. Die Lockfiles waren echt, geprüft gegen tatsächliche Paket-Registries wie npm, sodass die Agenten mit echten Abhängigkeitsdaten arbeiteten.

Über diese Repositories hinweg führte das Team 1.163 Prompt-Varianten aus, was 16.893 Sitzungen insgesamt ergab. Ecosistema Startup berichtet, der Aufbau habe zudem vier Nutzer-Personas und drei Sandbox-Umgebungen durchlaufen und ein separates KI-Modell genutzt, um menschliche Code-Reviews zu simulieren.

Die Werkzeuge selbst gingen deutlich auseinander

Die Schlagzeilen-Zahl ist die Übereinstimmungsrate von 42 Prozent. Den Rest der Zeit trafen die drei Agenten drei verschiedene Entscheidungen.

Ein konkretes Beispiel, identisch von beiden Quellen berichtet: PayPal tauchte in 139 Sitzungen als infrage kommende Option auf. Es wurde nie gewählt. Stripe gewann 124 dieser Sitzungen.

VerhaltenCodexClaude Code
Nutzt Websuche94% der SitzungenEtwa 30% der Sitzungen
SuchstilGrenzt mit site:-Operatoren einBreitere, uneingeschränkte Anfragen
Durchsuchte Seiten pro SucheBasiswertEtwa 3-mal mehr als Codex
Baut eine eigene Lösung10% der Sitzungen19% der Sitzungen

Codex' hohe Suchrate, gepaart mit engen, operatorbeschränkten Anfragen, deutet darauf hin, dass es sich aufs offene Web verlässt, um eine konkrete Antwort schnell zu bestätigen. Claude Code sucht seltener, liest dabei aber breiter, bevor es entscheidet.

Die Eigenbau-Zahl verdient besondere Aufmerksamkeit

Claude Code entschied sich in 19 Prozent der Sitzungen dafür, eigenen Code statt eines Drittanbieter-Werkzeugs zu schreiben, gegenüber 10 Prozent bei Codex und Cursor.

Das ist kein kleiner Unterschied. Fast jedes fünfte Mal, wenn eine Drittanbieter-Option existierte, baute Claude Code stattdessen seine eigene Version. Ob das besseres Urteilsvermögen widerspiegelt oder einfach eine Neigung, Code zu erzeugen statt Alternativen zu recherchieren, kann diese Studie allein nicht klären. Sie hat Ergebnisse gemessen, nicht Beweggründe.

Was das für Entwickler bedeutet

Gehen Sie nicht davon aus, dass die Werkzeugwahl Ihres Coding-Agenten neutral oder allgemeingültig ist. Bitten Sie einen anderen Agenten, dasselbe Integrationsproblem zu lösen, rechnen Sie mit einer echten Chance auf ein anderes Ergebnis. Das kann ein anderer Anbieter, eine andere Bibliothek oder eine komplett selbst geschriebene Lösung sein, nicht nur ein anderer Codestil.

Behandeln Sie eine vom Agenten gewählte Abhängigkeit als Entscheidung, die geprüft werden muss, nicht als Standard, den man akzeptiert. Eine Übereinstimmungsrate von 42 Prozent über drei bekannte Agenten hinweg sagt etwas aus. Die anderen 58 Prozent der Zeit kam die Wahl eher aus einer Art Hausstil zustande als aus einer durchdachten Abwägung Ihrer Optionen. Prüfen Sie Lizenz, Kosten und Pflegezustand, bevor diese Abhängigkeit ausgeliefert wird.

Wenn Sie selbst ein Entwicklerwerkzeug oder eine API bauen, ist diese Studie eine Vorschau auf einen echten Vertriebskanal. Die Standardantwort eines Agenten auf "Was sollte ich für X nutzen" wird zu einem echten Akquisitionsweg. Die Studie legt nahe, dass Dokumentationsqualität und Auffindbarkeit im Web diese Antwort ebenso prägen wie das Produkt selbst.

Beobachten Sie die Aufteilung zwischen Eigenbau und Zukauf je nach Agent, wenn Sie Werkzeuge in einem Team vereinheitlichen. Ein Team, das Claude Code mit Codex oder Cursor mischt, sollte mehr eigenen, selbst geschriebenen Code von der Claude-Code-Seite dieser Aufteilung erwarten. Diese Aufteilung ergibt sich daraus, welcher Agent den Code geschrieben hat, nicht daraus, wie schwer die Aufgabe war.

Quellen

  1. Which tools do Claude Code, Codex and Cursor choose? We measured 16,893 sessions to find out - Armature
  2. Claude, Codex y Cursor: 16.893 tests revelan qué eligen - Ecosistema Startup

Ähnliche Artikel