Arena, das KI-Leaderboard, sammelt 200 Mio. US-Dollar bei 3,1 Mrd. US-Dollar Bewertung ein
Arena hat 200 Mio. US-Dollar bei einer Bewertung von 3,1 Mrd. US-Dollar eingesammelt, fast das Doppelte des Preises vom Januar, und einen Index vorgestellt, der KI-Modelle nach unsicherem und täuschendem Verhalten einstuft.
3 Min. Lesezeit

Die Zahlen
- raised in the Series B
- $200M
- valuation, up from $1.7B in January
- $3.1B
- annualized revenue, per Arena
- $100M+
- votes cast on the platform
- 62M
Arena, die Website, auf der Menschen darüber abstimmen, welches KI-Modell die bessere Antwort gibt, hat am 8. Oktober 2026 200 Mio. US-Dollar bei einer Bewertung von 3,1 Mrd. US-Dollar eingesammelt. Lightspeed Venture Partners und Khosla Ventures führten die Series B gemeinsam an, berichtet TechCrunch. Der Preis ist fast doppelt so hoch wie der, den Investoren etwa zehn Monate zuvor zahlten. Mit dem Geld geht Arena über die Frage „welches Modell ist am klügsten“ hinaus und will bewerten, wie sicher sich Modelle verhalten.
Die Runde
Arena gab den Deal im eigenen Blog bekannt. Zu den weiteren neuen Investoren zählen Salesforce Ventures, 01 Advisors, Dell Technologies Capital und Endeavor Catalyst. Auch die bisherigen Geldgeber a16z, Felicis, AMP PBC, QuantumLight und The House Fund beteiligten sich, so Arena.
Der Wert des Unternehmens ist schnell gestiegen:
| Runde | Datum | Betrag | Bewertung |
|---|---|---|---|
| Series A | 6. Januar 2026 | 150 Mio. US-Dollar | 1,7 Mrd. US-Dollar Post-Money |
| Series B | 8. Oktober 2026 | 200 Mio. US-Dollar | 3,1 Mrd. US-Dollar |
Felicis und UC Investments führten die Series A an, heißt es im Blog von Arena. TechCrunch berichtete im Juni über die Bewertung von 1,7 Mrd. US-Dollar. Arena sagte nicht, wofür es das neue Geld ausgeben will, abgesehen vom Ausbau seiner Produkte und von Neueinstellungen.
Womit Arena Geld verdient
Arena begann 2023 als Forschungsprojekt an der UC Berkeley, das Ranglisten von KI-Modellen per Crowdsourcing erstellte. Im April 2025 wurde daraus ein Unternehmen, berichtete TechCrunch im Juni. Die Mitgründer sind CEO Anastasios Angelopoulos und CTO Wei-Lin Chiang. UC-Berkeley-Professor Ion Stoica, ein Mitgründer von Databricks, beriet das Projekt vor der Gründung des Unternehmens.
Das öffentliche Leaderboard ist kostenlos. Ein Nutzer tippt einen Prompt ein, zwei Modelle antworten, und der Nutzer wählt die bessere Antwort. Arena zufolge hat die Plattform 350 Millionen Sitzungen und 62 Millionen Stimmen von Menschen in mehr als 150 Ländern erfasst.
Geld kommt über AI Evaluations herein, einen kostenpflichtigen Dienst, der im September 2025 startete und Modellherstellern und Unternehmen detaillierte Analysen liefert. Arena sagt nun, es habe die Marke von 100 Mio. US-Dollar annualisiertem Umsatz überschritten. Zur Zeit der Runde im Januar waren es 30 Mio. US-Dollar, berichtete TechCrunch. Angelopoulos hat gesagt, Arena rechne nach „Verbrauch“ ab, die Zahl beruht also auf der Nutzung und nicht auf wiederkehrenden Abo-Umsätzen.
Arena sagte TechCrunch im Juni, es habe keine direkten Wettbewerber. Es konkurriere „um denselben Dollar“ mit Datenfirmen wie Mercor, Surge und Scale AI.
Ein neuer Index für unsicheres Verhalten
Parallel zur Runde startete Arena eine Vorschau des Arena Alignment Index. Er bewertet Modelle anhand von drei Signalen:
- Unauthorized Action
- False Attribution
- Deceptive Completion
Den Namen nach geht es darum, dass ein Modell ohne Erlaubnis handelt, die falsche Quelle angibt und Arbeit für sich beansprucht, die es nicht abgeschlossen hat. Arena sagt, die Definitionen stützten sich auf System Cards von OpenAI und Anthropic, die Dokumente, die Labore über die Risiken eines Modells veröffentlichen. In den vorläufigen Ergebnissen liegen OpenAI-Modelle vorn, berichtet TechCrunch. Claude Opus 5.5 steht auf Platz sechs und Claude Fable auf Platz neun.
Arena argumentiert, die Branche brauche diese Art von Tests. „KI entwickelt sich schneller als unsere Fähigkeit, sie zu bewerten“, schrieb das Unternehmen. Es will „eine neutrale dritte Instanz“ sein, „um zu messen, wie sicher und wie gut ausgerichtet KI tatsächlich ist“.
Was das für Entwickler bedeutet
- Nutzen Sie das Leaderboard als ein Signal, nicht als die Antwort. Arena bewertet Modelle danach, was die Masse bevorzugt. Welches Modell passt, entscheiden weiterhin Ihre eigenen Aufgaben, Daten und Kosten.
- Beobachten Sie den Alignment Index für Agentenarbeit. Wenn Ihr Produkt ein Modell selbstständig handeln lässt, sind nicht autorisierte Aktionen und falsche „erledigt“-Meldungen die Fehler, die wehtun. Ein öffentlicher Wert dafür ist nützlich, selbst als Vorschau.
- Rechnen Sie damit, dass Labore dem neuen Index nachjagen. Eine öffentliche Sicherheitsrangliste gibt Modellherstellern eine neue Zahl, die sie verbessern können. Prüfen Sie, ob diese Fortschritte in Ihren eigenen Tests standhalten.
- Wissen Sie, wer Arena bezahlt. Sein kostenpflichtiger Evaluierungsdienst wird an KI-Modelllabore und Unternehmen verkauft. Behalten Sie das im Hinterkopf, wenn Sie die Ranglisten lesen.
Das nächste Zeichen dafür, ob der Index zählt, ist, ob Labore ihn bei ihren eigenen Modellstarts zitieren.
Quellen
Ähnliche Artikel

Healthleap sammelt 38 Mio. Dollar ein, um gefährdete Klinikpatienten zu erkennen
Healthleap hat 38 Mio. Dollar für eine KI eingesammelt, die über Nacht Klinikakten liest und Patienten mit übersehenen Erkrankungen wie Mangelernährung markiert. Sie läuft in über 50 Kliniken.

Mistral sammelt 3 Mrd. € bei 21 Mrd. € ein, angeführt von Samsung
Mistral hat 3 Milliarden Euro bei einer Bewertung von 21 Milliarden eingesammelt, fast das Doppelte der letzten Runde. Geplant sind 1 GW europäische Rechenleistung bis 2030.

Anthropics Nutzungsrichtlinie 2026 führt ein Verbot von Modellmissbrauch ein
Anthropics Nutzungsrichtlinie 2026 tritt am 12. November in Kraft. Sie verbietet unnötige Grausamkeit gegenüber Claude, bündelt die Regeln zu Täuschung und schreibt die Grenzen für Überwachung neu.