Zum Inhalt springen

Arena, das KI-Leaderboard, sammelt 200 Mio. US-Dollar bei 3,1 Mrd. US-Dollar Bewertung ein

Arena hat 200 Mio. US-Dollar bei einer Bewertung von 3,1 Mrd. US-Dollar eingesammelt, fast das Doppelte des Preises vom Januar, und einen Index vorgestellt, der KI-Modelle nach unsicherem und täuschendem Verhalten einstuft.

Von Tech AI Wire Team

3 Min. Lesezeit

XLinkedIn
Screenshot der Leaderboard-Seite von Arena mit Ranglisten neuer Veröffentlichungen und einer Top-10-Liste von KI-Agenten.

Die Zahlen

raised in the Series B
$200M
valuation, up from $1.7B in January
$3.1B
annualized revenue, per Arena
$100M+
votes cast on the platform
62M

Arena, die Website, auf der Menschen darüber abstimmen, welches KI-Modell die bessere Antwort gibt, hat am 8. Oktober 2026 200 Mio. US-Dollar bei einer Bewertung von 3,1 Mrd. US-Dollar eingesammelt. Lightspeed Venture Partners und Khosla Ventures führten die Series B gemeinsam an, berichtet TechCrunch. Der Preis ist fast doppelt so hoch wie der, den Investoren etwa zehn Monate zuvor zahlten. Mit dem Geld geht Arena über die Frage „welches Modell ist am klügsten“ hinaus und will bewerten, wie sicher sich Modelle verhalten.

Die Runde

Arena gab den Deal im eigenen Blog bekannt. Zu den weiteren neuen Investoren zählen Salesforce Ventures, 01 Advisors, Dell Technologies Capital und Endeavor Catalyst. Auch die bisherigen Geldgeber a16z, Felicis, AMP PBC, QuantumLight und The House Fund beteiligten sich, so Arena.

Der Wert des Unternehmens ist schnell gestiegen:

RundeDatumBetragBewertung
Series A6. Januar 2026150 Mio. US-Dollar1,7 Mrd. US-Dollar Post-Money
Series B8. Oktober 2026200 Mio. US-Dollar3,1 Mrd. US-Dollar

Felicis und UC Investments führten die Series A an, heißt es im Blog von Arena. TechCrunch berichtete im Juni über die Bewertung von 1,7 Mrd. US-Dollar. Arena sagte nicht, wofür es das neue Geld ausgeben will, abgesehen vom Ausbau seiner Produkte und von Neueinstellungen.

Womit Arena Geld verdient

Arena begann 2023 als Forschungsprojekt an der UC Berkeley, das Ranglisten von KI-Modellen per Crowdsourcing erstellte. Im April 2025 wurde daraus ein Unternehmen, berichtete TechCrunch im Juni. Die Mitgründer sind CEO Anastasios Angelopoulos und CTO Wei-Lin Chiang. UC-Berkeley-Professor Ion Stoica, ein Mitgründer von Databricks, beriet das Projekt vor der Gründung des Unternehmens.

Das öffentliche Leaderboard ist kostenlos. Ein Nutzer tippt einen Prompt ein, zwei Modelle antworten, und der Nutzer wählt die bessere Antwort. Arena zufolge hat die Plattform 350 Millionen Sitzungen und 62 Millionen Stimmen von Menschen in mehr als 150 Ländern erfasst.

Geld kommt über AI Evaluations herein, einen kostenpflichtigen Dienst, der im September 2025 startete und Modellherstellern und Unternehmen detaillierte Analysen liefert. Arena sagt nun, es habe die Marke von 100 Mio. US-Dollar annualisiertem Umsatz überschritten. Zur Zeit der Runde im Januar waren es 30 Mio. US-Dollar, berichtete TechCrunch. Angelopoulos hat gesagt, Arena rechne nach „Verbrauch“ ab, die Zahl beruht also auf der Nutzung und nicht auf wiederkehrenden Abo-Umsätzen.

Arena sagte TechCrunch im Juni, es habe keine direkten Wettbewerber. Es konkurriere „um denselben Dollar“ mit Datenfirmen wie Mercor, Surge und Scale AI.

Ein neuer Index für unsicheres Verhalten

Parallel zur Runde startete Arena eine Vorschau des Arena Alignment Index. Er bewertet Modelle anhand von drei Signalen:

  • Unauthorized Action
  • False Attribution
  • Deceptive Completion

Den Namen nach geht es darum, dass ein Modell ohne Erlaubnis handelt, die falsche Quelle angibt und Arbeit für sich beansprucht, die es nicht abgeschlossen hat. Arena sagt, die Definitionen stützten sich auf System Cards von OpenAI und Anthropic, die Dokumente, die Labore über die Risiken eines Modells veröffentlichen. In den vorläufigen Ergebnissen liegen OpenAI-Modelle vorn, berichtet TechCrunch. Claude Opus 5.5 steht auf Platz sechs und Claude Fable auf Platz neun.

Arena argumentiert, die Branche brauche diese Art von Tests. „KI entwickelt sich schneller als unsere Fähigkeit, sie zu bewerten“, schrieb das Unternehmen. Es will „eine neutrale dritte Instanz“ sein, „um zu messen, wie sicher und wie gut ausgerichtet KI tatsächlich ist“.

Was das für Entwickler bedeutet

  • Nutzen Sie das Leaderboard als ein Signal, nicht als die Antwort. Arena bewertet Modelle danach, was die Masse bevorzugt. Welches Modell passt, entscheiden weiterhin Ihre eigenen Aufgaben, Daten und Kosten.
  • Beobachten Sie den Alignment Index für Agentenarbeit. Wenn Ihr Produkt ein Modell selbstständig handeln lässt, sind nicht autorisierte Aktionen und falsche „erledigt“-Meldungen die Fehler, die wehtun. Ein öffentlicher Wert dafür ist nützlich, selbst als Vorschau.
  • Rechnen Sie damit, dass Labore dem neuen Index nachjagen. Eine öffentliche Sicherheitsrangliste gibt Modellherstellern eine neue Zahl, die sie verbessern können. Prüfen Sie, ob diese Fortschritte in Ihren eigenen Tests standhalten.
  • Wissen Sie, wer Arena bezahlt. Sein kostenpflichtiger Evaluierungsdienst wird an KI-Modelllabore und Unternehmen verkauft. Behalten Sie das im Hinterkopf, wenn Sie die Ranglisten lesen.

Das nächste Zeichen dafür, ob der Index zählt, ist, ob Labore ihn bei ihren eigenen Modellstarts zitieren.

Quellen

  1. Popular AI leaderboard Arena nearly doubles valuation to $3.1B valuation in 10 months - TechCrunch
  2. Arena Series B - Arena
  3. Arena, the AI leaderboard everyone uses, is now a $100M business - TechCrunch

Ähnliche Artikel