AIリーダーボードのArena、評価額31億ドルで2億ドルを調達
Arena(アリーナ)は評価額31億ドルで2億ドルを調達しました。1月の評価額のほぼ2倍です。あわせて、AIモデルを安全でない行動や欺く行動でランク付けする指標のプレビューを公開しました。
3 分で読めます

数字で見る
- raised in the Series B
- $200M
- valuation, up from $1.7B in January
- $3.1B
- annualized revenue, per Arena
- $100M+
- votes cast on the platform
- 62M
どのAIモデルがより良い答えを出すかを人々が投票するウェブサイトのArenaは、2026年10月8日、評価額31億ドルで2億ドルを調達しました。TechCrunchによると、シリーズBはLightspeed Venture PartnersとKhosla Venturesが共同で主導しました。この価格は、約10か月前に投資家が支払った額のほぼ2倍です。Arenaはこの資金で、「どのモデルが最も賢いか」を超えて、モデルがどれほど安全に振る舞うかの評価へと踏み出そうとしています。
今回のラウンド
Arenaは、自社のブログでこの取引を発表しました。ほかの新しい投資家には、Salesforce Ventures、01 Advisors、Dell Technologies Capital、Endeavor Catalystが含まれます。Arenaによると、既存の出資者であるa16z、Felicis、AMP PBC、QuantumLight、The House Fundも参加しました。
同社の価値は急速に上がってきました。
| ラウンド | 日付 | 調達額 | 評価額 |
|---|---|---|---|
| シリーズA | 2026年1月6日 | 1億5000万ドル | ポストマネーで17億ドル |
| シリーズB | 2026年10月8日 | 2億ドル | 31億ドル |
Arenaのブログによると、シリーズAを主導したのはFelicisとUC Investmentsです。TechCrunchは6月に、17億ドルという評価額を報じていました。Arenaは、製品の開発と採用以外に、新しい資金をどう使うかを明らかにしていません。
Arenaの稼ぎ方
Arenaは2023年、AIモデルのランキングをクラウドソーシングで作るUC Berkeleyの研究プロジェクトとして始まりました。TechCrunchが6月に報じたところによると、2025年4月に会社になりました。共同創業者は、最高経営責任者のAnastasios Angelopoulos氏と、最高技術責任者のWei-Lin Chiang氏です。Databricksの共同創業者でUC Berkeleyの教授であるIon Stoica氏は、法人化の前にこのプロジェクトに助言していました。
公開のリーダーボードは無料です。ユーザーがプロンプトを入力すると、2つのモデルが答え、ユーザーがより良い回答を選びます。Arenaによると、このプラットフォームには150を超える国の人々から、3億5000万セッションと6200万票が記録されています。
収益源はAI Evaluationsです。2025年9月に始まった有料サービスで、モデルの開発元や企業に詳しい分析を提供します。Arenaは現在、年換算の売上高が1億ドルを超えたとしています。TechCrunchによると、1月のラウンドの時点では3000万ドルでした。Angelopoulos氏は、Arenaは「消費」に対して課金していると述べています。そのため、この数字は継続的なサブスクリプション収入ではなく、利用量に基づくものです。
Arenaは6月、TechCrunchに対し、直接の競合はいないと語りました。同社は、Mercor、Surge、Scale AIなどのデータ企業と「同じ1ドルをめぐって」競争していると言います。
安全でない行動を測る新しい指標
Arenaは今回のラウンドとあわせて、Arena Alignment Indexのプレビューを公開しました。この指標は、3つのシグナルでモデルを採点します。
- Unauthorized Action
- False Attribution
- Deceptive Completion
名前から判断すると、それぞれモデルが許可なく行動すること、間違った出典を挙げること、終えていない作業を終えたと主張することを扱っています。Arenaによると、これらの定義はOpenAIとAnthropicのシステムカードに基づいています。システムカードとは、研究所がモデルのリスクについて公開する文書です。TechCrunchによると、暫定結果ではOpenAIのモデルが上位を占めています。Claude Opus 5.5は6位、Claude Fableは9位です。
Arenaは、この分野にはこうしたテストが必要だと主張しています。同社は「AIは、私たちがそれを評価する能力よりも速く進歩しています」と書きました。同社は「AIが実際にどれほど安全で、アラインメントが取れているかを測る中立的な第三者」になりたいと考えています。
開発者にとっての意味
- リーダーボードは答えではなく、1つのシグナルとして使うこと。 Arenaは、大勢の人が好むものに基づいてモデルをランク付けします。どのモデルが合うかを決めるのは、依然として自分のタスク、データ、コストです。
- エージェントの用途では、Alignment Indexに注目すること。 製品でモデルが自ら行動するなら、許可のない行動や偽りの「完了」メッセージこそが痛手になる失敗です。プレビューの段階でも、それらの公開スコアは役に立ちます。
- 研究所が新しい指標を追いかけることを見込んでおくこと。 公開の安全性ランキングは、モデルの開発元に改善すべき新しい数字を与えます。その改善が自分のテストでも通用するかを確認してください。
- 誰がArenaにお金を払っているかを知ること。 有料の評価サービスは、AIモデルの研究所や企業に販売されています。ランキングを読むときは、そのことを念頭に置いてください。
この指標が重要かどうかを示す次の兆しは、研究所が自社のモデル発表でこれを引用し始めるかどうかです。
出典
関連記事

Healthleap、病院の高リスク患者を見つけるAIで3800万ドルを調達
Healthleapは、病院の記録を夜間に読み込み、栄養失調など見落とされやすい状態にある患者を示すAIのために3800万ドルを調達した。このソフトは50以上の病院で稼働している。

Mistral、Samsung主導で30億ユーロを調達(評価額210億ユーロ)
Mistralが30億ユーロを調達し、評価額は210億ユーロになりました。前回のほぼ2倍です。2030年までに欧州で1GWの計算資源を用意し、他社のオープンウェイト(重み公開)モデルも預かる計画です。

Anthropicの2026年版Usage Policy、モデルへの虐待行為の禁止を追加
Anthropicの2026年版Usage Policy(利用ポリシー)は11月12日に発効します。Claudeに対する不必要な残酷な振る舞いを禁じ、欺瞞に関するルールを統合し、監視に関する制限を書き直しました。