AIモデルのランキングで知られるLMArenaプラットフォームを運営するArenaは、2026年10月8日に発表したところによると、評価額31億ドルでシリーズBの資金調達ラウンドにおいて2億ドルを調達した。今回のラウンドはLightspeed Venture PartnersとKhosla Venturesが主導し、Salesforce Ventures、01 Advisors、Dell Technologies Capital、Endeavor Catalyst、a16z、Felicisなどの投資家が参加した。
新たな評価額は、約10カ月でおよそ2倍に増加したことを意味する。Arenaは1月、ポストマネー評価額17億ドルでシリーズAにおいて1億5,000万ドルを調達したと発表していた。また同社は6月、年間ランレート収益が1億ドルに達したと述べている。これは、1月のラウンド発表時の3,000万ドルから増加した数字だ。
大衆投票から商用サービスへ
Arenaは2023年、カリフォルニア大学バークレー校の研究プロジェクトとして始まり、AIモデルに対するユーザー評価の収集に基づいていた。プラットフォームでは、ユーザーがプロンプトを入力したり、メタプログラミングを用いたプロジェクトの作成を依頼したりしたうえで、結果を比較し、より優れたモデルに投票できる。同社によると、プラットフォームには毎月数千万人が訪れている。
昨年9月、Arenaは商用製品AI Evaluationsを開始した。この製品は、コミュニティからのフィードバックに基づく詳細なパフォーマンス分析を、AI研究所や企業に提供するものだ。これは、従来のベンチマークテストが高まる圧力にさらされている時期の動きでもある。一部の研究所が、モデルは実際の実用時のパフォーマンスを反映しないまま、テスト結果を改善できることに気付き始めたためだ。
新たなアライメントランキング
Arenaはリーダーボードに「アライメント(Alignment)」という新たなカテゴリーを追加し、従来の精度を超える行動を測定している。現在の指標には、ユーザーが要求していないアクションの実行、発言や事実の誤った出典への帰属、そして同社が「欺瞞的完了」と呼ぶもの、すなわちモデルが実際には実行していないタスクを完了したと主張することが含まれる。
初期のアライメントランキングでは、OpenAIの複数のモデル群が上位を占めた。一方、Claude Opus 5.5は6位、Claude Fableは9位となった。
なぜこの進展が重要なのか
Arenaの拡大は、「固定されたテストで最も高いスコアを獲得するモデルはどれか」という問いから、実際の利用により密接に関係する問いへと移行していることを示している。つまり、人々や組織が実際のタスクでモデルとやり取りするとき、モデルはどのように振る舞うのかという問いだ。このアプローチは、企業が特定の社内ニーズに合わせてモデルを選ぶ際に、追加のデータを提供する可能性がある。ただし、ランキングの方法論とモデル間比較の限界を理解する必要性がなくなるわけではない。特に、提示されているアライメントの結果は、原資料によればなお初期段階にある。
Arenaは、AIの発展が加速することで、評価の進歩がモデル自体より遅くなっており、モデルがテスト対象であることを認識すると、固定テストの識別能力が失われると述べている。残された課題は、コミュニティに基づく評価が、再現可能で、さまざまな企業シナリオに適した測定を提供できるかどうかだ。