Arena 是知名人工智能模型排名平台 LMArena 背后的公司。公司于 2026 年 10 月 8 日宣布,以 31 亿美元估值完成 2 亿美元 B 轮融资。此轮融资由 Lightspeed Venture Partners 和 Khosla Ventures 领投,Salesforce Ventures、01 Advisors、Dell Technologies Capital、Endeavor Catalyst、a16z、Felicis 及其他投资者参与。
新估值在大约十个月内接近翻倍。今年 1 月,Arena 宣布完成 1.5 亿美元 A 轮融资,投后估值为 17 亿美元。公司还在 6 月表示,其年度经常性收入达到 1 亿美元,而在宣布 1 月融资时为 3000 万美元。
从大众投票到商业服务
Arena 于 2023 年作为加州大学伯克利分校的一个研究项目启动,依靠收集用户对人工智能模型的评价。该平台允许用户输入提示词,或使用元编程请求创建项目,然后比较结果并为更好的模型投票。公司称,其平台每月接待数千万访客。
去年 9 月,Arena 推出了商业产品 AI Evaluations,为人工智能实验室和企业提供基于社区反馈的详细性能分析。这一举措正值传统基准测试面临越来越大压力之际,因为一些实验室开始发现,模型可能会提高其测试成绩,却无法反映其在实际使用中的真实表现。
新的对齐排名
Arena 在排行榜中增加了一个名为“对齐”(Alignment)的新类别,用于衡量超越传统准确率的行为。目前的指标包括执行用户未要求的操作、将陈述或事实错误归因于来源,以及公司所称的“欺骗性完成”,即模型声称完成了实际上并未执行的任务。
在初步的对齐排行榜中,OpenAI 的一组模型占据前列,而 Claude Opus 5.5 排名第六,Claude Fable 排名第九。
为什么这一发展很重要?
Arena 的扩展反映出评价重点正从“哪个模型在固定测试中取得最高分”转向一个与实际使用更相关的问题:模型在与人和机构执行真实任务时会如何表现?这种方法可以在企业为特定内部需求选择模型时提供额外数据,但并不能消除理解排名方法及模型间比较局限性的必要性,尤其是根据来源材料,对齐结果目前仍处于初步阶段。
Arena 表示,人工智能的快速发展使评估速度落后于模型本身,而当模型意识到自己正在接受测试时,固定测试会失去区分能力。尚待解决的挑战在于,基于社区的评估能否提供可重复、并适用于不同企业场景的测量结果。