Arena, компания, стоящая за популярной платформой LMArena для ранжирования моделей искусственного интеллекта, привлекла 200 млн долларов в раунде финансирования серии B при оценке в 3,1 млрд долларов, сообщила компания 8 октября 2026 года. Раунд возглавили Lightspeed Venture Partners и Khosla Ventures при участии Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z, Felicis и других инвесторов.
Новая оценка почти вдвое выше прежней примерно за десять месяцев. В январе Arena объявила о привлечении 150 млн долларов в раунде серии A при оценке после инвестиций в 1,7 млрд долларов. Компания также сообщила в июне, что достигла годового темпа выручки в 100 млн долларов по сравнению с 30 млн долларов на момент объявления январского раунда.
От массового голосования к коммерческому сервису
Arena начала работу в 2023 году как исследовательский проект в Калифорнийском университете в Беркли, основанный на сборе пользовательских оценок моделей искусственного интеллекта. Платформа позволяет пользователям вводить запросы или просить создать проекты с использованием метапрограммирования, а затем сравнивать результаты и голосовать за лучшую модель. Компания утверждает, что её платформа принимает десятки миллионов посетителей ежемесячно.
В сентябре прошлого года Arena запустила коммерческий продукт AI Evaluations, который предоставляет лабораториям искусственного интеллекта и компаниям подробную аналитику производительности на основе отзывов сообщества. Это происходит в условиях растущего давления на традиционные стандартные тесты: некоторые лаборатории начали обнаруживать, что модели могут улучшать результаты в тестах, не демонстрируя при этом реального повышения эффективности в практическом использовании.
Новый рейтинг согласованности
Arena добавила в таблицу лидеров новую категорию под названием «согласованность» (Alignment), предназначенную для измерения поведения, выходящего за рамки традиционной точности. Текущие показатели включают выполнение действий, о которых пользователь не просил, приписывание заявлений или фактов ошибочным источникам, а также то, что компания называет «обманчивым выполнением», то есть заявление модели о завершении задачи, которую она фактически не выполнила.
В первоначальной таблице согласованности группа моделей OpenAI заняла первые места, тогда как Claude Opus 5.5 оказался на шестом месте, а Claude Fable — на девятом.
Почему это развитие важно?
Расширение Arena отражает переход от вопроса «какая модель показывает лучший результат в фиксированном тесте?» к вопросу, более связанному с реальным использованием: как ведёт себя модель, когда люди и организации взаимодействуют с ней при выполнении реальных задач? Такой подход может предоставить компаниям дополнительные данные при выборе модели для конкретных внутренних потребностей, однако он не отменяет необходимости понимать методологию рейтинга и ограничения сравнений между моделями, особенно поскольку представленные результаты по согласованности, согласно исходному материалу, пока являются предварительными.
Arena утверждает, что ускорение развития искусственного интеллекта делает оценивание более медленным, чем сами модели, а фиксированные тесты теряют способность различать модели, когда те понимают, что проходят проверку. Открытый вопрос заключается в том, смогут ли оценки, основанные на сообществе, предоставлять воспроизводимые измерения, подходящие для различных сценариев использования в организациях.