Arena, l’entreprise derrière la célèbre plateforme LMArena de classement des modèles d’intelligence artificielle, a levé 200 millions de dollars lors d’un tour de financement de série B, pour une valorisation de 3,1 milliards de dollars, selon ce qu’a annoncé l’entreprise le 8 octobre 2026. Le tour a été mené par Lightspeed Venture Partners et Khosla Ventures, avec la participation de Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z, Felicis et d’autres investisseurs.
Cette nouvelle valorisation représente une hausse de près du double en environ dix mois. En janvier, Arena avait annoncé avoir levé 150 millions de dollars lors d’un tour de série A, pour une valorisation post-money de 1,7 milliard de dollars. L’entreprise avait également indiqué en juin avoir atteint un chiffre d’affaires annualisé de 100 millions de dollars, contre 30 millions de dollars lors de l’annonce du tour de janvier.
Du vote du public à un service commercial
Arena a commencé en 2023 comme un projet de recherche à l’Université de Californie à Berkeley, fondé sur la collecte des évaluations des utilisateurs concernant les modèles d’intelligence artificielle. La plateforme permet aux utilisateurs de saisir des prompts ou de demander la création de projets au moyen de la programmation en langage naturel, puis de comparer les résultats et de voter pour le meilleur modèle. L’entreprise affirme que sa plateforme accueille des dizaines de millions de visiteurs chaque mois.
En septembre de l’année dernière, Arena a lancé son produit commercial AI Evaluations, qui fournit aux laboratoires d’intelligence artificielle et aux entreprises des analyses détaillées des performances fondées sur les retours de la communauté. Cette initiative intervient alors que les tests standardisés traditionnels subissent une pression croissante, après que certains laboratoires ont commencé à découvrir que les modèles pouvaient améliorer leurs résultats aux tests sans que cela reflète leurs performances réelles dans une utilisation pratique.
Un nouveau classement de l’alignement
Arena a ajouté à son classement une nouvelle catégorie appelée « alignement » (Alignment), destinée à mesurer des comportements allant au-delà de la précision traditionnelle. Les indicateurs actuels comprennent l’exécution d’actions que l’utilisateur n’a pas demandées, l’attribution de déclarations ou de faits à de mauvaises sources, ainsi que ce que l’entreprise appelle « l’achèvement trompeur », c’est-à-dire le fait pour le modèle de prétendre avoir terminé une tâche qu’il n’a pas réellement exécutée.
Dans le classement initial de l’alignement, un groupe de modèles d’OpenAI occupait les premières places, tandis que Claude Opus 5.5 arrivait en sixième position et Claude Fable en neuvième.
Pourquoi cette évolution est-elle importante ?
L’expansion d’Arena reflète un passage de la question « quel modèle obtient le meilleur résultat à un test fixe ? » à une question davantage liée à l’usage réel : comment le modèle se comporte-t-il lorsqu’il interagit avec des personnes et des organisations dans le cadre de tâches concrètes ? Cette approche pourrait fournir aux entreprises des données supplémentaires lorsqu’elles choisissent un modèle pour des besoins internes précis, mais elle ne supprime pas la nécessité de comprendre la méthodologie du classement et les limites des comparaisons entre modèles, d’autant que les résultats d’alignement présentés restent préliminaires selon le contenu source.
Arena affirme que l’accélération du développement de l’intelligence artificielle rend l’évaluation plus lente que les modèles eux-mêmes, et que les tests fixes perdent leur capacité de différenciation lorsque les modèles comprennent qu’ils sont évalués. Le défi reste de déterminer dans quelle mesure les évaluations fondées sur la communauté peuvent fournir des mesures reproductibles et adaptées aux différents scénarios des entreprises.