Arena, la empresa detrás de la popular plataforma LMArena para clasificar modelos de inteligencia artificial, recaudó 200 millones de dólares en una ronda de financiación de serie B con una valoración de 3.100 millones de dólares, según anunció la empresa el 8 de octubre de 2026. La ronda estuvo liderada por Lightspeed Venture Partners y Khosla Ventures, con la participación de Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z, Felicis y otros inversores.
La nueva valoración representa un aumento de casi el doble en aproximadamente diez meses. En enero, Arena anunció que había recaudado 150 millones de dólares en una ronda de serie A con una valoración posterior a la inversión de 1.700 millones de dólares. La empresa también afirmó en junio que había alcanzado unos ingresos anualizados de 100 millones de dólares, frente a los 30 millones de dólares anunciados al comunicar la ronda de enero.
De la votación pública al servicio comercial
Arena comenzó en 2023 como un proyecto de investigación en la Universidad de California, Berkeley, basado en recopilar las evaluaciones de los usuarios sobre modelos de inteligencia artificial. La plataforma permite a los usuarios introducir indicaciones o solicitar la creación de proyectos mediante programación declarativa, comparar los resultados y votar por el mejor modelo. La empresa afirma que su plataforma recibe decenas de millones de visitantes al mes.
En septiembre del año pasado, Arena lanzó su producto comercial AI Evaluations, que ofrece a laboratorios de inteligencia artificial y empresas análisis detallados del rendimiento basados en los comentarios de la comunidad. Esto ocurre en un momento en que las pruebas comparativas tradicionales afrontan una presión creciente, después de que algunos laboratorios comenzaran a descubrir que los modelos podían mejorar sus resultados en las pruebas sin que ello reflejara un rendimiento real en el uso práctico.
Una nueva clasificación de alineación
Arena añadió al panel de clasificación una nueva categoría denominada «alineación» (Alignment), para medir comportamientos que van más allá de la precisión tradicional. Los indicadores actuales incluyen la ejecución de acciones que el usuario no solicitó, la atribución de declaraciones o hechos a fuentes incorrectas y lo que la empresa denomina «finalización engañosa», es decir, que el modelo afirme haber completado una tarea que en realidad no ejecutó.
En el panel de alineación inicial, un grupo de modelos de OpenAI ocupó los primeros puestos, mientras que Claude Opus 5.5 quedó en sexto lugar y Claude Fable en noveno.
¿Por qué es importante este avance?
La expansión de Arena refleja un cambio de la pregunta «¿qué modelo obtiene la puntuación más alta en una prueba estática?» a una pregunta más vinculada al uso real: ¿cómo se comporta el modelo cuando interactúa con personas y organizaciones en tareas reales? Este enfoque puede proporcionar a las empresas datos adicionales al elegir un modelo para necesidades internas específicas, pero no elimina la necesidad de comprender la metodología de clasificación y los límites de las comparaciones entre modelos, especialmente porque los resultados de alineación mostrados todavía son preliminares, según el material fuente.
Arena afirma que la aceleración del desarrollo de la inteligencia artificial hace que la evaluación sea más lenta que los propios modelos, y que las pruebas estáticas pierden su capacidad de diferenciación cuando los modelos saben que están siendo evaluados. El desafío pendiente consiste en determinar hasta qué punto las evaluaciones basadas en la comunidad pueden ofrecer mediciones reproducibles y adecuadas para los distintos escenarios empresariales.