Startups

Plataforma Arena para avaliar modelos de inteligência artificial arrecada US$ 200 milhões com avaliação de US$ 3,1 bilhões

A Arena, desenvolvedora da plataforma LMArena para classificar modelos de inteligência artificial por meio de votos dos usuários, levantou US$ 200 milhões em uma rodada de financiamento da Série B, elevando sua avaliação para US$ 3,1 bilhões. A empresa está ampliando suas classificações para incluir indicadores de alinhamento, como executar ações não autorizadas, atribuir informações a fontes erradas e alegar falsamente a conclusão de tarefas.

2026-10-08
4 min de leitura
12 visualizações
certi.news Editorial Team
Plataforma Arena para avaliar modelos de inteligência artificial arrecada US$ 200 milhões com avaliação de US$ 3,1 bilhões

A Arena, empresa responsável pela popular plataforma LMArena de classificação de modelos de inteligência artificial, levantou US$ 200 milhões em uma rodada de financiamento da Série B, com avaliação de US$ 3,1 bilhões, segundo anunciou a empresa em 8 de outubro de 2026. A rodada foi liderada pela Lightspeed Venture Partners e pela Khosla Ventures, com participação da Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z, Felicis e outros investidores.

A nova avaliação representa um aumento de quase o dobro em cerca de dez meses. Em janeiro, a Arena anunciou a captação de US$ 150 milhões em uma rodada da Série A, com avaliação pós-investimento de US$ 1,7 bilhão. A empresa também afirmou, em junho, que havia alcançado uma receita anualizada de US$ 100 milhões, ante US$ 30 milhões quando anunciou a rodada de janeiro.

Da votação do público a um serviço comercial

A Arena começou em 2023 como um projeto de pesquisa na Universidade da Califórnia, Berkeley, baseado na coleta de avaliações de usuários sobre modelos de inteligência artificial. A plataforma permite que os usuários insiram prompts ou solicitem a criação de projetos usando programação declarativa e, em seguida, comparem os resultados e votem no melhor modelo. A empresa afirma que sua plataforma recebe dezenas de milhões de visitantes por mês.

Em setembro do ano passado, a Arena lançou seu produto comercial AI Evaluations, que oferece a laboratórios de inteligência artificial e empresas análises detalhadas de desempenho baseadas no feedback da comunidade. Isso ocorre em um momento em que os testes de referência tradicionais enfrentam pressão crescente, depois que alguns laboratórios começaram a descobrir que os modelos podem melhorar seus resultados nos testes sem que isso reflita um desempenho real no uso prático.

Nova classificação de alinhamento

A Arena adicionou ao ranking uma nova categoria chamada «alinhamento» (Alignment), para medir comportamentos que vão além da precisão tradicional. Os indicadores atuais incluem executar ações que o usuário não solicitou, atribuir declarações ou fatos a fontes erradas e o que a empresa chama de «conclusão enganosa», isto é, o modelo afirmar que concluiu uma tarefa que, na realidade, não executou.

No ranking inicial de alinhamento, um grupo de modelos da OpenAI ocupou as primeiras posições, enquanto o Claude Opus 5.5 ficou em sexto lugar e o Claude Fable em nono.

Por que esse desenvolvimento é importante?

A expansão da Arena reflete uma mudança da pergunta «qual modelo alcança a maior pontuação em um teste estático?» para uma questão mais ligada ao uso real: como o modelo se comporta quando interage com pessoas e organizações em tarefas reais? Essa abordagem pode fornecer às empresas dados adicionais ao escolher um modelo para necessidades internas específicas, mas não elimina a necessidade de compreender a metodologia de classificação e os limites das comparações entre modelos, especialmente porque os resultados de alinhamento apresentados ainda são preliminares, de acordo com o material de origem.

A Arena afirma que a aceleração do desenvolvimento da inteligência artificial está tornando a avaliação mais lenta do que os próprios modelos e que os testes estáticos perdem sua capacidade de diferenciação quando os modelos percebem que estão sendo testados. O desafio em aberto é determinar até que ponto as avaliações baseadas na comunidade podem oferecer medições reproduzíveis e adequadas aos diferentes cenários das empresas.

Fonte da notícia
TechCrunch AI
Abrir fonte original ↗
c
Autor

certi.news Editorial Team

Explore esta história

Tópicos e entidades relacionados

Na mesma categoria

Você também pode gostar

Ver todas as notícias