Start-ups

Arena, Plattform zur Bewertung von KI-Modellen, sammelt 200 Millionen US-Dollar bei einer Bewertung von 3,1 Milliarden US-Dollar ein

Arena, das Unternehmen hinter der Plattform LMArena zur Einstufung von KI-Modellen durch Nutzerabstimmungen, hat in einer Serie-B-Finanzierungsrunde 200 Millionen US-Dollar eingesammelt und dadurch seine Bewertung auf 3,1 Milliarden US-Dollar erhöht. Das Unternehmen erweitert seine Rankings um Alignment-Indikatoren wie die Ausführung nicht autorisierter Aktionen, die falsche Zuordnung von Informationen zu Quellen und die fälschliche Behauptung, Aufgaben abgeschlossen zu haben.

2026-10-08
3 Min. Lesezeit
2 Aufrufe
certi.news Editorial Team
Arena, Plattform zur Bewertung von KI-Modellen, sammelt 200 Millionen US-Dollar bei einer Bewertung von 3,1 Milliarden US-Dollar ein

Arena, das Unternehmen hinter der bekannten Plattform LMArena zur Einstufung von KI-Modellen, hat in einer Serie-B-Finanzierungsrunde 200 Millionen US-Dollar bei einer Bewertung von 3,1 Milliarden US-Dollar eingesammelt, wie das Unternehmen am 8. Oktober 2026 bekannt gab. Die Runde wurde von Lightspeed Venture Partners und Khosla Ventures angeführt. Beteiligt waren Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z, Felicis und weitere Investoren.

Die neue Bewertung entspricht einer nahezu Verdopplung innerhalb von rund zehn Monaten. Im Januar hatte Arena bekannt gegeben, 150 Millionen US-Dollar in einer Serie-A-Runde bei einer Post-Money-Bewertung von 1,7 Milliarden US-Dollar eingesammelt zu haben. Außerdem erklärte das Unternehmen im Juni, einen annualisierten Umsatz von 100 Millionen US-Dollar erreicht zu haben, verglichen mit 30 Millionen US-Dollar bei der Bekanntgabe der Januar-Runde.

Von der Abstimmung durch die Öffentlichkeit zum kommerziellen Dienst

Arena startete 2023 als Forschungsprojekt an der University of California, Berkeley, das auf der Sammlung von Nutzerbewertungen für KI-Modelle beruhte. Die Plattform ermöglicht es Nutzern, Prompts einzugeben oder mithilfe von Vibe Coding die Erstellung von Projekten anzufordern, anschließend die Ergebnisse zu vergleichen und für das bessere Modell abzustimmen. Das Unternehmen gibt an, dass seine Plattform monatlich mehrere zehn Millionen Besucher empfängt.

Im September des vergangenen Jahres brachte Arena sein kommerzielles Produkt AI Evaluations auf den Markt. Es bietet KI-Laboren und Unternehmen detaillierte, auf Community-Feedback basierende Leistungsanalysen. Dies geschieht zu einem Zeitpunkt, an dem herkömmliche Benchmark-Tests zunehmend unter Druck geraten, nachdem einige Labore feststellten, dass Modelle ihre Testergebnisse verbessern können, ohne dass dies eine tatsächliche Leistungssteigerung im praktischen Einsatz widerspiegelt.

Neues Alignment-Ranking

Arena hat seiner Rangliste eine neue Kategorie namens „Alignment“ hinzugefügt, um Verhaltensweisen zu messen, die über die herkömmliche Genauigkeit hinausgehen. Zu den aktuellen Indikatoren gehören die Ausführung von Aktionen, die der Nutzer nicht angefordert hat, die Zuordnung von Aussagen oder Fakten zu falschen Quellen sowie das, was das Unternehmen als „täuschende Erledigung“ bezeichnet – also die Behauptung des Modells, eine Aufgabe abgeschlossen zu haben, obwohl es sie tatsächlich nicht ausgeführt hat.

In der ersten Alignment-Rangliste belegte eine Gruppe von OpenAI-Modellen die vorderen Plätze, während Claude Opus 5.5 den sechsten und Claude Fable den neunten Platz erreichte.

Warum ist diese Entwicklung wichtig?

Die Erweiterung von Arena spiegelt einen Wandel von der Frage „Welches Modell erzielt in einem festen Test das höchste Ergebnis?“ hin zu einer stärker an der tatsächlichen Nutzung orientierten Frage wider: Wie verhält sich das Modell, wenn Menschen und Organisationen in realen Aufgaben mit ihm interagieren? Dieser Ansatz könnte Unternehmen zusätzliche Daten bei der Auswahl eines Modells für bestimmte interne Anforderungen liefern. Er beseitigt jedoch nicht die Notwendigkeit, die Methodik der Einstufung und die Grenzen von Vergleichen zwischen Modellen zu verstehen, insbesondere da die dargestellten Alignment-Ergebnisse laut Ausgangsmaterial noch vorläufig sind.

Arena erklärt, dass die beschleunigte Entwicklung der KI dazu führt, dass die Bewertung langsamer voranschreitet als die Modelle selbst und dass statische Tests ihre Fähigkeit zur Differenzierung verlieren, sobald Modelle erkennen, dass sie getestet werden. Die offene Herausforderung besteht darin, inwieweit gemeinschaftsbasierte Bewertungen wiederholbare Messungen liefern können, die für die unterschiedlichen Szenarien von Unternehmen geeignet sind.

Nachrichtenquelle
c
Autor

certi.news Editorial Team

Aus derselben Kategorie

Das könnte Sie interessieren

Alle Nachrichten anzeigen