Yapay zekâ modellerini sıralayan popüler LMArena platformunun arkasındaki şirket Arena, 3,1 milyar dolar değerlemeyle 200 milyon dolarlık Seri B yatırım turu gerçekleştirdiğini 8 Ekim 2026'da açıkladı. Tura Lightspeed Venture Partners ve Khosla Ventures liderlik etti; Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z, Felicis ve diğer yatırımcılar da katıldı.
Yeni değerleme, yaklaşık on ay içinde neredeyse iki katına çıkış anlamına geliyor. Arena, ocak ayında Seri A turunda, para sonrası 1,7 milyar dolar değerlemeyle 150 milyon dolar topladığını açıklamıştı. Şirket ayrıca haziran ayında, ocak turunun duyurulduğu dönemdeki 30 milyon dolara kıyasla yıllıklandırılmış 100 milyon dolar gelir seviyesine ulaştığını söylemişti.
Kitlesel oylamadan ticari hizmete
Arena, 2023 yılında Berkeley'deki Kaliforniya Üniversitesi'nde, yapay zekâ modelleri hakkında kullanıcı değerlendirmeleri toplamaya dayanan bir araştırma projesi olarak başladı. Platform, kullanıcıların istemler girmesine veya programlama yoluyla projeler oluşturma talebinde bulunmasına, ardından sonuçları karşılaştırıp en iyi modele oy vermesine olanak tanıyor. Şirket, platformunun aylık on milyonlarca ziyaretçi aldığını belirtiyor.
Arena, geçen yıl eylül ayında yapay zekâ laboratuvarlarına ve şirketlere topluluk geri bildirimlerine dayalı ayrıntılı performans analizleri sunan ticari ürünü AI Evaluations'ı piyasaya sürdü. Bu gelişme, bazı laboratuvarların modellerin pratik kullanımdaki gerçek performansı yansıtmadan test sonuçlarını iyileştirebildiğini keşfetmeye başlamasının ardından, geleneksel kıyaslama testlerinin giderek artan baskıyla karşı karşıya kaldığı bir dönemde yaşandı.
Yeni uyum sıralaması
Arena, geleneksel doğruluğun ötesindeki davranışları ölçmek için liderlik tablosuna «Uyum» (Alignment) adlı yeni bir kategori ekledi. Mevcut göstergeler arasında kullanıcının istemediği eylemleri gerçekleştirme, ifadeleri veya gerçekleri yanlış kaynaklara atfetme ve şirketin «aldatıcı tamamlama» olarak adlandırdığı, modelin gerçekte gerçekleştirmediği bir görevi tamamladığını iddia etmesi yer alıyor.
İlk uyum tablosunda OpenAI modellerinden oluşan bir grup ilk sıralarda yer alırken Claude Opus 5.5 altıncı, Claude Fable ise dokuzuncu sırada yer aldı.
Bu gelişme neden önemli?
Arena'nın genişlemesi, «Sabit bir testte hangi model en yüksek sonucu elde ediyor?» sorusundan, gerçek kullanımla daha bağlantılı bir soruya geçişi yansıtıyor: Model, insanlar ve kurumlarla gerçek görevlerde etkileşime girdiğinde nasıl davranıyor? Bu yaklaşım, şirketlere belirli iç ihtiyaçları için model seçerken ek veriler sağlayabilir; ancak özellikle sunulan uyum sonuçlarının kaynak metne göre hâlâ başlangıç niteliğinde olması nedeniyle, sıralama metodolojisinin ve modeller arasındaki karşılaştırmaların sınırlarının anlaşılması gerekliliğini ortadan kaldırmıyor.
Arena, yapay zekânın gelişiminin hızlanmasının değerlendirmeyi modellerin kendisinden daha yavaş hâle getirdiğini ve modeller test edildiklerini anladığında sabit testlerin ayırt etme kabiliyetini kaybettiğini söylüyor. Açık soru ise topluluk temelli değerlendirmelerin tekrarlanabilir ve farklı kurumsal senaryolara uygun ölçümler sunma kapasitesinin ne ölçüde olduğuyla ilgili.