جمعت Arena، الشركة التي تقف وراء منصة LMArena الشهيرة لتصنيف نماذج الذكاء الاصطناعي، 200 مليون دولار في جولة تمويل من الفئة B بتقييم بلغ 3.1 مليار دولار، وفق ما أعلنته الشركة في 8 أكتوبر 2026. قادت الجولة Lightspeed Venture Partners وKhosla Ventures، بمشاركة Salesforce Ventures و01 Advisors وDell Technologies Capital وEndeavor Catalyst وa16z وFelicis ومستثمرين آخرين.
يمثل التقييم الجديد زيادة تقارب الضعف خلال نحو عشرة أشهر. ففي يناير، أعلنت Arena جمع 150 مليون دولار في جولة الفئة A عند تقييم لاحق للمال قدره 1.7 مليار دولار. كما قالت الشركة في يونيو إنها وصلت إلى إيرادات سنوية بمعدل تشغيل قدره 100 مليون دولار، مقارنة بـ30 مليون دولار عند إعلان جولة يناير.
من التصويت الجماهيري إلى خدمة تجارية
بدأت Arena في عام 2023 كمشروع بحثي في جامعة كاليفورنيا، بيركلي، يعتمد على جمع تقييمات المستخدمين لنماذج الذكاء الاصطناعي. وتتيح المنصة للمستخدمين إدخال المطالبات أو طلب إنشاء مشاريع باستخدام البرمجة الوصفية، ثم مقارنة النتائج والتصويت للنموذج الأفضل. وتقول الشركة إن منصتها تستقبل عشرات الملايين من الزوار شهرياً.
وفي سبتمبر من العام الماضي، أطلقت Arena منتجها التجاري AI Evaluations، الذي يقدم لمختبرات الذكاء الاصطناعي والشركات تحليلات تفصيلية للأداء تستند إلى ملاحظات المجتمع. ويأتي ذلك في وقت تواجه فيه الاختبارات المعيارية التقليدية ضغوطاً متزايدة، بعدما بدأت بعض المختبرات تكتشف أن النماذج قد تحسن نتائجها في الاختبارات من دون أن يعكس ذلك أداءً حقيقياً في الاستخدام العملي.
تصنيف جديد للمواءمة
أضافت Arena إلى لوحة الصدارة فئة جديدة باسم «المواءمة» (Alignment)، لقياس سلوكيات تتجاوز الدقة التقليدية. وتشمل المؤشرات الحالية تنفيذ إجراءات لم يطلبها المستخدم، ونسب تصريحات أو حقائق إلى مصادر خاطئة، وما تسميه الشركة «الإكمال الخادع»، أي ادعاء النموذج أنه أتم مهمة لم ينفذها فعلياً.
في لوحة المواءمة الأولية، احتلت مجموعة من نماذج OpenAI المراكز الأولى، بينما جاء Claude Opus 5.5 في المركز السادس وClaude Fable في المركز التاسع.
لماذا يهم هذا التطور؟
يعكس توسع Arena تحولاً من سؤال «أي نموذج يحقق أعلى نتيجة في اختبار ثابت؟» إلى سؤال أكثر ارتباطاً بالاستخدام الفعلي: كيف يتصرف النموذج عندما يتفاعل معه أشخاص ومؤسسات في مهام حقيقية؟ هذه المقاربة قد تمنح الشركات بيانات إضافية عند اختيار نموذج لاحتياجات داخلية محددة، لكنها لا تلغي الحاجة إلى فهم منهجية التصنيف وحدود المقارنات بين النماذج، خصوصاً أن نتائج المواءمة المعروضة ما تزال أولية بحسب المادة المصدرية.
وتقول Arena إن تسارع تطور الذكاء الاصطناعي يجعل التقييم أبطأ من النماذج نفسها، وإن الاختبارات الثابتة تفقد قدرتها على التمييز عندما تدرك النماذج أنها قيد الاختبار. أما التحدي المفتوح فيتمثل في مدى قدرة التقييمات القائمة على المجتمع على تقديم قياسات قابلة للتكرار وملائمة لسيناريوهات المؤسسات المختلفة.
كيف أعددنا هذا الخبر؟
اعتمد الخبر على المصدر الأصلي الموضح أعلاه. قد نستخدم أدوات آلية للمساعدة في الاستخراج والتصنيف والصياغة،
لكن النشر يخضع لقواعد تمنع المحتوى المكرر والقصير أو الروتيني منخفض القيمة.
اقرأ سياستنا التحريرية.