شركة طورت إطاراً مشتركاً لتقييم وكلاء الذكاء الاصطناعي المستخدمين في الأمن السيبراني وروبوتات المحادثة المؤسسية.
تشرح Susan Chang من Elastic كيف انتقلت الفرق من تقييمات متفرقة لوكلاء الذكاء الاصطناعي إلى إطار موحد يجمع بين التقييم البرمجي وLLM-as-a-judge والتتبع العميق. وتوضح التجربة أن الأتمتة لا تلغي الحاجة إلى خبراء المجال، خصوصاً عند بناء بيانات الاختبار ومعايرة المقاييس.