عالمة بيانات رئيسية في Elastic شرحت تجربة الشركة في بناء إطار موحد لتقييم الوكلاء.
تشرح Susan Chang من Elastic كيف انتقلت الفرق من تقييمات متفرقة لوكلاء الذكاء الاصطناعي إلى إطار موحد يجمع بين التقييم البرمجي وLLM-as-a-judge والتتبع العميق. وتوضح التجربة أن الأتمتة لا تلغي الحاجة إلى خبراء المجال، خصوصاً عند بناء بيانات الاختبار ومعايرة المقاييس.