نهج يستخدم نموذجاً لغوياً لتقييم مخرجات نموذج لغوي آخر، خاصة في المهام المفتوحة أو الغامضة.
تشرح Susan Chang من Elastic كيف انتقلت الفرق من تقييمات متفرقة لوكلاء الذكاء الاصطناعي إلى إطار موحد يجمع بين التقييم البرمجي وLLM-as-a-judge والتتبع العميق. وتوضح التجربة أن الأتمتة لا تلغي الحاجة إلى خبراء المجال، خصوصاً عند بناء بيانات الاختبار ومعايرة المقاييس.