أداة استخدمتها Elastic ضمن أدوات التقييم بعد نقل بعضها من Python إلى TypeScript.
تشرح Susan Chang من Elastic كيف انتقلت الفرق من تقييمات متفرقة لوكلاء الذكاء الاصطناعي إلى إطار موحد يجمع بين التقييم البرمجي وLLM-as-a-judge والتتبع العميق. وتوضح التجربة أن الأتمتة لا تلغي الحاجة إلى خبراء المجال، خصوصاً عند بناء بيانات الاختبار ومعايرة المقاييس.