إطار لتصنيف تكتيكات الهجمات استُخدم ضمن اختبارات وكيل اكتشاف الهجمات.
تشرح Susan Chang من Elastic كيف انتقلت الفرق من تقييمات متفرقة لوكلاء الذكاء الاصطناعي إلى إطار موحد يجمع بين التقييم البرمجي وLLM-as-a-judge والتتبع العميق. وتوضح التجربة أن الأتمتة لا تلغي الحاجة إلى خبراء المجال، خصوصاً عند بناء بيانات الاختبار ومعايرة المقاييس.