مقياس يقيس قدرة النظام على اكتشاف المشكلات الموجودة مسبقاً في مجموعة الحقيقة، واستخدمته GitHub مؤشراً رئيسياً للمقارنة.
أطلقت GitHub معيار ReviewBench المفتوح لتقييم وكلاء مراجعة الشيفرة اعتماداً على 219 طلب دمج من 187 مستودعاً و19 لغة برمجة، مع مقاييس تميّز بين اكتشاف المشكلات المعروفة والجديدة. وتقول الشركة إن نتائجه غير المتصلة بالإنترنت عكست اتجاه تجارب الإنتاج على Copilot Code Review، مع بقاء الاختبارات الفعلية للمستخدمين معيار الحكم النهائي.