نموذج لغوي استخدمته GitHub مقيّماً لغوياً في عمليات تقييم ReviewBench.
أطلقت GitHub معيار ReviewBench المفتوح لتقييم وكلاء مراجعة الشيفرة اعتماداً على 219 طلب دمج من 187 مستودعاً و19 لغة برمجة، مع مقاييس تميّز بين اكتشاف المشكلات المعروفة والجديدة. وتقول الشركة إن نتائجه غير المتصلة بالإنترنت عكست اتجاه تجارب الإنتاج على Copilot Code Review، مع بقاء الاختبارات الفعلية للمستخدمين معيار الحكم النهائي.