تستخلص GitHub من تجربة تقييم نظام يعتمد على نموذج لغوي لتقليل الإنذارات الكاذبة في فحص الأسرار مجموعة ممارسات لتقييم أنظمة LLM قبل الإنتاج. وتشدد التجربة على ربط المقاييس بقرار المنتج، ومحاكاة بيئة التشغيل الفعلية، وتحليل الأخطاء، مع اعتبار التقييم غير المتصل دليلاً منظماً لا ضماناً للسلوك في كل حالات الإنتاج.