Suivez les dernières actualités, explications et histoires technologiques associées.
GitHub a lancé le benchmark ouvert ReviewBench pour évaluer les agents de revue de code à partir de 219 demandes de fusion issues de 187 dépôts et couvrant 19 langages de programmation, avec des métriques distinguant la détection de problèmes connus et nouveaux. L’entreprise affirme que ses résultats hors ligne reflètent les tendances observées dans les expériences de production de Copilot Code Review, tout en soulignant que les tests réels auprès des utilisateurs restent le critère final d’évaluation.