Künstliche Intelligenz

GitHub startet ReviewBench zur Messung der Leistung KI-gestützter Code-Review-Agenten

GitHub hat den offenen Benchmark ReviewBench zur Bewertung von Code-Review-Agenten veröffentlicht. Er basiert auf 219 Pull Requests aus 187 Repositories und 19 Programmiersprachen und umfasst Metriken, die zwischen der Erkennung bekannter und neuer Probleme unterscheiden. Nach Angaben des Unternehmens spiegelten die Offline-Ergebnisse die Richtung der Produktionstests für Copilot Code Review wider, wobei reale Nutzertests weiterhin der endgültige Maßstab bleiben.

2026-10-05
5 Min. Lesezeit
1 Aufrufe
certi.news Editorial Team
GitHub startet ReviewBench zur Messung der Leistung KI-gestützter Code-Review-Agenten

GitHub hat den offenen Benchmark ReviewBench zur Bewertung von Code-Review-Agenten veröffentlicht, um ein grundlegendes Problem KI-gestützter Review-Tools anzugehen: die Schwierigkeit, zu vergleichen, welche Fehler sie entdecken, welche sie übersehen und wie viel Rauschen sie erzeugen. Der Benchmark steht Forschern und Teams zur Verfügung, die Systeme für Code-Reviews entwickeln, und ermöglicht außerdem, ein eigenes System einzubinden und mit anderen Systemen zu vergleichen.

Ein Benchmark auf Grundlage realer Pull Requests

GitHub entwickelte die ReviewBench-Sammlung auf Grundlage einer Analyse der Verteilung von mehr als 103,9 Millionen Pull Requests auf der Plattform. Die Sammlung umfasst 219 Pull Requests aus 187 öffentlichen, permissiv lizenzierten Open-Source-Repositories und deckt 19 Programmiersprachen ab, wobei die Verteilung der Sprachen und die Repository-Größen an das allgemeine GitHub-Muster angepasst wurden. Die Größe der Änderungen wurde jedoch zugunsten mittelgroßer und großer, überprüfbarer Pull Requests neu gewichtet, statt sich übermäßig auf kleine Änderungen in einer einzigen Datei zu konzentrieren.

Die von GitHub als „Ground-Truth-Sammlung“ bezeichnete Grundlage stützt sich nicht auf eine einzige Quelle. Die potenziellen Ergebnisse wurden aus menschlichen Reviews, nachträglichen Änderungen der Autoren der Pull Requests, statischen Analysetools und mehreren fortschrittlichen Sprachmodellen zusammengetragen. Nach der Entfernung semantisch überlappender Ergebnisse wurden diese nach einem einheitlichen Kriterium bewertet, wonach ein korrektes Ergebnis richtig, relevant und nicht marginal sein muss. GitHub verwendet Claude Sonnet 5 als sprachlichen Bewerter und veröffentlicht das Bewertungsraster sowie die Bewertungseinstellungen, um die Nachprüfbarkeit und Reproduzierbarkeit zu verbessern.

Metriken, die die Entdeckung neuer Fehler nicht bestrafen

ReviewBench unterscheidet zwischen zwei Metrikfamilien. Die Metriken grounded precision, grounded recall und grounded F1 messen, wie gut ein System die bereits in der Ground-Truth-Sammlung vorhandenen Probleme erkennt, und ermöglichen so einen direkten Vergleich zwischen Systemen. Die Metriken augmented precision, augmented recall und augmented F1 untersuchen außerdem Ergebnisse, die keinem bekannten Problem entsprechen, und schreiben dem System Punkte gut, wenn der Bewerter bestätigt, dass es sich um ein korrektes Problem handelt.

Diese Unterscheidung ist wichtig, weil eine feste Fehlerliste nicht zwangsläufig vollständig sein kann; ein neuer Agent könnte ein Problem entdecken, das die Ersteller des Benchmarks nicht erfasst haben. GitHub verwendet grounded recall als wichtigste Kennzahl für den Vergleich zwischen Systemen, während die erweiterten Metriken eine zusätzliche Diagnose für jedes System liefern.

Anpassbare und überprüfbare Bewertung

Die Ergebnisse können nach der Schwere und Kategorie des Problems aufgeschlüsselt werden, etwa nach Korrektheit, Sicherheit, Zuverlässigkeit, Wartbarkeit und Tests. Der Fβ-Maßstab ermöglicht es außerdem, das Gewicht zwischen Recall und Präzision zu verändern, sodass der Nutzer eine breitere Abdeckung oder weniger, dafür präzisere Kommentare bevorzugen kann. Vor der Veröffentlichung markierten leitende Ingenieure, die nicht am Aufbau der Daten beteiligt waren, alle Ergebnisse erneut. Die Übereinstimmungsrate mit den ReviewBench-Urteilen betrug 96,6 %. GitHub zufolge werden die Versionen der Daten, des Bewerters und des bei jeder Bewertung verwendeten Matching-Tools festgehalten.

Was lässt sich in der Praxis nachweisen?

GitHub verwendete ReviewBench zur Bewertung aufeinanderfolgender Versionen von Copilot Code Review und erklärte, dass die Richtung der Verbesserung oder Verschlechterung in den Offline-Tests mit den Produktionstests übereinstimmte. In einem Experiment mit einem Review-System, das mehrere Durchläufe verschiedener Modelle kombinierte, sagte der Benchmark einen Anstieg von Präzision, Recall und Kommentaranzahl sowie einen Rückgang der Review-Kosten voraus. Auch der A/B-Test in der Produktion zeigte in dieselbe Richtung: Die Rate der Kommentare, die zu einer Änderung am Code führten, stieg um 8,0 %, der Recall um 13,6 % und das Kommentarvolumen um 61 %, während die Kosten pro Review gegenüber der Kontrollgruppe um 8,0 % sanken. Der Benchmark sagte außerdem einen Anstieg der kritischen Kommentare um 227 % voraus, gegenüber 262 % in der Produktion.

Die redaktionelle Einschätzung von certi.news: Der wichtigste Wert von ReviewBench liegt nicht in der Veröffentlichung eines neuen Tools, sondern in dem Versuch, die Bewertung von Code-Review-Agenten in einen vergleichbaren und überprüfbaren Prozess zu überführen, wobei anerkannt wird, dass „mehr Kommentare“ nicht zwangsläufig ein besseres Review bedeutet. Die Quelle selbst räumt jedoch ein, dass Produktionstests weiterhin der endgültige Maßstab für die Auswirkungen auf Nutzer sind. Außerdem lässt die teilweise Abhängigkeit der Bewertung von einem sprachlichen Bewerter die Frage nach den Grenzen der Konsistenz automatisierter Urteile offen.

GitHub stellt eine erste Forschungsversion des Benchmarks bereit, einschließlich Daten, Methodik, Bewertereinstellungen und eines Tools zur eigenständigen Ausführung. Agenten können zunächst anhand einer Sammlung von 25 Pull Requests getestet werden. Anschließend kann die vollständige Bewertung über 219 Pull Requests in drei Durchläufen ausgeführt werden, bevor die Veröffentlichung des Ergebnisses auf der Bestenliste beantragt wird.

Nachrichtenquelle
c
Autor

certi.news Editorial Team

Aus derselben Kategorie

Das könnte Sie interessieren

Alle Nachrichten anzeigen