Die Ergebnisse einer neuen stratifizierten Bewertung von Modellen zur Weizenkopferkennung zeigen, dass die Rangfolge der Modelle nach der durchschnittlichen Gesamtleistung kein vollständiges Bild ihrer Zuverlässigkeit im Feldeinsatz liefert. Neun Modelle, die auf dem Global Wheat Head Dataset 2021 (GWHD) trainiert worden waren, wurden erneut nach Ländern getestet. Die Ergebnisse zeigten deutliche Leistungsunterschiede zwischen geografischen Domänen, selbst wenn die Gesamtwerte ähnlich waren.
Die Analyse, die der Nutzer Saumya Saksena unter dem Namen dronefreak am 11. August 2026 im Hugging-Face-Blog veröffentlichte, ist eine Fortsetzung einer früheren Open-Source-Veröffentlichung, die neun Objekterkennungsmodelle umfasste: YOLOv8, YOLOv11, YOLOv26 und RF-DETR in Versionen von nano bis x-large. Die Modelle wurden mit GWHD 2021 trainiert und feinabgestimmt. Dabei handelt es sich um einen Datensatz, der aus Feldbildern von Weizenköpfen erstellt wurde, die in sechs Ländern und von 18 Forschungseinrichtungen gesammelt wurden, um die genetischen Muster, Wachstumsstadien und Aufnahmebedingungen zu diversifizieren.
Separate Prüfung für jedes Land
Die Analyse basierte auf einem eigens erstellten Manifest für jedes Bild, das die Bilder des Testdatensatzes mit dem jeweiligen Land und Wachstumsstadium verknüpft. Der Autor erklärte, dass diese Verknüpfung nicht Bestandteil der ursprünglichen GWHD-Veröffentlichung war, sondern für diese Analyse anhand domänenspezifischer Metadaten erstellt wurde. Außerdem wurde dieselbe Bewertungs-Engine erneut ausgeführt, die auch für die Gesamtergebnisse verwendet worden war: model.val() von Ultralytics für die YOLO-Familie und MeanAveragePrecision aus der Bibliothek supervision für RF-DETR-Modelle.
Von den 1.382 Bildern im Testdatensatz konnte das Land eines einzigen Bildes aufgrund eines Problems mit einem doppelten Dateinamen in den Quelldaten nicht bestimmt werden. Das Bild wurde daher ausgeschlossen, statt ihm schätzungsweise ein Land zuzuweisen. Die Vergleiche basierten auf 1.381 Bildern, verteilt auf die Vereinigten Staaten mit 605 Bildern, Australien mit 281, Mexiko mit 205, China mit 200, Japan mit 60 und Sudan mit 30 Bildern.
China erzielt bei allen Modellen die besten Ergebnisse
China erzielte bei allen neun Modellen ohne Ausnahme das höchste Ergebnis bei mAP@50. Die Werte reichten dort von 79,78 % für RF-DETR Nano bis 92,36 % für YOLOv11x. Die Analyse führt dies darauf zurück, dass die chinesische Domäne zu den größeren und visuell konsistenteren Domänen des Datensatzes gehört, da sie zwei Einrichtungen und 200 Bilder umfasst. Die Homogenität innerhalb der Domäne kann die Bewertung dort unabhängig davon erleichtern, welche Informationen das Modell aus den übrigen Ländern gelernt hat.
In der vorherigen Gesamtbewertung lag YOLOv11x mit 74,25 % bei mAP@50 und 34,92 % bei mAP@50:95 sowie einer Präzision von 83,37 % vorn. YOLOv26s bot den besten Kompromiss zwischen Effizienz und Leistung und erreichte 70,49 % bei mAP@50 mit 22,8 GFLOPs und 10 Millionen Parametern. Damit lag es weniger als vier Punkte hinter dem Spitzenmodell und benötigte etwa 8,6-mal weniger Operationen als YOLOv11x mit 196,0 GFLOPs.
Die Schwachstellen unterscheiden sich zwischen den Modellfamilien
Der Vergleich zeigte, dass vier der sechs YOLO-Versionen – YOLOv26s, YOLOv8m, YOLOv8s und YOLOv8n – auf der US-amerikanischen Bildgruppe am schwächsten waren. Die Vereinigten Staaten stellen 43,8 % der Testbilder. Das bedeutet, dass der Gesamtwert dieser Modelle stark von ihrer Leistung in der Region beeinflusst wird, in der sie schlechter abschneiden, und nicht unbedingt von der Leistung in einem typischen Land.
YOLOv11x bildete eine Ausnahme und erzielte seine schwächste Leistung in Australien, während YOLOv26m in Japan am schwächsten war. Auf der anderen Seite war Australien für alle drei RF-DETR-Versionen die schwächste Domäne. Die Unterschiede zwischen dem besten und dem schlechtesten Land reichten den in der Analyse angegebenen Werten zufolge von 22,79 Punkten bei YOLOv26m bis 44,38 Punkten bei RF-DETR Nano.
Die Rohgenauigkeit entspricht nicht der Robustheit über Domänen hinweg
YOLOv26m wies mit 22,8 Punkten den kleinsten Länderunterschied auf: von 88,99 % in China bis 66,21 % in Japan, obwohl es nicht das höchste Gesamtergebnis erzielte. YOLOv11x lag mit einem Unterschied von 23,1 Punkten nahe daran. Dies deutet im Vergleich zu den übrigen Modellen auf eine bessere Konsistenz über die Domänen hinweg hin.
RF-DETR Nano erzielte dagegen mit 44,4 Punkten den größten Unterschied und fiel von 79,8 % in China auf 35,4 % in Australien. Dieser Unterschied ist größer als die Spannweite zwischen den Modellen selbst in China, wo die Ergebnisse zwischen 79,8 % und 92,4 % lagen. Bei diesem speziellen Modell kann die Quelle der Einsatzbilder das Ergebnis stärker beeinflussen als die Wahl eines anderen Modells aus der Gruppe.
Das Beispiel von YOLOv26s und YOLOv8m verdeutlicht die Bedeutung dieser Messung: Ihre Gesamtergebnisse lagen mit 70,49 % beziehungsweise 69,55 % bei mAP@50 nahe beieinander, mit einem Unterschied von weniger als einem Punkt. Der Unterschied zwischen dem besten und dem schlechtesten Land variierte jedoch um mehr als drei Punkte: Er betrug beim ersten Modell 25,3 Punkte und beim zweiten 28,6 Punkte. Der Analyse zufolge kann eine einzige Zeile mit Ergebnissen der Gesamtbewertung diesen Unterschied in der Zuverlässigkeit nicht sichtbar machen.
Grenzen des Vergleichs und nächster Schritt
Der Autor warnt davor, die Ergebnisse von Sudan und Japan mit derselben Sicherheit zu interpretieren wie diejenigen der Vereinigten Staaten oder Australiens, da ihre Gruppen klein sind und eine Handvoll leichter oder schwieriger Bilder den mAP stärker beeinflussen kann. Außerdem erfolgt die derzeitige Bewertung auf Länderebene und nicht auf Ebene der genetischen Muster. Das verwendete Manifest enthält das Land, die Einrichtung und das Wachstumsstadium, jedoch keine Bezeichnungen der genetischen Muster.
Der nächste Schritt umfasst eine nach Wachstumsstadium aufgeteilte Bewertung, nachdem eine unterschiedliche Schreibweise einer der Bezeichnungen zwischen „Post-flowering“ und „Post-Flowering“ vereinheitlicht wurde. Es wird davon ausgegangen, dass der Unterschied lediglich formaler Natur ist und mit der Groß- und Kleinschreibung zusammenhängt. Die Modellkarten enthalten nun einen Abschnitt zur Leistung nach Ländern sowie die Dateien country_breakdown.json und domain_metadata.json im Datensatz-Repository. Der Autor betonte, dass die Veröffentlichung und die Analyse eine unabhängige, nicht offizielle Bewertung darstellen, die auf der Arbeit der ursprünglichen Autoren des Datensatzes basiert.