Buğday başaklarını tespit etmeye yönelik modellere ilişkin yeni bir katmanlı değerlendirme, modelleri genel ortalama performansa göre sıralamanın sahadaki kullanımları açısından güvenilirliklerinin tamamını ortaya koymadığını gösteriyor. Global Wheat Head Dataset 2021 (GWHD) üzerinde eğitilen dokuz model ülkeye göre yeniden test edildi ve genel puanlar birbirine yakın olduğunda bile coğrafi alanlar arasında belirgin performans farklılıkları görüldü.
Hugging Face blogunda dronefreak adıyla kullanıcı Saumya Saksena tarafından 11 Ağustos 2026'da yayımlanan analiz, dokuz nesne tespit modelini kapsayan önceki açık kaynaklı sürümün devamı niteliğinde: nano'dan x-large'a kadar sürümleri bulunan YOLOv8, YOLOv11, YOLOv26 ve RF-DETR. Modeller, genetik çeşitliliği, büyüme aşamalarını ve görüntüleme koşullarını çeşitlendirmek amacıyla altı ülkede ve 18 araştırma kuruluşunda toplanan buğday başaklarının arazi görüntülerinden oluşturulan GWHD 2021 kullanılarak eğitildi ve ayarlandı.
Her ülke için ayrı test
Analiz, test kümesindeki görüntüleri ülke ve büyüme aşamasıyla ilişkilendiren, her görüntü için hazırlanmış bir manifestoya dayanıyordu. Yazar, bu eşleştirmenin GWHD'nin orijinal sürümünün parçası olmadığını; alanlara ilişkin meta verilerden bu analiz için oluşturulduğunu açıkladı. Genel sonuçlarda kullanılan aynı değerlendirme motoru da yeniden çalıştırıldı: YOLO ailesi için Ultralytics'in model.val() işlevi, RF-DETR modelleri için ise supervision kütüphanesinin MeanAveragePrecision bileşeni.
Test kümesindeki 1.382 görüntünün birinin ülkesi, kaynak verilerdeki yinelenen dosya adı sorunu nedeniyle belirlenemedi; bu nedenle görüntü varsayımsal olarak atanmak yerine dışarıda bırakıldı. Karşılaştırmalar 1.381 görüntüye dayanıyordu: Amerika Birleşik Devletleri'nden 605, Avustralya'dan 281, Meksika'dan 205, Çin'den 200, Japonya'dan 60 ve Sudan'dan 30 görüntü.
Çin tüm modellerin performansında başı çekiyor
Çin, istisnasız dokuz modelin tamamında mAP@50 açısından en yüksek sonucu elde etti; sonuçlar RF-DETR Nano için %79,78 ile YOLOv11x için %92,36 arasında değişti. Analiz, bunu Çin alanının veri kümesindeki daha büyük ve görsel açıdan daha tutarlı alanlardan biri olmasıyla ilişkilendiriyor; bu alanda iki kuruluş ve 200 görüntü bulunuyor. Alan içindeki homojenlik, modelin diğer ülkelerden öğrendiği bilgilerden bağımsız olarak, bu alan üzerindeki değerlendirmeyi kolaylaştırabilir.
Önceki genel değerlendirmede YOLOv11x, mAP@50'de %74,25 ve mAP@50:95'te %34,92 sonuçlarıyla lider oldu; doğruluğu ise %83,37 idi. YOLOv26s, verimlilik ve performans arasında en iyi dengeyi sundu; 22,8 GFLOPs ve 10 milyon parametreyle mAP@50'de %70,49 elde etti. Bu değer, en yüksek sonucu alan modelden dört puandan daha az düşük olup, 196,0 GFLOPs kullanan YOLOv11x'e kıyasla yaklaşık 8,6 kat daha az işlem gerektiriyordu.
Zayıf bölgeler model aileleri arasında farklılık gösteriyor
Karşılaştırma, altı YOLO sürümünün dördünün —YOLOv26s, YOLOv8m, YOLOv8s ve YOLOv8n— ABD görüntü kümesinde en zayıf olduğunu gösterdi. Amerika Birleşik Devletleri test görüntülerinin %43,8'ini oluşturuyor. Bu da bu modellerin genel puanının, mutlaka tipik bir ülkenin performansından değil, en kötü başa çıktıkları bölgedeki performanstan büyük ölçüde etkilendiği anlamına geliyor.
YOLOv11x bir istisnaydı; en zayıf performansını Avustralya'da gösterirken YOLOv26m'nin en zayıf performansı Japonya'daydı. Buna karşılık Avustralya, RF-DETR'nin üç sürümünün tamamı için zayıf bölgeydi. Analizde verilen değerlere göre en iyi ve en kötü ülke arasındaki farklar YOLOv26m için 22,79 puandan RF-DETR Nano için 44,38 puana kadar değişti.
Ham doğruluk, alanlar arası sağlamlıkla aynı değildir
YOLOv26m, ülkeler arasındaki en dar farkı, 22,8 puanı kaydetti: Çin'de %88,99'dan Japonya'da %66,21'e. Genel toplamda en yüksek sonuca sahip olmamasına rağmen bu farkı elde etti. YOLOv11x de 23,1 puanlık farkla ona yakındı; bu, diğer modellere kıyasla alanlar arasında daha iyi tutarlılığa işaret ediyor.
Buna karşılık RF-DETR Nano, Çin'de %79,8'den Avustralya'da %35,4'e gerileyerek 44,4 puanlık en geniş farkı oluşturdu. Bu fark, Çin'deki modellerin kendi aralarındaki değişim aralığından daha büyüktü; Çin'de sonuçlar %79,8 ile %92,4 arasında değişti. Özellikle bu model için dağıtım görüntülerinin kaynağı, sonuç üzerinde gruptan başka bir model seçilmesinden daha etkili olabilir.
YOLOv26s ile YOLOv8m arasındaki örnek, bu ölçümün önemini gösteriyor: mAP@50'de %70,49 ve %69,55 olan genel sonuçları birbirine yakındı; fark bir puandan azdı. Ancak en iyi ve en kötü ülke arasındaki fark değişiyordu: ilk modelde 25,3 puan, ikincisinde ise 28,6 puan. Analize göre tek satırlık genel değerlendirme sonuçları, güvenilirlikteki bu farklılığı ortaya çıkaramaz.
Karşılaştırmanın sınırları ve sonraki adım
Yazar, Sudan ve Japonya sonuçlarının ABD veya Avustralya için kullanılan güven düzeyiyle yorumlanmaması gerektiği konusunda uyarıyor; çünkü bu iki ülkenin kümeleri küçük ve birkaç kolay ya da zor görüntü mAP'yi daha büyük ölçüde etkileyebilir. Ayrıca mevcut değerlendirme genetik tip düzeyinde değil, ülke düzeyinde yapılıyor. Kullanılan manifestoda ülke, kuruluş ve büyüme aşaması yer alıyor, ancak genetik tip etiketleri bulunmuyor.
Sonraki adım, “Post-flowering” ile “Post-Flowering” etiketlerinden birinin yazımındaki farkın standartlaştırılmasının ardından büyüme aşamasına göre bölünmüş bir değerlendirmeyi içeriyor; bu farkın büyük olasılıkla biçimsel olduğu ve büyük-küçük harf kullanımından kaynaklandığı düşünülüyor. Model kartlarında artık ülkeye göre performans bölümü yer alıyor; ayrıca küme deposunda country_breakdown.json ve domain_metadata.json dosyaları bulunuyor. Yazar, sürüm ve analizin özgün veri kümesi yazarlarının çalışmalarını temel alan bağımsız ve gayriresmî bir değerlendirme olduğunu vurguladı.