Результаты новой стратифицированной оценки моделей обнаружения колосьев пшеницы показывают, что ранжирование моделей по среднему общему показателю производительности не даёт полной картины их надёжности при использовании в полевых условиях. Девять моделей, обученных на наборе данных Global Wheat Head Dataset 2021 (GWHD), были повторно протестированы с разбивкой по странам. Результаты показали явные различия в производительности между географическими доменами, даже когда общие оценки были близкими.
Анализ, опубликованный пользователем Saumya Saksena под именем dronefreak в блоге Hugging Face 11 августа 2026 года, стал продолжением предыдущего открытого релиза, включавшего девять моделей обнаружения объектов: YOLOv8, YOLOv11, YOLOv26 и RF-DETR в версиях от nano до x-large. Модели обучались и настраивались с использованием GWHD 2021 — набора данных, созданного на основе полевых изображений колосьев пшеницы, собранных в шести странах и 18 исследовательских учреждениях для разнообразия генетических типов, стадий роста и условий съёмки.
Отдельное тестирование для каждой страны
Анализ основывался на манифесте для каждого изображения, связывающем изображения тестового набора со страной и стадией роста. Автор пояснил, что эта связь не входила в исходный релиз GWHD, а была создана для данного анализа на основе метаданных доменов. Также был повторно запущен тот же механизм оценки, который использовался для общих результатов: model.val() из Ultralytics для семейства YOLO и MeanAveragePrecision из библиотеки supervision для моделей RF-DETR.
Из 1 382 изображений в тестовом наборе страну одного изображения невозможно было определить из-за проблемы с дублированием имени файла в исходных данных; поэтому изображение исключили, а не стали приблизительно относить к какой-либо стране. Сравнения основывались на 1 381 изображении: 605 изображений из США, 281 из Австралии, 205 из Мексики, 200 из Китая, 60 из Японии и 30 из Судана.
Китай лидирует по производительности всех моделей
Китай получил самый высокий результат по mAP@50 для всех девяти моделей без исключения: от 79,78% для RF-DETR Nano до 92,36% для YOLOv11x. Анализ связывает это с тем, что китайский домен является одним из крупнейших и наиболее визуально однородных в наборе данных: он включает два учреждения и 200 изображений. Однородность внутри домена может упрощать оценку на нём независимо от того, какую информацию модель изучила по данным других стран.
В предыдущей общей оценке лидером была YOLOv11x с результатом 74,25% по mAP@50 и 34,92% по mAP@50:95 при точности 83,37%. YOLOv26s обеспечила наилучший компромисс между эффективностью и производительностью, достигнув 70,49% по mAP@50 при 22,8 GFLOPs и 10 миллионах параметров — менее чем на четыре пункта ниже самой эффективной модели и примерно в 8,6 раза с меньшим числом операций, чем YOLOv11x, показавшая 196,0 GFLOPs.
Слабые места различаются между семействами моделей
Сравнение показало, что четыре из шести версий YOLO — YOLOv26s, YOLOv8m, YOLOv8s и YOLOv8n — были наиболее слабыми на наборе изображений из США. На США приходится 43,8% тестовых изображений, поэтому общая оценка этих моделей в значительной степени зависит от производительности в регионе, с которым они справляются хуже всего, а не обязательно от производительности в типичной стране.
YOLOv11x была исключением: её наименьшая производительность наблюдалась в Австралии, тогда как самым слабым регионом для YOLOv26m оказалась Япония. В свою очередь, Австралия была слабым регионом для всех трёх версий RF-DETR. Согласно значениям, приведённым в анализе, разница между лучшей и худшей странами составляла от 22,79 пункта для YOLOv26m до 44,38 пункта для RF-DETR Nano.
Сырая точность не равна устойчивости между доменами
YOLOv26m показала наименьшую разницу между странами — 22,8 пункта: от 88,99% в Китае до 66,21% в Японии, хотя не имела самого высокого общего результата. YOLOv11x была близка к ней с разницей в 23,1 пункта, что указывает на большую согласованность между доменами по сравнению с остальными моделями.
Напротив, RF-DETR Nano продемонстрировала наибольшую разницу — 44,4 пункта, снизившись с 79,8% в Китае до 35,4% в Австралии. Эта разница превышает диапазон различий между самими моделями в Китае, где результаты составляли от 79,8% до 92,4%. Конкретно для этой модели источник изображений для развёртывания может сильнее влиять на результат, чем выбор другой модели из набора.
Пример с YOLOv26s и YOLOv8m показывает важность такого измерения: их общие результаты были близкими — 70,49% и 69,55% по mAP@50 соответственно, с разницей менее одного пункта, однако разница между лучшей и худшей странами отличалась более чем на три пункта: 25,3 пункта для первой модели и 28,6 для второй. Согласно анализу, одна строка общих результатов оценки не способна показать это различие в надёжности.
Ограничения сравнения и следующий шаг
Автор предупреждает, что результаты для Судана и Японии не следует интерпретировать с той же уверенностью, что и результаты для США или Австралии, поскольку их выборки невелики, и небольшое число лёгких или сложных изображений может сильнее повлиять на mAP. Кроме того, текущая оценка проводится на уровне страны, а не генетического типа: используемый манифест содержит сведения о стране, учреждении и стадии роста, но не содержит меток генетических типов.
Следующий этап включает оценку с разбивкой по стадии роста после унификации различия в написании одной из меток — “Post-flowering” и “Post-Flowering”; предполагается, что различие является формальным и связано с регистром букв. В карточки моделей был добавлен раздел с производительностью по странам, а в репозитории набора появились файлы country_breakdown.json и domain_metadata.json. Автор подчеркнул, что релиз и анализ являются независимой и неофициальной оценкой, основанной на работе авторов исходного набора данных.