Искусственный интеллект

За пределами общей оценки: как различия между странами выявляют надёжность моделей обнаружения колосьев пшеницы

Повторная оценка девяти моделей обнаружения колосьев пшеницы показывает, что среднее общее значение mAP может скрывать значительные различия в производительности между странами. Китай оказался лидером для всех моделей, тогда как слабые места YOLO и RF-DETR различались, что делает измерение переноса между доменами необходимым перед применением в полевых условиях.

2026-08-11
5 мин. чтения
7 просмотров
فريق تحرير certi.news
За пределами общей оценки: как различия между странами выявляют надёжность моделей обнаружения колосьев пшеницы

Результаты новой стратифицированной оценки моделей обнаружения колосьев пшеницы показывают, что ранжирование моделей по среднему общему показателю производительности не даёт полной картины их надёжности при использовании в полевых условиях. Девять моделей, обученных на наборе данных Global Wheat Head Dataset 2021 (GWHD), были повторно протестированы с разбивкой по странам. Результаты показали явные различия в производительности между географическими доменами, даже когда общие оценки были близкими.

Анализ, опубликованный пользователем Saumya Saksena под именем dronefreak в блоге Hugging Face 11 августа 2026 года, стал продолжением предыдущего открытого релиза, включавшего девять моделей обнаружения объектов: YOLOv8, YOLOv11, YOLOv26 и RF-DETR в версиях от nano до x-large. Модели обучались и настраивались с использованием GWHD 2021 — набора данных, созданного на основе полевых изображений колосьев пшеницы, собранных в шести странах и 18 исследовательских учреждениях для разнообразия генетических типов, стадий роста и условий съёмки.

Отдельное тестирование для каждой страны

Анализ основывался на манифесте для каждого изображения, связывающем изображения тестового набора со страной и стадией роста. Автор пояснил, что эта связь не входила в исходный релиз GWHD, а была создана для данного анализа на основе метаданных доменов. Также был повторно запущен тот же механизм оценки, который использовался для общих результатов: model.val() из Ultralytics для семейства YOLO и MeanAveragePrecision из библиотеки supervision для моделей RF-DETR.

Из 1 382 изображений в тестовом наборе страну одного изображения невозможно было определить из-за проблемы с дублированием имени файла в исходных данных; поэтому изображение исключили, а не стали приблизительно относить к какой-либо стране. Сравнения основывались на 1 381 изображении: 605 изображений из США, 281 из Австралии, 205 из Мексики, 200 из Китая, 60 из Японии и 30 из Судана.

Китай лидирует по производительности всех моделей

Китай получил самый высокий результат по mAP@50 для всех девяти моделей без исключения: от 79,78% для RF-DETR Nano до 92,36% для YOLOv11x. Анализ связывает это с тем, что китайский домен является одним из крупнейших и наиболее визуально однородных в наборе данных: он включает два учреждения и 200 изображений. Однородность внутри домена может упрощать оценку на нём независимо от того, какую информацию модель изучила по данным других стран.

В предыдущей общей оценке лидером была YOLOv11x с результатом 74,25% по mAP@50 и 34,92% по mAP@50:95 при точности 83,37%. YOLOv26s обеспечила наилучший компромисс между эффективностью и производительностью, достигнув 70,49% по mAP@50 при 22,8 GFLOPs и 10 миллионах параметров — менее чем на четыре пункта ниже самой эффективной модели и примерно в 8,6 раза с меньшим числом операций, чем YOLOv11x, показавшая 196,0 GFLOPs.

Слабые места различаются между семействами моделей

Сравнение показало, что четыре из шести версий YOLO — YOLOv26s, YOLOv8m, YOLOv8s и YOLOv8n — были наиболее слабыми на наборе изображений из США. На США приходится 43,8% тестовых изображений, поэтому общая оценка этих моделей в значительной степени зависит от производительности в регионе, с которым они справляются хуже всего, а не обязательно от производительности в типичной стране.

YOLOv11x была исключением: её наименьшая производительность наблюдалась в Австралии, тогда как самым слабым регионом для YOLOv26m оказалась Япония. В свою очередь, Австралия была слабым регионом для всех трёх версий RF-DETR. Согласно значениям, приведённым в анализе, разница между лучшей и худшей странами составляла от 22,79 пункта для YOLOv26m до 44,38 пункта для RF-DETR Nano.

Сырая точность не равна устойчивости между доменами

YOLOv26m показала наименьшую разницу между странами — 22,8 пункта: от 88,99% в Китае до 66,21% в Японии, хотя не имела самого высокого общего результата. YOLOv11x была близка к ней с разницей в 23,1 пункта, что указывает на большую согласованность между доменами по сравнению с остальными моделями.

Напротив, RF-DETR Nano продемонстрировала наибольшую разницу — 44,4 пункта, снизившись с 79,8% в Китае до 35,4% в Австралии. Эта разница превышает диапазон различий между самими моделями в Китае, где результаты составляли от 79,8% до 92,4%. Конкретно для этой модели источник изображений для развёртывания может сильнее влиять на результат, чем выбор другой модели из набора.

Пример с YOLOv26s и YOLOv8m показывает важность такого измерения: их общие результаты были близкими — 70,49% и 69,55% по mAP@50 соответственно, с разницей менее одного пункта, однако разница между лучшей и худшей странами отличалась более чем на три пункта: 25,3 пункта для первой модели и 28,6 для второй. Согласно анализу, одна строка общих результатов оценки не способна показать это различие в надёжности.

Ограничения сравнения и следующий шаг

Автор предупреждает, что результаты для Судана и Японии не следует интерпретировать с той же уверенностью, что и результаты для США или Австралии, поскольку их выборки невелики, и небольшое число лёгких или сложных изображений может сильнее повлиять на mAP. Кроме того, текущая оценка проводится на уровне страны, а не генетического типа: используемый манифест содержит сведения о стране, учреждении и стадии роста, но не содержит меток генетических типов.

Следующий этап включает оценку с разбивкой по стадии роста после унификации различия в написании одной из меток — “Post-flowering” и “Post-Flowering”; предполагается, что различие является формальным и связано с регистром букв. В карточки моделей был добавлен раздел с производительностью по странам, а в репозитории набора появились файлы country_breakdown.json и domain_metadata.json. Автор подчеркнул, что релиз и анализ являются независимой и неофициальной оценкой, основанной на работе авторов исходного набора данных.

Источник новости
ف
Автор

فريق تحرير certi.news

В той же категории

Вам также может понравиться

Все новости