Искусственный интеллект

Почему готовой модели недостаточно? Практический урок по дообучению моделей обнаружения объектов на реальных данных

JetBrains показывает на примере эксперимента с YOLO12, YOLO26 и RF-DETR, что модели, предварительно обученные на COCO, при прямом переносе в специализированные области могут показывать результаты, близкие к нулю, тогда как дообучение улучшает показатели в разной степени. Эксперимент показывает, что сходство целевой области с обучающими данными, а также точность позиционирования и время инференса важнее, чем классификация модели как самой новой или лучшей.

2026-08-31
5 мин. чтения
7 просмотров
فريق تحرير certi.news
Почему готовой модели недостаточно? Практический урок по дообучению моделей обнаружения объектов на реальных данных

JetBrains представляет практический эксперимент по проверке трёх современных моделей обнаружения объектов — YOLO12, YOLO26 и RF-DETR — не только на стандартных данных, но и на изображениях, представляющих сценарии, более близкие к реальному использованию: повреждение кабелей, переломы костей на рентгеновских снимках и уложенные в ряд бутылки с напитками. Основной вывод однозначен: предварительно обученная модель не обязательно является моделью, готовой к развёртыванию.

Изначально модели были обучены на данных COCO, включающих около 118 тысяч обучающих изображений и 80 распространённых классов, таких как люди, автомобили, собаки и стулья. Однако некоторые практические объекты, например переломы костей, вообще не относятся к словарю этих классов, тогда как рентгеновские снимки, промышленные изображения и визуально перегруженные сцены отличаются от естественных изображений, к которым привыкли модели.

Проверка базовой линии перед обучением

Перед переходом к дообучению JetBrains оценила шесть контрольных точек — по две для каждого из трёх семейств — на проверочном наборе COCO val2017, состоящем из 5 000 изображений. RF-DETR Base достиг наивысшего результата mAP50-95 — 0.5325, тогда как две средние модели YOLO приблизились к этому показателю, набрав 0.5259 и 0.5181 соответственно, при этом имея примерно на 10 миллионов параметров меньше.

Сравнение также выявило практические различия в скорости. YOLO26-N показала время 12.3 миллисекунды при результате mAP50-95, близком к YOLOv12-N, которая показала 23.9 миллисекунды, несмотря на то что была самой маленькой моделью в эксперименте. Время RF-DETR Nano составило 12.4 миллисекунды, хотя число её параметров приблизительно равно 30 миллионам, что больше, чем у YOLO26-M.

Эти показатели не обязательно совпадают с данными, опубликованными в статьях о моделях, поскольку в эксперименте использовалось оборудование, отличное от распространённого ускорителя NVIDIA T4 в подобных сравнениях, а модели запускались в исходных фреймворках без преобразования в TensorRT. JetBrains отмечает, что TensorRT может сократить время инференса за счёт объединения слоёв и выбора оптимизированных для оборудования ядер, однако требует дополнительного этапа сборки и создаёт движок, связанный с конкретным графическим процессором. Поэтому показатели эксперимента отражают производительность, более близкую к непосредственному запуску, а не максимально возможную производительность после оптимизации.

Тестирование за пределами области обучения

В эксперименте использовались три набора из RF100-VL — коллекции, включающей 100 мультимодальных наборов данных, предназначенных для покрытия редких объектов, обычно отсутствующих в обучающих данных. Были выбраны наборы bone-fracture-7fylg, cable-damage и soda-bottles.

При непосредственном запуске контрольных точек, обученных на COCO, на этих данных результат оказался практически нулевым. JetBrains объясняет это тем, что используемые модели являются детекторами с закрытым словарём: они располагают фиксированным числом классов и не могут вывести класс вроде fracture, если он отсутствует в голове модели, состоящей из 80 классов. Поэтому результат mAP50, равный 0.72 на COCO, не означает, что модель автоматически распознает переломы костей.

Что меняет дообучение?

JetBrains дообучила три модели на каждом наборе данных в течение 10 эпох, используя один модуль A100 и стандартные процедуры обучения в Ultralytics и RF-DETR. После обучения результаты заметно улучшились в задачах обнаружения повреждений кабелей и бутылок с напитками, тогда как задача обнаружения переломов костей оставалась наиболее сложной.

Бутылки с напитками оказались самым простым случаем: результат mAP50 всех моделей находился в диапазоне от 0.91 до 0.97, а YOLOv12-M достигла наилучшего показателя mAP50-95 — 0.6422. JetBrains предполагает, что причина заключается в близости изображений товаров к некоторым классам COCO, благодаря чему задача больше похожа на добавление новых элементов словаря, чем на полный переход между двумя визуальными областями.

В задаче обнаружения повреждений кабелей mAP50 достиг 0.93, однако наивысший mAP50-95 не превысил 0.446. Это означает, что модели способны хорошо находить повреждения, но испытывают трудности с точным построением ограничивающих рамок вокруг тонких и протяжённых дефектов. На рентгеновских изображениях переломов костей наилучший mAP50, достигнутый RF-DETR Base, составил лишь 0.447, причём между моделями наблюдалась значительная разница. Визуальная проверка также показала, что в некоторых результатах перелом был обнаружен менее чем на половине изображений.

Что следует проверить команде разработки?

  • Начните с воспроизводимой базовой линии: проверьте производительность контрольных точек в своей среде и на своём оборудовании, прежде чем сравнивать результаты с опубликованными показателями.
  • Разделяйте программные среды: JetBrains использовала три изолированные среды uv внутри одного проекта PyCharm, поскольку версии библиотеки ultralytics, необходимые для поколений YOLO, несовместимы. Использование удалённого интерпретатора в PyCharm требует версии Professional, тогда как Community Edition поддерживает только локальные среды.
  • Не ограничивайтесь одним показателем: разница между mAP50 и mAP50-95 при обнаружении повреждений кабелей выявляет проблему точного позиционирования, которая может быть незаметна при рассмотрении только mAP50.
  • Связывайте выбор модели с задачей: RF-DETR Base показала большую стабильность и победила на двух из трёх наборов данных, однако это не делает её лучшей для любого сценария.
  • Планируйте данные при значительном сдвиге области: результаты на рентгеновских снимках показывают, что одного дообучения может быть недостаточно; могут потребоваться дополнительные данные, более длительное обучение или специализированное предварительное обучение в целевой области — эти варианты упоминаются в материале, но превосходство какого-либо из них в данном эксперименте не доказано.

Эксперимент подтверждает, что слова «современная» или «предварительно обученная» не определяют пригодность модели обнаружения объектов для среды развёртывания. Практическое решение должно учитывать точность, время инференса, размер модели, лицензионные требования и, что наиболее важно, степень сходства обучающих данных с целевой областью. Кроме того, результаты JetBrains связаны с тремя использованными наборами и настройками обучения, поэтому их не следует обобщать как окончательный рейтинг для всех задач обнаружения.

Источник новости
ف
Автор

فريق تحرير certi.news

В той же категории

Вам также может понравиться

Все новости