인공지능

준비된 모델만으로는 왜 충분하지 않은가? 실제 데이터에서 객체 탐지 모델을 파인튜닝하는 실전 교훈

JetBrains는 YOLO12, YOLO26, RF-DETR을 대상으로 한 실험을 통해 COCO에서 사전 학습된 모델을 전문 분야에 그대로 적용하면 성능이 거의 0에 가까워질 수 있는 반면, 파인튜닝을 수행하면 결과가 서로 다른 수준으로 개선된다는 점을 보여준다. 이 실험은 모델이 최신인지 또는 최고인지에 대한 분류보다 대상 도메인과 학습 데이터의 유사성, 위치 지정의 정확도, 추론 시간이 더 중요하다는 사실을 드러낸다.

2026-08-31
4 분 읽기
7 조회수
فريق تحرير certi.news
준비된 모델만으로는 왜 충분하지 않은가? 실제 데이터에서 객체 탐지 모델을 파인튜닝하는 실전 교훈

JetBrains는 세 가지 최신 객체 탐지 모델인 YOLO12, YOLO26, RF-DETR을 테스트하는 실전 실험을 제시한다. 이 실험은 표준 데이터만이 아니라 케이블 손상, X선 이미지의 골절, 빽빽하게 쌓인 음료수병 등 실제 사용 사례에 가까운 상황을 나타내는 이미지에서도 수행되었다. 핵심 결론은 분명하다. 사전 학습된 모델이 반드시 배포 준비가 된 모델인 것은 아니다.

모델은 기본적으로 약 118,000개의 학습 이미지와 사람, 자동차, 개, 의자 등 80개의 일반적인 클래스를 포함하는 COCO 데이터에 의존했다. 그러나 골절과 같은 일부 실용적인 대상은 이러한 클래스의 어휘에 애초에 포함되지 않는다. 또한 X선 이미지, 산업용 장면, 시각적으로 복잡한 장면은 모델이 익숙하게 보아 온 자연 이미지와 다르다.

학습 전에 기준선 확인하기

파인튜닝으로 넘어가기 전에 JetBrains는 세 모델 계열에서 각각 두 가지 크기로 구성된 6개의 체크포인트를 5,000개의 이미지로 이루어진 COCO 검증 세트 val2017에서 평가했다. RF-DETR Base는 0.5325의 가장 높은 mAP50-95를 기록했다. 한편 중간 크기의 YOLO 모델 두 개는 각각 0.5259와 0.5181로 이에 근접했으며, 매개변수 수는 약 1,000만 개 더 적었다.

비교 결과 속도에서도 실질적인 차이가 나타났다. YOLO26-N은 12.3밀리초를 기록했으며, 실험에서 가장 작았지만 23.9밀리초를 기록한 YOLOv12-N과 비슷한 mAP50-95를 보였다. RF-DETR Nano의 추론 시간은 12.4밀리초였지만 매개변수 수는 약 3,000만 개로, YOLO26-M보다 많았다.

이 수치는 모델 논문에 발표된 결과와 반드시 일치하지는 않는다. 실험에서 비교에 흔히 사용되는 NVIDIA T4와 다른 하드웨어를 사용했고, 모델을 TensorRT로 변환하지 않은 채 각 모델의 기본 프레임워크에서 실행했기 때문이다. JetBrains는 TensorRT가 레이어를 결합하고 하드웨어에 최적화된 커널을 선택해 추론 시간을 줄일 수 있지만, 추가적인 빌드 단계가 필요하며 특정 그래픽 처리 장치에 종속된 엔진을 생성한다고 설명한다. 따라서 실험 수치는 최적화 후 가능한 최대 성능이 아니라 직접 실행에 가까운 성능을 반영한다.

학습 범위를 벗어난 테스트

실험에는 일반적인 학습 데이터에서 드문 대상을 다루도록 설계된 100개의 멀티모달 데이터 세트를 포함하는 RF100-VL에서 세 가지 데이터 세트가 사용되었다. 선택된 데이터 세트는 bone-fracture-7fylg, cable-damage, soda-bottles였다.

COCO에서 학습된 체크포인트를 이 데이터에 직접 실행했을 때 결과는 거의 0에 가까웠다. JetBrains는 사용된 모델이 폐쇄형 어휘를 사용하는 탐지기이기 때문이라고 설명한다. 모델은 정해진 수의 클래스만 가지고 있으며, 80개 클래스로 구성된 모델의 헤드에 fracture라는 클래스가 없다면 해당 클래스를 출력할 수 없다. 따라서 한 모델이 COCO에서 mAP50 0.72를 얻었다고 해서 골절을 자동으로 인식한다는 의미는 아니다.

파인튜닝은 무엇을 바꾸는가?

JetBrains는 세 모델을 각각의 데이터 세트에 대해 단일 A100에서 10개의 학습 에포크 동안 파인튜닝했으며, Ultralytics와 RF-DETR의 일반적인 학습 경로를 사용했다. 학습 후 케이블 손상과 음료수병 작업에서는 결과가 뚜렷하게 개선되었지만, 더 어려운 골절 작업은 여전히 난도가 높았다.

음료수병은 가장 쉬운 사례였다. 모든 모델의 mAP50은 0.91에서 0.97 사이였고, YOLOv12-M은 0.6422로 가장 높은 mAP50-95를 기록했다. JetBrains는 제품 이미지가 COCO에 존재하는 일부 클래스와 유사하기 때문일 가능성이 높다고 본다. 이 문제는 두 시각적 도메인 사이의 완전한 전환이라기보다 새로운 어휘를 추가하는 문제에 가깝다는 것이다.

케이블 손상 작업에서는 mAP50이 0.93에 도달했지만, 가장 높은 mAP50-95는 0.446을 넘지 못했다. 이는 모델이 손상을 상당히 잘 찾아낼 수 있지만, 가늘고 길게 이어지는 결함 주변에 정확한 바운딩 박스를 그리는 데 어려움을 겪는다는 의미다. 골절 이미지에서는 RF-DETR Base가 기록한 최고 mAP50도 0.447에 그쳤으며, 모델 간 편차도 컸다. 또한 시각적 검토 결과 일부 결과에서는 전체 이미지의 절반 미만에서만 골절이 탐지되었다.

개발팀이 검토해야 할 사항

  • 재현 가능한 기준선부터 시작하라: 발표된 수치와 결과를 비교하기 전에 자체 환경과 하드웨어에서 체크포인트의 성능을 확인하라.
  • 소프트웨어 환경을 분리하라: JetBrains는 하나의 PyCharm 프로젝트 안에서 격리된 uv 환경 세 개를 사용했다. YOLO 세대에 필요한 ultralytics 라이브러리 버전이 서로 호환되지 않기 때문이다. PyCharm에서 원격 인터프리터를 사용하려면 Professional 버전이 필요하며, Community Edition은 로컬 환경만 지원한다.
  • 하나의 지표에만 의존하지 말라: 케이블 손상에서 mAP50과 mAP50-95의 차이는 mAP50만 볼 때 드러나지 않을 수 있는 정밀한 위치 지정 문제를 보여준다.
  • 모델 선택을 작업과 연결하라: RF-DETR Base는 더 높은 일관성을 보였고 세 데이터 세트 중 두 곳에서 우수했지만, 그렇다고 모든 사례에서 가장 뛰어난 모델이라는 뜻은 아니다.
  • 변화 폭이 클 때는 데이터를 계획하라: X선 결과는 파인튜닝만으로 충분하지 않을 수 있음을 보여준다. 더 많은 데이터, 더 긴 학습, 또는 해당 도메인에 특화된 사전 학습이 필요할 수 있다. 이 자료는 이러한 선택지를 제시하지만, 이번 실험에서 어느 하나가 우월하다는 점을 입증하지는 않는다.

이 실험은 ‘최첨단’ 또는 ‘사전 학습됨’이라는 표현만으로 객체 탐지 모델이 배포 환경에 적합한지를 판단할 수 없다는 점을 확인해 준다. 실질적인 결정에서는 정확도, 추론 시간, 모델 크기, 라이선스 요구 사항, 그리고 무엇보다 학습 데이터와 대상 도메인의 유사성을 함께 고려해야 한다. 또한 JetBrains의 결과는 사용된 세 데이터 세트와 학습 설정에 종속되어 있으므로, 모든 탐지 작업에 적용되는 최종 순위로 일반화해서는 안 된다.

뉴스 출처
JetBrains Blog
원문 보기 ↗
ف
작성자

فريق تحرير certi.news

같은 카테고리

추천 기사

모든 뉴스 보기