인공지능

종합 점수 너머: 국가별 차이가 밀 추수 머리 감지 모델의 신뢰성을 어떻게 드러내는가

밀 이삭 감지를 위한 9개 모델을 재평가한 결과, 전체 평균 mAP가 국가별 성능의 큰 차이를 가릴 수 있는 것으로 나타났다. 모든 모델에서 중국이 가장 높은 성능을 보였으며, YOLO와 RF-DETR의 취약 지역은 서로 달랐다. 따라서 현장 배포 전에 도메인 간 전이를 측정하는 것이 필수적이다.

2026-08-11
4 분 읽기
7 조회수
فريق تحرير certi.news
종합 점수 너머: 국가별 차이가 밀 추수 머리 감지 모델의 신뢰성을 어떻게 드러내는가

밀 이삭 감지 모델에 대한 새로운 계층별 평가 결과, 전체 평균 성능을 기준으로 모델 순위를 매기는 것만으로는 현장 사용에서의 신뢰성을 온전히 파악할 수 없는 것으로 나타났다. Global Wheat Head Dataset 2021 (GWHD)로 학습된 9개 모델을 국가별로 다시 테스트한 결과, 전체 점수가 비슷한 경우에도 지리적 도메인 간 성능에 뚜렷한 차이가 확인됐다.

Hugging Face 블로그에서 dronefreak이라는 이름으로 활동하는 사용자 Saumya Saksena가 2026년 8월 11일 게시한 이 분석은 객체 감지를 위한 9개 모델을 포함한 이전 오픈 소스 릴리스의 후속 작업이다. 대상 모델은 nano부터 x-large까지의 버전으로 구성된 YOLOv8, YOLOv11, YOLOv26, RF-DETR이다. 모델은 GWHD 2021을 사용해 학습 및 조정됐다. GWHD 2021은 유전형, 생육 단계, 촬영 조건을 다양화하기 위해 6개국과 18개 연구 기관에서 수집한 밀 이삭 현장 이미지로 구축된 데이터셋이다.

국가별 개별 테스트

분석에서는 테스트 세트의 이미지를 국가 및 생육 단계와 연결하는 이미지별 전용 매니페스트를 사용했다. 작성자는 이 연결 정보가 GWHD 원본 릴리스의 일부가 아니라, 도메인 메타데이터에서 이 분석을 위해 생성된 것이라고 설명했다. 또한 전체 결과에 사용된 것과 동일한 평가 엔진을 다시 실행했다. YOLO 계열에는 Ultralytics의 model.val()을, RF-DETR 모델에는 supervision 라이브러리의 MeanAveragePrecision을 사용했다.

테스트 세트의 1,382개 이미지 중 원본 데이터의 파일명 중복 문제로 이미지 1개의 국가를 확인할 수 없었다. 따라서 해당 이미지는 추정하여 배정하지 않고 제외했다. 비교는 미국 605장, 호주 281장, 멕시코 205장, 중국 200장, 일본 60장, 수단 30장으로 구성된 총 1,381장의 이미지에 기반했다.

모든 모델의 성능에서 중국이 선두

중국은 예외 없이 9개 모델 모두에서 mAP@50 최고 점수를 기록했다. 중국에서의 결과는 RF-DETR Nano의 79.78%에서 YOLOv11x의 92.36%까지 분포했다. 분석은 중국 도메인이 데이터셋에서 규모가 크고 시각적으로 가장 일관된 도메인 중 하나라는 점과 이를 연관지었다. 중국 도메인에는 2개 기관과 200장의 이미지가 포함된다. 도메인 내부의 동질성으로 인해 다른 국가에서 모델이 학습한 정보와 관계없이 해당 도메인에서의 평가가 더 쉬워질 수 있다.

이전의 전체 평가에서는 YOLOv11x가 mAP@50 74.25%, mAP@50:95 34.92%, 정밀도 83.37%로 1위를 차지했다. YOLOv26s는 효율성과 성능 사이에서 가장 뛰어난 절충을 보였다. 22.8 GFLOPs와 1,000만 개의 파라미터로 mAP@50 70.49%를 기록했으며, 최고 모델보다 4점 미만 낮은 결과를 약 196.0 GFLOPs를 기록한 YOLOv11x보다 약 8.6배 적은 연산으로 달성했다.

모델 계열에 따라 취약 지역이 다르다

비교 결과, YOLO의 6개 버전 중 YOLOv26s, YOLOv8m, YOLOv8s, YOLOv8n의 4개 모델은 미국 이미지 세트에서 가장 약한 성능을 보였다. 미국은 테스트 이미지의 43.8%를 차지하므로, 이 모델들의 전체 점수는 반드시 대표적인 국가의 성능이 아니라 가장 취약하게 처리하는 지역의 성능에 크게 영향을 받는다.

YOLOv11x는 예외로, 가장 낮은 성능을 호주에서 기록했으며 YOLOv26m은 일본에서 가장 낮은 성능을 보였다. 반면 호주는 RF-DETR의 3개 버전 모두에서 취약 지역이었다. 분석에 제시된 값에 따르면 최고 국가와 최저 국가 사이의 차이는 YOLOv26m의 22.79점에서 RF-DETR Nano의 44.38점까지였다.

원시 정확도가 도메인 간 견고성을 의미하지는 않는다

YOLOv26m은 국가 간 차이가 22.8점으로 가장 좁았다. 중국의 88.99%에서 일본의 66.21%까지였으며, 전체 최고 점수를 기록한 모델은 아니었다. YOLOv11x도 23.1점의 차이로 이에 가까웠고, 이는 다른 모델에 비해 도메인 전반에서 더 높은 일관성을 보인다는 것을 의미한다.

반대로 RF-DETR Nano는 중국의 79.8%에서 호주의 35.4%로 이동하며 44.4점으로 가장 큰 차이를 보였다. 이 차이는 중국에서 모델 간 성능 차이의 범위 자체보다도 컸다. 중국에서 모델 간 결과는 79.8%에서 92.4%까지 분포했다. 특히 이 모델의 경우 배포 이미지의 출처가 그룹 내에서 다른 모델을 선택하는 것보다 결과에 더 큰 영향을 미칠 수 있다.

YOLOv26s와 YOLOv8m의 사례는 이러한 측정의 중요성을 보여준다. 두 모델의 전체 결과는 mAP@50 기준 각각 70.49%와 69.55%로 1점 미만의 차이를 보였지만, 최고 국가와 최저 국가 간 차이는 3점 이상 달랐다. 전자는 25.3점, 후자는 28.6점이었다. 분석에 따르면 전체 평가 결과 한 줄만으로는 이러한 신뢰성 차이를 드러낼 수 없다.

비교의 한계와 다음 단계

작성자는 미국이나 호주에 적용하는 것과 동일한 수준의 신뢰도로 수단과 일본의 결과를 해석해서는 안 된다고 경고한다. 두 국가의 그룹 규모가 작아, 소수의 쉬운 이미지나 어려운 이미지가 mAP에 더 큰 영향을 미칠 수 있기 때문이다. 또한 현재 평가는 유전형이 아닌 국가 수준에서 이루어졌다. 사용된 매니페스트에는 국가, 기관, 생육 단계가 포함되지만 유전형 라벨은 포함되지 않는다.

다음 단계에는 생육 단계별로 나눈 평가가 포함된다. 이를 위해 “Post-flowering”과 “Post-Flowering” 사이에 존재하는 표기 차이를 통일할 예정이다. 이 차이는 대소문자 표기와 관련된 형식상의 차이일 가능성이 높다. 모델 카드에는 국가별 성능 섹션이 추가됐으며, 데이터셋 저장소에는 country_breakdown.json 및 domain_metadata.json 파일도 포함됐다. 작성자는 이번 릴리스와 분석이 원본 데이터셋 저자들의 작업을 바탕으로 한 독립적이고 비공식적인 평가라고 강조했다.

뉴스 출처
Hugging Face Blog
원문 보기 ↗
ف
작성자

فريق تحرير certi.news

같은 카테고리

추천 기사

모든 뉴스 보기