Inteligencia artificial

Más allá de la puntuación global: cómo las diferencias entre países revelan la fiabilidad de los modelos de detección de espigas de trigo

Una reevaluación de nueve modelos para detectar espigas de trigo muestra que el mAP medio global puede ocultar grandes diferencias de rendimiento entre países. China encabezó todos los modelos, mientras que las zonas de debilidad variaron entre YOLO y RF-DETR, lo que hace necesario medir el cambio entre dominios antes del despliegue sobre el terreno.

2026-08-11
7 min de lectura
7 visitas
فريق تحرير certi.news
Más allá de la puntuación global: cómo las diferencias entre países revelan la fiabilidad de los modelos de detección de espigas de trigo

Los resultados de una nueva evaluación estratificada de modelos de detección de espigas de trigo revelan que ordenar los modelos según el rendimiento medio global no ofrece una imagen completa de su fiabilidad en el uso sobre el terreno. Se volvieron a probar nueve modelos entrenados con el Global Wheat Head Dataset 2021 (GWHD) por país, y los resultados mostraron claras diferencias de rendimiento entre dominios geográficos, incluso cuando las puntuaciones globales eran similares.

El análisis, publicado por el usuario Saumya Saksena con el nombre dronefreak en el blog de Hugging Face el 11 de agosto de 2026, es una continuación de una versión anterior de código abierto que incluía nueve modelos de detección de objetos: YOLOv8, YOLOv11, YOLOv26 y RF-DETR, en versiones desde nano hasta x-large. Los modelos se entrenaron y ajustaron utilizando GWHD 2021, un conjunto de datos creado a partir de imágenes de campo de espigas de trigo recopiladas en seis países y 18 instituciones de investigación con el objetivo de diversificar los patrones genéticos, las etapas de crecimiento y las condiciones de captura.

Prueba independiente para cada país

El análisis se basó en un manifiesto específico para cada imagen, que vinculaba las imágenes del conjunto de prueba con el país y la etapa de crecimiento. El autor explicó que esta vinculación no formaba parte de la versión original de GWHD, sino que se creó para este análisis a partir de los metadatos específicos de los dominios. También se volvió a ejecutar el mismo motor de evaluación utilizado en los resultados globales: model.val() de Ultralytics para la familia YOLO y MeanAveragePrecision de la biblioteca supervision para los modelos RF-DETR.

De las 1.382 imágenes del conjunto de prueba, no fue posible determinar el país de una imagen debido a un problema de duplicación del nombre de archivo en los datos de origen; por ello, la imagen se excluyó en lugar de asignarle un país de forma estimada. Las comparaciones se basaron en 1.381 imágenes distribuidas entre Estados Unidos, con 605 imágenes; Australia, con 281; México, con 205; China, con 200; Japón, con 60; y Sudán, con 30 imágenes.

China encabeza el rendimiento de todos los modelos

China obtuvo la puntuación más alta en mAP@50 para los nueve modelos sin excepción, con resultados que oscilaron allí entre el 79,78 % del modelo RF-DETR Nano y el 92,36 % del modelo YOLOv11x. El análisis relaciona este resultado con el hecho de que el dominio chino es uno de los más grandes y visualmente más coherentes del conjunto de datos, ya que incluye dos instituciones y 200 imágenes. La homogeneidad dentro del dominio puede hacer que su evaluación sea más sencilla, independientemente de la información que el modelo haya aprendido del resto de países.

En la evaluación global anterior, YOLOv11x encabezó la clasificación con un 74,25 % en mAP@50 y un 34,92 % en mAP@50:95, con una precisión del 83,37 %. Por su parte, YOLOv26s ofreció la mejor relación entre eficiencia y rendimiento, al alcanzar un 70,49 % en mAP@50 con 22,8 GFLOPs y 10 millones de parámetros; es decir, menos de cuatro puntos por debajo del modelo líder y utilizando aproximadamente 8,6 veces menos operaciones que YOLOv11x, que alcanzó 196,0 GFLOPs.

Las zonas de debilidad varían entre las familias de modelos

La comparación mostró que cuatro de las seis versiones de YOLO —YOLOv26s, YOLOv8m, YOLOv8s y YOLOv8n— fueron más débiles en el conjunto de imágenes estadounidenses. Estados Unidos representa el 43,8 % de las imágenes de prueba, lo que significa que la puntuación global de estos modelos se ve afectada en gran medida por el rendimiento en la región que gestionan peor, no necesariamente por el rendimiento en un país representativo.

YOLOv11x fue una excepción, ya que registró su peor rendimiento en Australia, mientras que el rendimiento más bajo de YOLOv26m se produjo en Japón. Por otro lado, Australia fue la zona de debilidad para las tres versiones de RF-DETR. Las diferencias entre el mejor y el peor país oscilaron entre 22,79 puntos para YOLOv26m y 44,38 puntos para RF-DETR Nano, según los valores incluidos en el análisis.

La precisión bruta no equivale a robustez entre dominios

YOLOv26m registró la diferencia más estrecha entre países, de 22,8 puntos, desde el 88,99 % en China hasta el 66,21 % en Japón, aunque no fue el modelo con la puntuación global más alta. YOLOv11x se aproximó con una diferencia de 23,1 puntos, lo que indica una mayor coherencia entre dominios en comparación con el resto de modelos.

En cambio, RF-DETR Nano obtuvo la diferencia más amplia, de 44,4 puntos, al pasar del 79,8 % en China al 35,4 % en Australia. Esta diferencia es mayor que el intervalo de variación entre los propios modelos en China, donde los resultados oscilaron entre el 79,8 % y el 92,4 %. En el caso concreto de este modelo, la fuente de las imágenes de despliegue puede influir más en el resultado que elegir otro modelo del conjunto.

El ejemplo de YOLOv26s y YOLOv8m demuestra la importancia de esta medición: sus resultados globales fueron similares, del 70,49 % y el 69,55 % en mAP@50, respectivamente, con una diferencia inferior a un punto; sin embargo, la diferencia entre su mejor y peor país varió en más de tres puntos, al alcanzar 25,3 puntos para el primero y 28,6 para el segundo. Según el análisis, una sola fila de resultados de evaluación global no puede mostrar esta diferencia de fiabilidad.

Limitaciones de la comparación y siguiente paso

El autor advierte que los resultados de Sudán y Japón no deben interpretarse con el mismo nivel de confianza que los de Estados Unidos o Australia, porque sus conjuntos son pequeños y un puñado de imágenes fáciles o difíciles puede influir más en el mAP. Además, la evaluación actual se realiza a nivel de país, no de patrón genético; el manifiesto utilizado incluye el país, la institución y la etapa de crecimiento, pero no incluye etiquetas de los patrones genéticos.

El siguiente paso incluye una evaluación dividida por etapa de crecimiento, después de unificar una diferencia en la escritura de una de las etiquetas entre “Post-flowering” y “Post-Flowering”, ya que probablemente se trata de una diferencia formal relacionada con el uso de mayúsculas y minúsculas. Las tarjetas de los modelos ahora incluyen una sección sobre el rendimiento por país, junto con los archivos country_breakdown.json y domain_metadata.json en el repositorio del conjunto. El autor confirmó que la versión y el análisis constituyen una evaluación independiente y no oficial basada en el trabajo de los autores del conjunto de datos original.

Fuente de la noticia
Hugging Face Blog
Abrir fuente original ↗
ف
Autor

فريق تحرير certi.news

De la misma categoría

También te puede interesar

Ver todas las noticias