Inteligência artificial

Além da pontuação geral: como as diferenças entre países revelam a confiabilidade dos modelos de detecção de espigas de trigo

Uma reavaliação de nove modelos de detecção de espigas de trigo mostra que a média geral de mAP pode ocultar grandes diferenças de desempenho entre países. A China liderou em todos os modelos, enquanto as áreas de fraqueza variaram entre YOLO e RF-DETR, tornando essencial medir a transferência entre domínios antes da implantação em campo.

2026-08-11
6 min de leitura
7 visualizações
فريق تحرير certi.news
Além da pontuação geral: como as diferenças entre países revelam a confiabilidade dos modelos de detecção de espigas de trigo

Os resultados de uma nova avaliação estratificada de modelos de detecção de espigas de trigo revelam que classificar os modelos pela média geral de desempenho não oferece um quadro completo de sua confiabilidade no uso em campo. Nove modelos treinados no Global Wheat Head Dataset 2021 (GWHD) foram novamente testados por país, e os resultados mostraram diferenças claras de desempenho entre os domínios geográficos, mesmo quando as pontuações gerais eram próximas.

A análise, publicada pelo usuário Saumya Saksena sob o nome dronefreak no blog do Hugging Face em 11 de agosto de 2026, dá continuidade a uma versão anterior de código aberto que abrangia nove modelos de detecção de objetos: YOLOv8, YOLOv11, YOLOv26 e RF-DETR, com versões de nano a x-large. Os modelos foram treinados e ajustados usando o GWHD 2021, um conjunto de dados criado a partir de imagens de campo de espigas de trigo coletadas em seis países e 18 instituições de pesquisa, com o objetivo de diversificar os padrões genéticos, os estágios de crescimento e as condições de captura.

Teste separado para cada país

A análise utilizou um manifesto específico para cada imagem, associando as imagens do conjunto de teste ao país e ao estágio de crescimento. O autor explicou que essa associação não fazia parte da versão original do GWHD, mas foi criada para esta análise a partir dos metadados dos domínios. Também foi executado novamente o mesmo mecanismo de avaliação usado nos resultados gerais: model.val() da Ultralytics para a família YOLO e MeanAveragePrecision da biblioteca supervision para os modelos RF-DETR.

De um total de 1.382 imagens no conjunto de teste, não foi possível identificar o país de uma imagem devido a um problema de duplicação do nome do arquivo nos dados de origem; por isso, a imagem foi excluída em vez de ser atribuída de forma estimada. As comparações basearam-se em 1.381 imagens distribuídas entre os Estados Unidos, com 605 imagens; a Austrália, com 281; o México, com 205; a China, com 200; o Japão, com 60; e o Sudão, com 30 imagens.

A China lidera o desempenho de todos os modelos

A China obteve o resultado mais alto em mAP@50 para todos os nove modelos, sem exceção, com resultados variando de 79,78% para o RF-DETR Nano a 92,36% para o YOLOv11x. A análise relaciona esse resultado ao fato de o domínio chinês ser um dos maiores e visualmente mais consistentes do conjunto de dados, reunindo duas instituições e 200 imagens. A homogeneidade dentro do domínio pode tornar a avaliação nele mais fácil, independentemente das informações que o modelo tenha aprendido com os demais países.

Na avaliação geral anterior, o YOLOv11x liderou com 74,25% em mAP@50 e 34,92% em mAP@50:95, com precisão de 83,37%. Já o YOLOv26s ofereceu o melhor equilíbrio entre eficiência e desempenho, alcançando 70,49% em mAP@50 com 22,8 GFLOPs e 10 milhões de parâmetros, menos de quatro pontos abaixo do modelo líder e usando cerca de 8,6 vezes menos operações que o YOLOv11x, que atingiu 196,0 GFLOPs.

As áreas de fraqueza variam entre as famílias de modelos

A comparação mostrou que quatro das seis versões do YOLO, nomeadamente YOLOv26s, YOLOv8m, YOLOv8s e YOLOv8n, foram mais fracas no conjunto de imagens dos Estados Unidos. Os Estados Unidos representam 43,8% das imagens de teste, o que significa que a pontuação geral desses modelos é fortemente influenciada pelo desempenho na região com a qual lidam pior, e não necessariamente pelo desempenho em um país típico.

O YOLOv11x foi uma exceção, registrando seu pior desempenho na Austrália, enquanto o pior desempenho do YOLOv26m ocorreu no Japão. Por outro lado, a Austrália foi a área de fraqueza para todas as três versões do RF-DETR. As diferenças entre o melhor e o pior país variaram de 22,79 pontos para o YOLOv26m a 44,38 pontos para o RF-DETR Nano, de acordo com os valores apresentados na análise.

Precisão bruta não equivale a robustez entre domínios

O YOLOv26m apresentou a menor diferença entre os países, de 22,8 pontos, variando de 88,99% na China a 66,21% no Japão, embora não tenha obtido a maior pontuação geral. O YOLOv11x ficou próximo, com uma diferença de 23,1 pontos, indicando maior consistência entre os domínios em comparação com os demais modelos.

Em contrapartida, o RF-DETR Nano apresentou a maior diferença, de 44,4 pontos, passando de 79,8% na China para 35,4% na Austrália. Essa diferença é maior que a faixa de variação entre os próprios modelos na China, onde os resultados variaram de 79,8% a 92,4%. Especificamente para esse modelo, a origem das imagens de implantação pode ter mais influência no resultado do que a escolha de outro modelo do conjunto.

O exemplo entre YOLOv26s e YOLOv8m mostra a importância dessa medição: suas pontuações gerais foram próximas, 70,49% e 69,55% em mAP@50, com uma diferença inferior a um ponto, mas a diferença entre o melhor e o pior país variou em mais de três pontos, alcançando 25,3 pontos para o primeiro e 28,6 para o segundo. De acordo com a análise, uma única linha de resultados da avaliação geral não consegue revelar essa diferença de confiabilidade.

Limitações da comparação e próximo passo

O autor alerta contra a interpretação dos resultados do Sudão e do Japão com o mesmo nível de confiança usado para os Estados Unidos ou a Austrália, pois seus conjuntos são pequenos, e algumas imagens fáceis ou difíceis podem influenciar o mAP em maior medida. Além disso, a avaliação atual é feita no nível do país, e não do padrão genético; o manifesto utilizado inclui o país, a instituição e o estágio de crescimento, mas não inclui rótulos dos padrões genéticos.

O próximo passo inclui uma avaliação dividida por estágio de crescimento, após a padronização de uma diferença na escrita de um dos rótulos entre “Post-flowering” e “Post-Flowering”, pois é provável que a diferença seja apenas formal e esteja relacionada à capitalização. As fichas dos modelos passaram a incluir uma seção de desempenho por país, juntamente com os arquivos country_breakdown.json e domain_metadata.json no repositório do conjunto. O autor confirmou que a versão e a análise constituem uma avaliação independente e não oficial, baseada no trabalho dos autores originais do conjunto de dados.

Fonte da notícia
Hugging Face Blog
Abrir fonte original ↗
ف
Autor

فريق تحرير certi.news

Na mesma categoria

Você também pode gostar

Ver todas as notícias