一项针对小麦穗检测模型开展的新分层评估结果显示,按照总体平均性能对模型进行排序,无法完整反映其在实际应用中的可靠性。研究根据国家对在 Global Wheat Head Dataset 2021 (GWHD) 数据集上训练的九个模型进行了重新测试,结果表明,不同地理领域之间的性能存在明显差异,即使总体分数相近也是如此。
该分析由用户 Saumya Saksena 以 dronefreak 的名义于 2026 年 8 月 11 日发布在 Hugging Face 博客上,是此前一次开源发布的后续工作。此前的发布涵盖九个目标检测模型:YOLOv8、YOLOv11、YOLOv26 和 RF-DETR,版本范围从 nano 到 x-large。模型使用 GWHD 2021 进行训练和调优。该数据集由来自六个国家和 18 家研究机构的小麦穗田间图像构成,旨在涵盖多样的遗传类型、生长阶段和拍摄条件。
按国家分别测试
该分析使用了一个按图像划分的清单,将测试集图像与国家和生长阶段关联起来。作者说明,这种关联并不属于 GWHD 的原始发布内容,而是根据领域元数据为本次分析创建的。研究还重新运行了总体结果中使用的同一评估引擎:YOLO 系列使用 Ultralytics 的 model.val(),RF-DETR 模型使用 supervision 库的 MeanAveragePrecision。
测试集中共有 1,382 张图像,其中一张图像由于源数据中存在文件名重复问题,无法确定其所属国家;因此研究排除了该图像,而没有进行推测性归属。比较基于 1,381 张图像展开,分别包括美国 605 张、澳大利亚 281 张、墨西哥 205 张、中国 200 张、日本 60 张和苏丹 30 张。
中国在所有模型中均居首
中国在九个模型的 mAP@50 上均取得最高结果,没有例外,得分范围从 RF-DETR Nano 的 79.78% 到 YOLOv11x 的 92.36%。分析将这一结果与中国领域在数据集中规模较大且视觉一致性较高联系起来,该领域包含两家机构和 200 张图像。领域内部的同质性可能使其更易于评估,而不论模型从其他国家学习了哪些信息。
在此前的总体评估中,YOLOv11x 以 74.25% 的 mAP@50、34.92% 的 mAP@50:95 和 83.37% 的精确率位居首位。YOLOv26s 则提供了最佳的效率与性能折中,在 22.8 GFLOPs 和 1,000 万个参数的条件下取得 70.49% 的 mAP@50,与最高分模型相差不到四个百分点,同时所需运算量约为 YOLOv11x 的 1/8.6;后者为 196.0 GFLOPs。
两类模型的薄弱地区不同
比较结果显示,六个 YOLO 版本中的四个,即 YOLOv26s、YOLOv8m、YOLOv8s 和 YOLOv8n,在美国图像集上的表现最弱。美国占测试图像的 43.8%,这意味着这些模型的总体分数在很大程度上受到其表现最差地区的影响,而不一定反映典型国家的表现。
YOLOv11x 是一个例外,其表现最弱的地区是澳大利亚;而 YOLOv26m 的最弱表现出现在日本。另一方面,澳大利亚是三个 RF-DETR 版本共同的薄弱地区。根据分析中的数值,最佳国家与最差国家之间的差距从 YOLOv26m 的 22.79 个百分点到 RF-DETR Nano 的 44.38 个百分点不等。
原始精度不等于跨领域稳健性
YOLOv26m 在不同国家之间的差距最小,为 22.8 个百分点,从中国的 88.99% 到日本的 66.21%,尽管它并不是总体结果最高的模型。YOLOv11x 也接近这一表现,差距为 23.1 个百分点,这表明与其他模型相比,它在不同领域之间具有更好的一致性。
相比之下,RF-DETR Nano 的差距最大,为 44.4 个百分点,从中国的 79.8% 降至澳大利亚的 35.4%。这一差距大于中国各模型之间的差异范围,后者的结果介于 79.8% 和 92.4% 之间。对于这一模型而言,部署图像的来源可能比从该组中选择另一个模型对结果的影响更大。
YOLOv26s 与 YOLOv8m 之间的例子说明了这一测量的重要性:两者的总体结果相近,mAP@50 分别为 70.49% 和 69.55%,差距不到一个百分点;但两者最佳国家与最差国家之间的差距相差三个百分点以上,前者为 25.3 个百分点,后者为 28.6 个百分点。根据分析,仅凭一行总体评估结果无法呈现这种可靠性差异。
比较的局限与下一步
作者提醒,不应以解读美国或澳大利亚结果时所使用的相同信心来解读苏丹和日本的结果,因为这两个国家的样本集较小,少量容易或困难的图像可能会对 mAP 产生更大影响。此外,当前评估是在国家层面进行的,而不是在遗传类型层面进行的;所使用的清单包含国家、机构和生长阶段信息,但不包含遗传类型标签。
下一步将是在统一一个标签书写差异后,按生长阶段进行分组评估:该标签分别写作“Post-flowering”和“Post-Flowering”,预计这只是形式上的差异,与字母大小写有关。模型卡现已加入按国家划分的性能部分,数据集存储库中还包含 country_breakdown.json 和 domain_metadata.json 两个文件。作者确认,该发布版本和分析属于独立的非官方评估,建立在原始数据集作者的工作之上。