自动化土豆收获需要满足严格操作约束的视觉系统:近乎零的土豆错误分类(PMR 60%)。尽管YOLOX支持实时处理,但在小物体检测方面显示出关键的性能限制。本文介绍了一种统一优化策略,结合训练级别的修改(P3特征增强、SimOTA参数优化和尺寸感知损失加权)与推理级别的阈值优化。基于包含232,000个注释的10,000张图像的实验结果表明,所有四种评估的方法都满足定义的操作约束。SimOTA成为最佳配置,提供了最高的小物体召回率(18.18%),同时保持PMR为0.06%和IDR为95.05%。P3特征增强实现了最低PMR(0.05%),SALW提供了平衡的性能(PMR 0.06%,IDR 96.11%),而P3+SimOTA组合在关键上失败(PMR 9.90%),揭示了优化组件之间的根本不兼容性。所有成功的配置均超过了实时处理要求(45-61 fps),确认其适合在资源受限的农业自动化系统中部署。
KIM 等(Sun,)研究了这个问题。