摘要 零售环境中杂货商品的识别和管理传统上依赖于基于条形码的系统,这些系统需要大量人工干预,且未能充分利用现有的监控基础设施。基于计算机视觉的方法为自动化商品识别提供了一种极具前景的替代方案。然而,许多现有的杂货数据集仍然相对同质化,或在规模、地理多样性或真实场景变异性方面存在局限。为了支持更贴合实际的评估环境,我们展示了一个从印度多个邦的八家商店收集的大规模杂货数据集。该数据集包含跨越 349 个商品类别的逾 13,000 张图像,并涵盖了密集的货架陈列、遮挡、视角变化和视觉模糊等实际零售挑战。我们的贡献不在于单独解决这些挑战的创新性,而在于将它们系统地整合在一个统一且多样化的数据集框架中。我们还引入了一种基于全尺度特征学习(omni-scale feature learning)的轻量级商品识别流程,旨在平衡表征能力与计算效率。所提出的模型在该数据集上实现了 58.3 的 mAP@0.50、72.9% 的精确率以及 77.9% 的召回率,在保持紧凑架构的同时展现了具有竞争力的性能。与已有基准模型的全面比较进一步在更广泛的文献背景下明确了我们的贡献。总体而言,这项工作为实际零售部署提供了一个多样化的评估基准和一个高效的检测框架。
Sah et al. (Tue,) 对该问题进行了研究。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: