目的多摄像头多目标跟踪(Multi-Camera Multi-Object Tracking, MC-MOT)在视频监控与自动驾驶中具有重要应用,但现有方法常因跨视角遮挡导致特征不连续,往往不得不依赖复杂的后端图优化算法进行补偿。方法本文提出一种基于强时空表征的统一感知框架,通过在特征提取阶段深度融合时空信息,得到高质量的目标特征,提升目标跟踪的效果。首先,利用包含相机内参和外参的几何投影模块,将多视角的2D图像特征提升并融合至统一的3D鸟瞰图(Bird’s-Eye-View, BEV)空间。其次,设计一种窗口化时空融合模块,利用交叉注意力机制让当前帧 BEV 特征(Query, Q)在局部窗口内动态聚合历史帧特征(Key/Value,K/V),实现特征去噪与时序平滑。最后,结合具有鲁棒性的时空表征,采用基于运动模型的简单卡尔曼滤波配合匈牙利算法,完成高精度的跨帧数据关联。结果在 Wildtrack 多视角数据集上的实验结果表明,该方法取得了极具竞争力的性能,其中 IDF1 为92.23%,相比基线提升2.04%,MOTA 为89.70%,提升1.8%,同时在 MultiviewX 上依然取得先进的跟踪结果。消融实验显示了引入窗口化时空融合模块的有效性。结论本文提出的强时空表征统一感知框架有效解决了多摄像头多目标跟踪中的特征对齐与长时遮挡问题。研究证明,端到端时空表征的构建在MC-MOT任务中展现出显著的性能增益,高质量的特征使得基础关联算法足以应对复杂的关联挑战,为该领域提供了一种高效、简洁的新基准。本文相关代码与数据集已在ScienceDB开放共享,DOI:https://doi.org/10.57760/sciencedb.j00240.00082
Jiawei et al. (Thu,) studied this question.