Key points are not available for this paper at this time.
基于运动表达的视频分割是一项具有挑战性的任务,旨在根据包含运动描述的自然语言表达对视频中的对象进行分割。与之前的参考视频对象分割(RVOS)不同,该任务更加关注视频内容中的运动,要求增强建模更长时间段的运动导向视觉-语言数据的能力。在本报告中,我们基于RVOS方法,成功引入了从视频实例分割模型获得的掩模信息作为时间增强的初步信息,并使用了SAM进行空间细化。最后,我们的方法在验证阶段达到了49.92 J&F的得分,在测试阶段达到了54.20 J&F,最终在CVPR 2024 PVUW挑战赛的MeViS赛道中获得第二名的排名。
曹等人(星期三)研究了这个问题。