Key points are not available for this paper at this time.
新兴的视频大型多模态模型(LMMs)在通用视频理解方面实现了显著的进步,形式为视觉问答(VQA),其中原始视频是由相机捕捉的。然而,现实应用中大量视频是编辑过的视频,例如,用户通常会在社交媒体平台上发布之前剪辑和添加特效/修改。编辑视频通常具有高观看次数,但它们未包含在现有的视频LMM基准测试中,即ActivityNet-QA或VideoChatGPT基准。在本文中,我们利用一个流行短视频平台上的编辑视频,即TikTok,建立了一个覆盖四个典型编辑类别的视频VQA基准(命名为EditVid-QA),即特效、搞笑、表情包和游戏。搞笑和表情包视频基准测试微妙的理解和高级推理,而特效和游戏则评估人工设计的理解能力。大多数开源视频LMM在EditVid-QA基准测试中的表现不佳,表明社交媒体上的编辑短视频与常规原始视频之间存在巨大领域差距。为了提高LMM的泛化能力,我们根据Panda-70M/WebVid原始视频和小规模的TikTok/CapCut编辑视频收集了一个用于拟议基准的训练集,这提升了在拟议的EditVid-QA基准上的表现,表明高质量训练数据的有效性。我们还发现了现有评估协议中的一个严重问题,使用GPT-3.5评审时,出现了“抱歉”攻击,即“抱歉”风格的天真回答可以从GPT评审那里获得极高的评分,例如,在VideoChatGPT评估协议中的正确性得分超过4.3。为了避免“抱歉”攻击,我们使用GPT-4评审和关键词过滤进行结果评估。数据集将仅用于学术目的发布.
Xu等人(周五)研究了这个问题。