Key points are not available for this paper at this time.
视频序列中的动态面部表情识别(DFER)由于表情之间的细微差别和数据集固有的不平衡性而面临重大挑战。本研究提出了一种新方法,利用大规模对比视觉语言预训练(VLP)模型,特别是CLIP和ALIGN,以解决这些问题。我们引入了两个关键创新:(1)一种基于概念的语言-视觉特征学习方法,以及(2)一种基于概念的样本重平衡技术。前者通过选择细粒度的文本概念(例如微笑的嘴唇、眯眼的眼睛)并使用CLIP构建相应的视觉概念,改进了传统的文本-图像匹配。这种方法通过在训练过程中进行视觉概念反向查找,实现精确融合,增强视觉表示中的语义信息。后者通过为欠代表性表情合成额外样本,并减少过代表性类别中的冗余,解决了数据集不平衡问题。我们的方法在三个基准数据集上进行了评估:DFEW、MAFW和FERV39k。结果表明,与现有方法相比,DFER系统的准确性和鲁棒性显著提高。
Liang等人(周六)研究了这个问题。