Key points are not available for this paper at this time.
面部表情作为人类最具信息量的行为之一,通常是复合和多变的,这体现在不同的人可能用非常不同的方式表达相同的表情。然而,大多数面部表情识别(FER)方法仍然使用独热编码或软标签作为监督,这缺乏对面部表情的充分语义描述,并且可解释性较差。最近,对比视觉-语言预训练模型(如CLIP)使用文本作为监督,并为各种计算机视觉任务注入了新的活力,得益于文本中的丰富语义。因此,我们提出了CLIPER,一个基于CLIP的静态和动态表情识别统一框架。此外,我们引入了多种表情文本描述符(METD)来学习细粒度的表情表示,以及保留CLIP可解释性的一种两阶段训练范式。我们在多个流行的FER基准上进行了广泛实验,以证明CLIPER的有效性。源代码将很快在https://github.com/muse1998/CLIPER上提供。
Li et al. (Mon,)研究了这个问题。