Los puntos clave no están disponibles para este artículo en este momento.
El rendimiento de CLIP en la tarea de reconocimiento de expresiones faciales dinámicas (DFER) no arroja resultados excepcionales como se observa en otras tareas de clasificación basadas en CLIP. Si bien el objetivo principal de CLIP es lograr la alineación entre imágenes y texto en el espacio de características, DFER presenta desafíos debido a la naturaleza abstracta del texto y la naturaleza dinámica del video, lo que limita la representación de etiquetas y dificulta la alineación perfecta. Para abordar este problema, hemos diseñado A^3lign-DFER, que introduce un nuevo paradigma de etiquetado DFER para lograr una alineación integral, mejorando así la idoneidad de CLIP para la tarea DFER. Específicamente, nuestro método A^3lign-DFER está diseñado con múltiples módulos que trabajan juntos para obtener las incrustaciones de dimensión expandida más adecuadas para la clasificación y lograr la alineación en tres aspectos clave: afectivo, dinámico y bidireccional. Reemplazamos el texto de la etiqueta de entrada con un Token de Alineación Multi-Dimensional (MAT) aprendible, lo que permite la alineación del texto con muestras de video de expresiones faciales en ambas dimensiones, afectivas y dinámicas. Después de la extracción de características de CLIP, introducimos el Sincronizador de Alineación Dinámica Conjunta (JAS), facilitando aún más la sincronización y alineación en la dimensión temporal. Además, implementamos un Paradigma de Entrenamiento de Alineación Bidireccional (BAP) para asegurar un entrenamiento gradual y constante de los parámetros para ambas modalidades. Nuestro método A^3lign-DFER, perspicaz y conciso, logra resultados de vanguardia en múltiples conjuntos de datos DFER, incluyendo DFEW, FERV39k y MAFW. Experimentos de ablación extensos y estudios de visualización demuestran la efectividad de A^3lign-DFER. El código estará disponible en el futuro.
Tao et al. (Jue,) estudiaron esta cuestión.