Los puntos clave no están disponibles para este artículo en este momento.
El análisis del comportamiento afectivo humano ha recibido mucha atención en la interacción humano-computadora (HCI). En este artículo, presentamos nuestra contribución a la Competencia ABAW sobre Análisis del Comportamiento Afectivo en el mundo real (ABAW) de CVPR 2022. Para explotar completamente el conocimiento afectivo desde múltiples perspectivas, utilizamos las características multimodales de palabras habladas, prosodia del habla y expresiones faciales, que se extraen de los clips de video en el conjunto de datos Aff-Wild2. Basado en estas características, proponemos un marco unificado multimodal basado en transformadores para la detección de Unidades de Acción y también para el reconocimiento de expresiones. Específicamente, la característica de visión estática se codifica primero a partir de la imagen del fotograma actual. Al mismo tiempo, cortamos sus fotogramas adyacentes mediante una ventana deslizante y extraemos tres tipos de características multimodales de la secuencia de imágenes, audio y texto. Luego, introducimos un módulo de fusión basado en transformadores que integra las características de visión estática y las características multimodales dinámicas. El módulo de atención cruzada en el módulo de fusión hace que las características integradas de salida se concentren en las partes cruciales que facilitan las tareas de detección posteriores. También aprovechamos algunas técnicas de balanceo de datos, técnicas de aumento de datos y métodos de posprocesamiento para mejorar aún más el rendimiento del modelo. En la prueba oficial de la Competencia ABAW3, nuestro modelo ocupa el primer lugar en las categorías EXPR y AU. Las extensas evaluaciones cuantitativas, así como los estudios de ablación en el conjunto de datos Aff-Wild2, demuestran la efectividad de nuestro método propuesto.
Zhang et al. (Wed,) estudiaron esta cuestión.