Los puntos clave no están disponibles para este artículo en este momento.
La detección de emociones tiene una importancia significativa en la facilitación de la interacción humano-computadora, mejorando la profundidad del compromiso. Al integrar esta capacidad, allanamos el camino para que las futuras tecnologías de IA posean una combinación de comprensión cognitiva y emocional, cerrando la brecha entre la funcionalidad de la máquina y la complejidad emocional humana. Este progreso tiene el potencial de transformar cómo las máquinas perciben y responden a las emociones humanas, dando paso a una era de sistemas artificiales empáticos e intuitivos. El principal desafío de investigación implica desarrollar modelos que puedan interpretar y analizar con precisión las emociones tanto de datos auditivos como textuales, donde los datos auditivos requieren la optimización de CNNs para detectar fluctuaciones emocionales sutiles e intensas en el habla, y los datos textuales exigen acceso a grandes y diversos conjuntos de datos para captar de manera efectiva las señales emocionales matizadas en el lenguaje escrito. Este documento introduce un enfoque novedoso para el reconocimiento emocional multimodal, integrando de manera fluida las modalidades de habla y texto para inferir estados emocionales con precisión. Empleando CNNs, analizamos meticulosamente el habla usando espectrogramas de Mel, mientras que un modelo basado en BERT procesa el componente textual, aprovechando sus capas bidireccionales para habilitar una comprensión semántica profunda. Las salidas de ambas modalidades se combinan utilizando un mecanismo de fusión basado en atención que pesa óptimamente sus contribuciones. El método propuesto aquí se somete a pruebas meticulosas en dos conjuntos de datos distintos: el conjunto de datos de Opinión Multimodal y Intensidad Emocional de la Universidad Carnegie Mellon (CMU-MOSEI) y el Conjunto de Datos de Líneas de Emoción Multimodal (MELD). Los resultados demuestran una eficacia superior en comparación con los marcos existentes, logrando una precisión del 88.4% y una puntuación F1 del 87.9% en el conjunto de datos CMU-MOSEI, y una notable precisión ponderada (WA) del 67.81% y una puntuación F1 ponderada (WF1) del 66.32% en el conjunto de datos MELD. Este sistema integral ofrece una detección precisa de emociones e introduce varios avances significativos en el campo.
Makhmudov et al. (Wed,) estudiaron esta cuestión.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: