Los puntos clave no están disponibles para este artículo en este momento.
Las imágenes son un portador importante de la expresión emocional. Los humanos pueden entender las emociones en las imágenes de manera fácil y rápida, mientras que es una tarea muy desafiante para las máquinas extraer emociones precisas. En este estudio, proponemos un novedoso modelo de predicción de emociones basado en atención espacial y por canal, SCEP, para ayudar a las computadoras a reconocer las emociones de las imágenes de manera más precisa. SCEP integra tanto la atención espacial como los mecanismos de peso por canal en una estructura de capa de red neuronal convolucional (CNN) clásica para predecir emociones de imágenes, basado en el hecho de que el mecanismo de atención espacial puede aumentar el contraste entre regiones salientes y potencialmente irrelevantes, y que el mecanismo de peso por canal puede enfatizar características informativas mientras suprime características menos útiles. El modelo SCEP produce valores emocionales en un espacio continuo de valencia y excitación 2-D, de modo que se pueden expresar más emociones que simplemente clasificando las emociones de manera discreta. Para validar la efectividad de nuestro modelo, utilizamos un conjunto de datos de imágenes existente con una distribución emocional generalizada para las pruebas. Experimentos extensos muestran que, en comparación con modelos base (es decir, VGG y ResNet) sin atención espacial o mecanismos por canal, SCEP puede mejorar la precisión de la predicción de emociones (evaluada por el coeficiente de correlación de concordancia) en ~ 3%-5% en el dominio de excitación, y en ~ 3-6% en el dominio de valencia. Por lo tanto, concluimos que utilizar SCEP puede brindar una mayor precisión en la predicción de emociones.
Li et al. (2021) estudiaron esta cuestión.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: