Introducción: Predecir las respuestas emocionales de los espectadores a estímulos visuales se ha convertido en un tema central en la computación afectiva, con numerosos modelos de aprendizaje profundo propuestos para estimar distribuciones emocionales a partir de imágenes generales. Sin embargo, las imágenes artísticas presentan un desafío único debido a su naturaleza abstracta, rica variación estilística y las profundamente subjetivas reacciones emocionales que evocan. Los esfuerzos existentes se centran en gran medida en imágenes naturales o fotográficas, dejando la predicción de distribuciones emocionales en pinturas artísticas poco explorada. Métodos: Para cerrar esta brecha, proponemos ArtFusionNet, un novedoso marco de aprendizaje profundo multimodal diseñado para predecir distribuciones emocionales a partir de pinturas artísticas. Nuestro marco integra y fusiona características visuales alineadas a múltiples niveles y espacialmente para formar una representación emocional integral. Específicamente, combina características perceptuales y características semánticas de alto nivel con incrustaciones de estilo artístico derivadas de etiquetas de estilo discretas. Estas características heterogéneas se unifican en una sola representación utilizada para predecir un vector de distribución emocional de 9 dimensiones. Resultados: Los resultados experimentales en el conjunto de datos ArtEmis demuestran que ArtFusionNet supera significativamente a varios modelos base fuertes. Los estudios de ablación revelan además los roles complementarios de las pistas texturales de bajo nivel y el contexto estilístico en la mejora de la sensibilidad a matices emocionales sutiles en el arte. Discusión: Nuestro enfoque introduce un camino espacialmente consciente y estilísticamente enriquecido para la comprensión afectiva del arte visual, contribuyendo con nuevas perspectivas al relativamente subrepresentado dominio de la predicción de distribuciones emocionales para imágenes artísticas. Conclusión: En este documento, propusimos ArtFusionNet, un innovador marco de aprendizaje profundo que integra de manera única características multimodales para predecir distribuciones emocionales subjetivas a partir de pinturas artísticas. Al aprovechar la semántica global de un transformador visual, los detalles perceptuales locales de un codificador VAE y los prior contextuales de incrustaciones de estilo aprendibles, nuestro modelo captura efectivamente la complejidad y subjetividad de las emociones evocadas por el arte.
Li et al. (2026) estudiaron esta cuestión.