La evaluación estética cuantitativa automatizada de obras de arte visual es una tarea interdisciplinaria desafiante que involucra visión por computadora e historia del arte. Los métodos tradicionales de evaluación estética se basan en características artesanales o modelos de aprendizaje profundo de rama única, que no logran capturar de manera integral los atributos artísticos multifacéticos (por ejemplo, armonía de color, equilibrio de composición, textura y estilo semántico) y dependencias globales a larga distancia críticas para la apreciación artística. Para abordar estas limitaciones, este documento propone un marco novedoso: Vision Transformer con Fusión de Características Artísticas Multi-Dimensionales (MDAF-ViT). Nuestro modelo integra un backbone jerárquico de Vision Transformer (ViT) para el modelado de contexto global con extractores de características de múltiples ramas para capturar atributos visuales de bajo nivel, reglas composicionales de nivel medio y características de estilo semántico de alto nivel. Una innovación clave es el módulo de Fusión de Atención Multi-Dimensional Dinámica (MDAF), que pondera y fusiona de manera adaptativa características artísticas heterogéneas. Experimentos extensos en conjuntos de datos estándar de estética del arte (BAID, APDDv2, JenAesthetics) demuestran que MDAF-ViT supera significativamente a los métodos de vanguardia basados en CNN y ViT, logrando un rendimiento superior en términos de Coeficiente de Correlación Lineal de Pearson (PLCC), Coeficiente de Correlación de Rangos de Spearman (SRCC) y Error Cuadrático Medio (MSE). Este trabajo proporciona una base robusta e interpretable para el análisis y la curaduría del arte digital a gran escala.
Zeyu Gao (2026) estudió esta cuestión.