Los puntos clave no están disponibles para este artículo en este momento.
El marco del codificador-decodificador neuronal se adopta ampliamente para la generación de subtítulos de imágenes naturales. Sin embargo, pocos trabajos han contribuido a la generación de subtítulos para imágenes culturales utilizando este esquema. En este documento, proponemos un modelo de subtitulado de imágenes enriquecido por tipo de obra de arte, donde el codificador representa una imagen de obra de arte de entrada como un vector de 512 dimensiones y el decodificador genera un subtítulo correspondiente basado en el vector de imagen de entrada. El tipo de obra de arte se predice primero mediante un clasificador de red neuronal convolucional y luego se integra en el decodificador. Investigamos múltiples enfoques para integrar el tipo de obra de arte en el modelo de subtitulado, entre los cuales se encuentra uno que aplica una suma ponderada paso a paso del vector de tipo de obra de arte y el vector de representación oculta del decodificador. Este modelo supera tres modelos básicos de subtitulado de imágenes para un conjunto de datos de subtitulado de imágenes de arte chino en todas las métricas de evaluación. Uno de los modelos básicos es un enfoque de vanguardia que fusiona atributos textuales de imagen en el modelo de subtitulado para imágenes naturales. El modelo propuesto también obtiene resultados promisorios para otro conjunto de datos de subtitulado de imágenes de arte egipcio.
Sheng et al. (Tue,) estudiaron esta cuestión.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: