Los puntos clave no están disponibles para este artículo en este momento.
La correspondencia imagen-texto es una tarea vital de cross-modalidad en inteligencia artificial y ha atraído una atención creciente en los últimos años. Trabajos existentes han demostrado que aprender conceptos semánticos es útil para mejorar la representación de imágenes y puede mejorar significativamente el rendimiento tanto de la recuperación imagen-a-texto como de texto-a-imagen. Sin embargo, los modelos existentes simplemente detectan conceptos semánticos de una imagen dada, que son menos propensos a abordar conceptos de cola larga y de oclusión. Los conceptos que co-ocurren con frecuencia en la misma escena, por ejemplo, dormitorio y cama, pueden proporcionar conocimiento de sentido común para descubrir otros conceptos relacionados semánticamente. En este artículo, desarrollamos un Grafo de Conceptos de Escena (SCG) al agregar grafos de escena de imágenes y extrayendo pares de conceptos que co-ocurren con frecuencia como conocimiento de sentido común de la escena. Además, proponemos un modelo novedoso para incorporar este conocimiento para mejorar la correspondencia imagen-texto. Específicamente, los conceptos semánticos se detectan de las imágenes y luego se expanden mediante el SCG. Después de aprender a seleccionar conceptos contextuales relevantes, fusionamos sus representaciones con la característica de incrustación de la imagen para alimentarlo en el módulo de coincidencia. Se realizan amplios experimentos en los conjuntos de datos de Flickr30K y MSCOCO, y se demuestra que nuestro modelo logra resultados de vanguardia debido a la efectividad de incorporar el SCG externo.
Shi et al. (Sun,) estudiaron esta cuestión.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: