Key points are not available for this paper at this time.
Décrire automatiquement le contenu d'une image est un problème fondamental en intelligence artificielle qui relie la vision par ordinateur et le traitement du langage naturel. Dans cet article, nous présentons un modèle génératif basé sur une architecture récurrente profonde qui combine les avancées récentes en vision par ordinateur et en traduction automatique, et qui peut être utilisé pour générer des phrases naturelles décrivant une image. Le modèle est entraîné pour maximiser la vraisemblance de la phrase de description cible donnée l'image d'entraînement. Des expériences sur plusieurs ensembles de données montrent la précision du modèle et la fluidité de la langue qu'il apprend uniquement à partir des descriptions d'images. Notre modèle est souvent assez précis, ce que nous vérifions à la fois qualitativement et quantitativement. Par exemple, alors que le score BLEU-1 actuel de l'état de l'art (plus c'est élevé, mieux c'est) sur l'ensemble de données Pascal est de 25, notre approche donne 59, à comparer à la performance humaine d'environ 69. Nous montrons également des améliorations de score BLEU-1 sur Flickr30k, de 56 à 66, et sur SBU, de 19 à 28. Enfin, sur le nouvel ensemble de données COCO récemment publié, nous atteignons un BLEU-4 de 27,7, qui est l'état de l'art actuel.
Vinyals et al. (Mon,) ont étudié cette question.
Synapse has enriched 4 closely related papers on similar clinical questions. Consider them for comparative context: