Key points are not available for this paper at this time.
La mesure dans laquelle les modèles de langage (LM) uniquement textuels apprennent à représenter les caractéristiques du monde non linguistique est une question ouverte. Des travaux antérieurs ont montré que les LM préentraînés peuvent être enseignés à légender des images lorsque les paramètres d'un modèle de vision sont optimisés pour encoder les images dans l'espace linguistique. Nous testons une hypothèse plus forte : que les représentations conceptuelles apprises par des modèles uniquement textuels figés et des modèles uniquement visuels sont suffisamment similaires pour que cela puisse être réalisé avec une cartographie linéaire. Nous montrons que les représentations d'image des modèles de vision peuvent être transférées comme des invites continues aux LM figés en formant uniquement une seule projection linéaire. En utilisant celles-ci pour inciter le LM, on obtient une performance compétitive sur les tâches de légendage et de réponse à des questions visuelles par rapport aux modèles qui ajustent à la fois l'encodeur d'images et le décodeur de texte (comme le modèle MAGMA). Nous comparons trois encodeurs d'images avec des quantités croissantes de supervision linguistique observées lors du pré-entraînement : BEIT (pas d'information linguistique), NF-ResNET (information sur la catégorie lexicale) et CLIP (descriptions en langage naturel complètes). Nous constatons que les trois encodeurs performent également bien pour transférer des informations sur les propriétés visuelles au modèle de langue (par exemple, si un animal est grand ou petit), mais que les encodeurs d'images préentraînés avec supervision linguistique codent plus saillamment les informations de catégorie (par exemple, faire la distinction entre hippopotame et éléphant) et réalisent ainsi des performances nettement meilleures sur les tâches de référence en langue et vision. Nos résultats indiquent que les LM codent l'information conceptuelle de manière structurellement similaire aux modèles basés sur la vision, même ceux qui sont exclusivement entraînés sur des images. Le code est disponible ici : https://github.com/jmerullo/limber
Merullo et al. (Fri,) ont étudié cette question.