Key points are not available for this paper at this time.
Les humains ont des préférences cross-modales claires lorsqu'ils associent certains mots nouveaux à des formes visuelles. Les preuves suggèrent que ces préférences jouent un rôle prépondérant dans notre traitement linguistique, l'apprentissage des langues et les origines des mappings signal-signification. Avec l'émergence des modèles multimodaux en IA, tels que les modèles vision-langage (VLM), il devient de plus en plus important de découvrir les types d'associations visio-linguistiques que ces modèles encodent et si elles s'alignent avec les représentations humaines. Informés par des expériences humaines, nous explorons et comparons quatre VLM pour une préférence cross-modale humaine bien connue, l'effet bouba-kiki. Nous ne trouvons pas de preuves concluantes pour cet effet mais suggérons que les résultats peuvent dépendre des caractéristiques des modèles, telles que la conception de l'architecture, la taille du modèle et les détails de l'entraînement. Nos résultats éclairent les discussions sur les origines de l'effet bouba-kiki dans la cognition humaine et les développements futurs de VLM qui s'alignent bien avec les associations cross-modales humaines.
Verhoef et al. (Jeu,) ont étudié cette question.