Key points are not available for this paper at this time.
L'apprentissage multimodal est prouvé supérieur à l'apprentissage unimodal. Cependant, dans la pratique, les réseaux unimodaux les plus performants surpassent souvent les réseaux multimodaux formés conjointement. Ce phénomène peut être attribué aux taux de convergence et de généralisation variés à travers les différentes modalités, menant à la domination d'une modalité et causant un sous-apprentissage des autres modalités dans un simple entraînement multimodal joint. Pour atténuer ce problème, nous proposons deux ingrédients clés : i) défaire l'apprentissage des caractéristiques unimodales et l'interaction multimodale à travers un bloc de fusion de représentations intermédiaires ; ii) moduler les logits des différentes modalités via des coefficients dynamiques pendant l'entraînement pour aligner leurs magnitudes avec les valeurs cibles, appelé modulation en ligne des logits (OLM). Remarkablement, l'OLM est agnostique au modèle et peut être intégré de manière transparente dans la plupart des cadres d'entraînement multimodal existants. Des preuves empiriques montrent que notre approche apporte des améliorations significatives par rapport aux références sur une large gamme de tâches multimodales, couvrant les modalités vidéo, audio, texte, image et profondeur.
Zong et al. (Ven,) ont étudié cette question.