Key points are not available for this paper at this time.
Computer Vision (CV), Natural Language Processing (NLP) und Recommender Systems (RecSys) sind drei herausragende KI-Anwendungen, die traditionell unabhängig voneinander entwickelt wurden, was zu unterschiedlichen Modellierungs- und Ingenieurmethoden geführt hat. Dies hat die Möglichkeit behindert, dass diese Bereiche direkt von den Fortschritten der jeweils anderen profitieren. Mit der jüngsten Entwicklung von Grundmodellen sind große Sprachmodelle als potenzielles allgemeines Schnittstellenmodell entstanden, um verschiedene Modalitäten und Problemformulierungen zu vereinen. In Anbetracht dessen schlagen wir die Entwicklung eines multimodalen Grundmodells (MFM) vor, das visuelle, textuelle und personalisierte Modalitäten unter dem P5-Empfehlungsparadigma berücksichtigt, daher VIP5 (Visual P5) genannt, um verschiedene Modalitäten und Empfehlungsaufgaben zu vereinheitlichen. Dies wird die Verarbeitung mehrerer Modalitäten in einer gemeinsamen Architektur für verbesserte Empfehlungen ermöglichen. Um dies zu erreichen, führen wir multimodale personalisierte Prompts ein, um mehrere Modalitäten unter einem gemeinsamen Format zu berücksichtigen. Darüber hinaus schlagen wir eine parameter-effiziente Trainingsmethode für Grundmodelle vor, die das Einfrieren des P5-Rückgrats und das Feineinstellen leichter Adapter umfasst, was zu einer verbesserten Empfehlungsleistung und einer erhöhten Effizienz in Bezug auf Trainingszeit und Speicherauslastung führt. Der Code und die Daten von VIP5 sind verfügbar unter https://github.com/jeykigung/VIP5.
Geng et al. (Sun,) haben diese Frage untersucht.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: