Multimodale Empfehlungen haben sich als vielversprechende Lösung erwiesen, um die Probleme des kalten Starts und der Sparsamkeit im kollaborativen Filtern zu lindern, indem sie reichhaltige Inhaltsinformationen wie Produktbilder und textuelle Beschreibungen integrieren. Die effektive Integration heterogener Modalitäten in ein einheitliches Empfehlungsframework bleibt jedoch eine Herausforderung. Bestehende Ansätze basieren häufig auf festen Fusionsstrategien oder komplexen Architekturen, die möglicherweise nicht auf die Qualitätsvariationen der Modalitäten angepasst werden können oder unnötigen Rechenaufwand verursachen. In dieser Arbeit schlagen wir RLMultimodalRec vor, ein leichtgewichtiges und modulares Empfehlungsframework, das graphbasierte Benutzermodellierung mit adaptiver multimodaler Elementkodierung kombiniert. Das Modell verwendet ein gated Fusion-Modul, um den Beitrag visueller und textueller Modalitäten dynamisch auszubalancieren, was eine feinkörnige und inhaltsbewusste Darstellung von Elementen ermöglicht. Gleichzeitig erfasst ein zweischichtiger LightGCN-Encoder hochordentliche kollaborative Signale, indem er Einbettungen über den Benutzer-Element-Interaktionsgraph propagiert, ohne auf nichtlineare Transformationen angewiesen zu sein. Wir bewerten unser Modell an einem realen Datensatz aus dem Amazon-Produktbereich. Experimentelle Ergebnisse zeigen, dass RLMultimodalRec konstant mehrere wettbewerbsfähige Baselines übertrifft, einschließlich kollaborativem Filtern, visuellem Bewusstsein und multimodalen GNN-basierten Methoden. Der vorgeschlagene Ansatz erzielt signifikante Verbesserungen bei den Top-K-Empfehlungsmetriken und bleibt dabei skalierbar und nachvollziehbar, wodurch er für die praktische Anwendung geeignet ist.
Liu et al. (Fri,) untersuchten diese Frage.