Key points are not available for this paper at this time.
Das Wachstum der sozialen Medien, gekennzeichnet durch ihre multimodale Natur, hat zur Entstehung vielfältiger Phänomene und Herausforderungen geführt, die einen effektiven Ansatz erfordern, um automatisierte Aufgaben einheitlich zu lösen. Die leistungsstarken großen Vision-Sprachmodelle ermöglichen es, eine Vielzahl von Aufgaben gleichzeitig zu bearbeiten, aber selbst mit sorgfältig gestalteten Aufforderungsmethoden scheitern die allgemeinen Domänenmodelle oft daran, sich mit dem einzigartigen Sprechstil und Kontext von Aufgaben der sozialen Medien in Einklang zu bringen. In diesem Papier stellen wir ein großes Vision-Sprachmodell für die Verarbeitung von sozialen Medien (SoMeLVLM) vor, das ein kognitives Rahmenwerk mit fünf Schlüsselkapazitäten ausgestattet ist, darunter Wissen & Verständnis, Anwendung, Analyse, Bewertung und Kreation. SoMeLVLM ist darauf ausgelegt, realistisches Verhalten in sozialen Medien zu verstehen und zu generieren. Wir haben ein multimodales Daten-Set mit 654.000 Anweisungen für die Feinabstimmung in sozialen Medien entwickelt, um unser kognitives Rahmenwerk zu unterstützen und unser Modell zu optimieren. Unsere Experimente zeigen, dass SoMeLVLM in mehreren Aufgaben der sozialen Medien eine erstklassige Leistung erzielt. Weitere Analysen zeigen seine erheblichen Vorteile gegenüber Baselines in Bezug auf kognitive Fähigkeiten.
Zhang et al. (Dienstag) haben diese Frage untersucht.