Key points are not available for this paper at this time.
In diesem Papier stellen wir LLaVA-φ (LLaVA-Phi) vor, einen effizienten multi-modalen Assistenten, der die Macht des kürzlich fortgeschrittenen kleinen Sprachmodells Phi-2 nutzt, um multi-modale Dialoge zu erleichtern. LLaVA-Phi stellt einen bemerkenswerten Fortschritt im Bereich der kompakten multi-modalen Modelle dar. Es zeigt, dass selbst kleinere Sprachmodelle mit nur 2,7 Milliarden Parametern effektiv an komplexen Dialogen teilnehmen können, die sowohl textuelle als auch visuelle Elemente integrieren, vorausgesetzt, sie werden mit qualitativ hochwertigen Korpora trainiert. Unser Modell erzielt lobenswerte Leistungen bei öffentlich verfügbaren Benchmarks, die visuelles Verständnis, Schlussfolgerungen und wissensbasierte Wahrnehmung umfassen. Über seine bemerkenswerten Leistungen bei multi-modalen Dialogaufgaben hinaus eröffnet unser Modell neue Perspektiven für Anwendungen in zeitkritischen Umgebungen und Systemen, die Echtzeitan interaktionen erfordern, wie verkörperte Agenten. Es hebt das Potenzial kleinerer Sprachmodelle hervor, um anspruchsvolle Levels des Verständnisses und der Interaktion zu erreichen und gleichzeitig eine höhere Ressourceneffizienz aufrechtzuerhalten.
Zhu et al. (Sat,) haben diese Frage untersucht.