Key points are not available for this paper at this time.
Kürzlich haben multimodale große Sprachmodelle (MM-LLMs) in vielen multimodalen Aufgaben große Erfolge erzielt, aber ihre hohen Betriebskosten schränken ihre weitere Förderung und Anwendung ein. Im Rahmen der MM-LLMs ist der Hauptschritt mit hohen Rechenkosten die Verarbeitung concatenierter Text- und visueller Tokens auf der LLM-Schicht. Die Länge des Eingabetokens für das LLM beeinflusst direkt die gesamte Trainings- und Inferenz-Effizienz. Um dieses Problem anzugehen, haben wir die visuellen Tokens der MM-LLMs weiter untersucht. Wir fanden heraus, dass die Ähnlichkeit zwischen visuellen und CLS-Tokens im visuellen Encoder einer Langschwanzverteilung folgt. Mit anderen Worten, nur wenige visuelle Tokens sind hochgradig ähnlich zu CLS-Tokens. Daher haben wir einen dynamischen Pruning-Algorithmus entwickelt, um dieses Problem zu lösen. Zunächst suchen wir für verschiedene Eingabemuster den Wendepunkt ihrer Ähnlichkeitskurve der visuellen CLS-Tokens und verwenden ihn als entsprechenden Segmentierungspunkt, um die visuellen Markierungen zu trimmen. Dieser Prozess reduziert hauptsächlich die Ausgabe des visuellen Encoders, um das Modell zu beschleunigen. Dann werden in der LLM-Schicht die concatenierten visuellen Texttokens ein zweites Mal beschnitten. Während dieses Prozesses werden, aufgrund der Interaktion zwischen visuellen und textlichen Merkmalen, visuelle und textliche Tokens mit niedriger Textkorrelation weiter gefiltert, um ein Gleichgewicht zwischen Effizienz und Leistung zu erreichen. Die Ergebnisse auf mehreren Datensätzen zeigen, dass unsere vorgeschlagene Methode eine Leistung erzielen kann, die mit der ursprünglichen Leistung konkurriert, wenn im Durchschnitt 22 % der ursprünglichen Tokenmenge verwendet werden. Unser Quellcode wird nach der Annahme öffentlich verfügbar gemacht.
Yu et al. (2024) haben diese Frage untersucht.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: