Es wurden große Sprachmodelle (LLMs) mit unterschiedlichen Architekturen und Größen entwickelt. Die Verwendung von dedizierten GPUs für jedes LLM führt zu Ressourcenverschwendung und Dienstineffizienz aufgrund der unterschiedlichen Nachfrage von LLM-Anfragen. Eine gängige Praxis ist es, mehrere LLMs zu teilen. Bestehende Teilungssysteme berücksichtigen jedoch entweder nicht das autoregressive Muster von LLM-Diensten oder konzentrieren sich nur auf die Verbesserung des Durchsatzes, was die Teilungsleistung, insbesondere die Bedienlatenz, beeinträchtigt. Wir präsentieren SeaLLM, das dienstbewusste und latenzoptimierte LLM-Freigabe ermöglicht. SeaLLM verbessert die Gesamtleistung der Teilung durch (1) einen latenzoptimierten Planungsalgorithmus, der die Eigenschaften von LLM-Diensten nutzt, (2) einen Platzierungsalgorithmus zur Bestimmung des Platzierungsplans und einen adaptiven Ersetzungsalgorithmus zur Entscheidung über das Ersetzungsintervall und (3) einen einheitlichen Schlüssel-Wert-Cache, um den GPU-Speicher effizient zwischen LLM-Diensten zu teilen. Unsere Bewertung unter realen Nachverfolgungen und LLM-Diensten zeigt, dass SeaLLM die normalisierte Latenz um bis zu 13,60, die Tail-Latenz um bis zu 18,69 und die SLO-Einhaltung um bis zu 3,64 im Vergleich zu bestehenden Lösungen verbessert.
Zhao et al. (2025) untersuchten diese Frage.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: