Key points are not available for this paper at this time.
Großangelegte tiefe neuronale Netzwerke (DNNs), wie große Sprachmodelle (LLMs), haben das Feld der künstlichen Intelligenz (KI) revolutioniert und sind zunehmend populär geworden. Das Training oder Fine-Tuning solcher Modelle erfordert jedoch erhebliche Rechenleistung und Ressourcen, wobei die Speicherkapazität eines einzelnen Beschleunigungsgeräts wie einer GPU eines der wichtigsten Engpässe ist. Aufgrund des unverhältnismäßig hohen Overheads (z.B. 10×) von GPUs nativen Speichermanagern nutzen DNN-Frameworks wie PyTorch und TensorFlow einen Caching-Allokator, der einen Speicherpool mit einem Splittungsmechanismus zur schnellen Speicher-(De)Allokation verwaltet. Leider nimmt die Effizienz des Caching-Allokators schnell ab bei beliebten Speicherreduzierungstechniken wie Neuberechnung, Offloading, verteiltem Training und Niedrigrankanpassung. Der Hauptgrund dafür ist, dass diese Speicherreduzierungstechniken häufige und unregelmäßige Speicher-(De)Allokationsanfragen einführen, was zu schweren Fragmentierungsproblemen für den splittungsbasierten Caching-Allokator führt. Um dieses Fragmentierungsproblem zu mildern, schlagen wir ein neuartiges Speicherallokationsframework auf der Grundlage des Low-Level-GPU-virtuellen Speichermanagements vor, das als GPU-Speicherseen (GMLake) bezeichnet wird. GMLake verwendet einen neuartigen Mechanismus zum virtuellen Speichermanagement (VMS), der nicht zusammenhängende Speicherblöcke mit einer virtuellen Speicheradresszuordnung zusammenfügen oder kombinieren kann. GMLake kann den durchschnittlichen GPU-Speicherverbrauch um 9,2 GB (bis zu 25 GB) und die Fragmentierung um 15 % (bis zu 33 %) bei acht LLM-Modellen auf der GPU A100 mit 80 GB Speicher reduzieren. GMLake ist für die DNN-Modelle und Speicherreduzierungstechniken vollständig transparent und gewährleistet die nahtlose Ausführung ressourcenintensiver Deep-Learning-Aufgaben. Wir haben GMLake unter https://github.com/intelligent-machine-learning/glake/tree/main/GMLake als Open Source veröffentlicht.
Guo et al. (Mon,) haben diese Frage untersucht.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: