Key points are not available for this paper at this time.
在过去三年中,最大的密集型深度学习模型增长了1000倍,达到了数千亿个参数,而GPU内存仅增长了5倍(从16 GB增至80 GB)。因此,模型规模的增长主要依赖系统创新,使大型模型能够适应多个GPU的总GPU内存。然而,我们已接近GPU内存壁垒。仅训练一个万亿参数模型就需要800个NVIDIA V100 GPU,而这样的集群对于大多数数据科学家来说几乎不可得。此外,以该规模训练模型需要复杂的并行技术组合,这对数据科学家重新构建模型造成了巨大负担。在本文中,我们介绍了ZeRO-Infinity,这是一种新颖的异构系统技术,利用GPU、CPU和NVMe内存,在有限资源上实现前所未有的模型规模,而无需重构模型代码。同时,它在训练吞吐量和可扩展性上表现优异,不受有限的CPU或NVMe带宽的限制。ZeRO-Infinity可以容纳数十万亿的参数用于在当前一代GPU集群上进行训练。它可以用于在单个NVIDIA DGX-2节点上微调万亿参数模型,使大型模型更易于获取。在训练吞吐量和可扩展性方面,它在512个NVIDIA V100 GPU上持续超过25 petaflops(达峰值的40%),同时展示了超线性可扩展性。ZeRO-Infinity的开源实现可以通过DeepSpeed获得,这是一个深度学习优化库,使分布式训练变得简单、高效和有效。
Rajbhandari等人(周五)研究了这个问题。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: