Key points are not available for this paper at this time.
Os sistemas para treinar modelos massivos de aprendizado profundo (bilhões de parâmetros) hoje assumem e requerem "hiper-clusters" especializados: centenas ou milhares de GPUs conectadas por interconexões de alta largura de banda, como NV-Link e Infiniband. Além de serem caras, essa dependência de hiper-clusters e interconexões personalizadas de alta velocidade limita o tamanho desses clusters, criando (a) limites de escalabilidade no paralelismo de trabalhos; (b) fragmentação de recursos entre hiper-clusters. Neste artigo, apresentamos o Varuna, um novo sistema que permite o treinamento de modelos massivos de aprendizado profundo em redes de consumo. O Varuna faz uso econômico dos recursos de rede e configura automaticamente o trabalho de treinamento do usuário para utilizar eficientemente qualquer conjunto de recursos. Portanto, o Varuna consegue aproveitar VMs de "baixa prioridade" que custam cerca de 5 vezes menos que GPUs dedicadas, reduzindo assim significativamente o custo do treinamento de modelos massivos. Demonstramos a eficácia do Varuna treinando modelos massivos, incluindo um modelo de 200 bilhões de parâmetros, em "spot VMs" 5 vezes mais baratas, mantendo alta taxa de transferência de treinamento. O Varuna melhora o tempo de treinamento de ponta a ponta em até 18 vezes em comparação com outras abordagens de modelo paralelo e em até 26% em comparação com outras abordagens de pipeline paralelo. O código para o Varuna está disponível em https://github.com/microsoft/varuna.
Athlur et al. (Sun,) estudaram essa questão.