Key points are not available for this paper at this time.
Redes neurais profundas possibilitaram avanços em uma ampla variedade de aplicações. Aumentar o tamanho da rede neural geralmente resulta em maior precisão. À medida que os tamanhos dos modelos crescem, também aumentam os requisitos de memória e computação para treinar esses modelos. Introduzimos uma técnica para treinar redes neurais profundas utilizando números de ponto flutuante de meia precisão. Em nossa técnica, pesos, ativações e gradientes são armazenados no formato de meia precisão IEEE. Números de ponto flutuante de meia precisão têm um intervalo numérico limitado em comparação com números de precisão simples. Propomos duas técnicas para lidar com essa perda de informação. Primeiramente, recomendamos manter uma cópia de precisão simples dos pesos que acumula os gradientes após cada passo do otimizador. Essa cópia de precisão simples é arredondada para o formato de meia precisão durante o treinamento. Em segundo lugar, propomos escalar a perda adequadamente para lidar com a perda de informação com gradientes de meia precisão. Demonstramos que essa abordagem funciona para uma ampla variedade de modelos, incluindo redes neurais convolucionais, redes neurais recorrentes e redes adversariais generativas. Essa técnica funciona para modelos em larga escala com mais de 100 milhões de parâmetros treinados em grandes conjuntos de dados. Usando essa abordagem, podemos reduzir o consumo de memória dos modelos de aprendizado profundo em quase 2x. Em processadores futuros, também podemos esperar um aumento significativo na velocidade de computação usando unidades de hardware de meia precisão.
Micikevicius et al. (Terça,) estudaram essa questão.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: