Key points are not available for this paper at this time.
O treinamento de modelos linguísticos torna-se cada vez mais caro com a escala, levando a inúmeras tentativas de melhorar a eficiência da otimização. Apesar destes esforços, o otimizador Adam continua a ser o mais amplamente utilizado, devido à visão predominante de que é a abordagem mais eficaz. Nosso objetivo é comparar vários algoritmos de otimização, incluindo SGD, Adafactor, Adam e Lion, no contexto da modelagem de linguagem autorregressiva em uma variedade de tamanhos de modelo, hiperparâmetros e variantes de arquitetura. Nossas descobertas indicam que, exceto pelo SGD, todos esses algoritmos apresentam desempenho comparável tanto em sua performance ótima quanto em termos de como se saem em uma ampla gama de escolhas de hiperparâmetros. Nossos resultados sugerem aos praticantes que a escolha do otimizador pode ser guiada por considerações práticas como restrições de memória e facilidade de implementação, já que nenhum algoritmo único se destacou como um vencedor claro em termos de desempenho ou estabilidade à má especificação de hiperparâmetros. Dadas nossas descobertas, analisamos ainda mais essas abordagens, examinando duas versões simplificadas do Adam: a) momentum assinado (Signum) que observamos recuperar tanto o desempenho quanto a estabilidade de hiperparâmetros do Adam e b) Adalayer, uma variante em camadas do Adam que introduzimos para estudar o pré-condicionamento do Adam. A análise do Adalayer nos leva à conclusão de que o maior impacto do pré-condicionamento do Adam está restrito à última camada e aos parâmetros de LayerNorm e, talvez surpreendentemente, as camadas restantes podem ser treinadas com SGD.
Zhao et al. (Quarta,) estudaram essa questão.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: