Key points are not available for this paper at this time.
Investigamos a continuidade do pré-treinamento de LLMs para adaptação de linguagem em um orçamento acadêmico apertado: um cenário no qual apenas algumas GPUs podem ser usadas em paralelo, por uma duração fortemente limitada. Focamos na adaptação do Mistral-7B para o alemão ou árabe e avaliamos várias técnicas para melhorar a eficiência e eficácia nesse contexto. Nossos modelos em alemão adaptados a esse orçamento computacional apertado têm desempenho inferior ao do Mistral-7B base, enquanto nossos modelos em árabe superam várias linhas de base, mostrando que, para idiomas suficientemente bem representados, a continuidade do pré-treinamento para especialização nem sempre é útil. Nossos principais achados se concentram na precisão do treinamento e na troca de tokenizadores. Nossos resultados mostram que o treinamento com bfloat16 puro é uma alternativa viável ao treinamento de precisão mista, sendo muito mais rápido ao usar apenas algumas GPUs. A troca do tokenizador por um especializado resulta em uma tokenização mais eficiente e é competitiva com o tokenizador original, que já contém alguns tokens em alemão, mas não aumentou significativamente o desempenho para o alemão. O código e os pesos do modelo estão disponíveis no GitHub.
Dobler et al. (Quarta-feira,) estudaram essa questão.