Los puntos clave no están disponibles para este artículo en este momento.
Investigamos la continuación del preentrenamiento de LLMs para la adaptación del lenguaje con un presupuesto académico ajustado: un escenario en el que solo se pueden utilizar algunas GPU en paralelo, durante una duración muy restringida. Nos enfocamos en adaptar Mistral-7B al alemán o árabe y evaluamos varias técnicas para mejorar la eficiencia y efectividad en este entorno. Nuestros modelos alemanes adaptados con este presupuesto computacional restringido tienen un rendimiento inferior en comparación con el Mistral-7B base, mientras que nuestros modelos árabes superan varias líneas de referencia, mostrando que para idiomas representados de manera suficiente, la continuación del preentrenamiento para la especialización no siempre es útil. Nuestros hallazgos principales se centran en la precisión del entrenamiento y el intercambio de tokenizadores. Nuestros resultados muestran que el entrenamiento puro en bfloat16 es una alternativa viable al entrenamiento de precisión mixta, siendo mucho más rápido al usar solo algunas GPU. Cambiar el tokenizador por uno especializado produce una tokenización más eficiente y es competitivo con el tokenizador original, que ya contiene algunos tokens en alemán, pero no aumentó significativamente el rendimiento para el alemán. El código y los pesos del modelo están disponibles en GitHub.
Dobler et al. (Mié,) estudiaron esta cuestión.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: