Los puntos clave no están disponibles para este artículo en este momento.
Los grandes modelos de lenguaje (LLMs) se entrenan típicamente en datos de origen generales para diversos dominios, pero un reciente auge en LLMs específicos de dominio ha mostrado su potencial para superar modelos de propósito general en tareas específicas de dominio (por ejemplo, biomedicina). Aunque el preentrenamiento específico de dominio mejora la eficiencia y conduce a modelos más pequeños, los costos computacionales de entrenar estos LLMs siguen siendo altos, lo que plantea desafíos presupuestarios. Introducimos MediSwift, un conjunto de LMs biomédicos que aprovechan el preentrenamiento disperso en datos de texto biomédicos específicos de dominio. Al inducir hasta un 75% de esparcimiento de pesos durante la fase de preentrenamiento, MediSwift logra una reducción de 2-2.5x en FLOPs de entrenamiento. Es notable que todo el preentrenamiento disperso se realizó en el sistema Cerebras CS-2, que está diseñado específicamente para realizar los beneficios de aceleración del esparcimiento de peso no estructurado, mejorando así significativamente la eficiencia de los modelos MediSwift. A través de un posterior ajuste fino denso y un prompting suave estratégico, los modelos MediSwift superan los LLMs existentes de hasta 7B parámetros en tareas biomédicas, estableciendo nuevos estándares en términos de eficiencia-precisión en tareas como PubMedQA. Nuestros resultados muestran que el preentrenamiento disperso, junto con el ajuste fino denso y el prompting suave, ofrece un método efectivo para crear modelos de alto rendimiento y computacionalmente eficientes en dominios especializados.
Thangarasa et al. (Fri,) estudiaron esta cuestión.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: