Las leyes de escalado para modelos de lenguaje grandes en dominios de lenguaje natural se derivan típicamente bajo la suposición de que el rendimiento está principalmente limitado por el cómputo. En contraste, los modelos de lenguaje de anticuerpos (AbLMs) entrenados en secuencias emparejadas están limitados principalmente por los datos, lo que requiere consideraciones diferentes. Para explorar cómo el tamaño del modelo y la escala de datos afectan el rendimiento de los AbLM, entrenamos 15 AbLMs en todas las combinaciones de tamaño de modelo y tamaños de datos de entrenamiento. A partir de estos experimentos, derivamos una ley de escalado específica para AbLM y estimamos que entrenar un AbLM óptimo en datos equivalente al altamente eficaz modelo de lenguaje de proteínas ESM-2 de 650 millones de parámetros requeriría aproximadamente 5.5 millones de secuencias de anticuerpos emparejadas. La evaluación en múltiples tareas de clasificación reveló que las ganancias de rendimiento significativas solo surgieron con un tamaño de modelo suficientemente grande, lo que sugiere que en dominios limitados por datos, la mejora del rendimiento depende conjuntamente tanto de la escala del modelo como del volumen de datos.
Neyestanak et al. (Sat,) estudiaron esta cuestión.