Los Modelos de Lenguaje Grandes (LLMs) están compuestos por neuronas que exhiben varios comportamientos y roles, los cuales se diversifican cada vez más a medida que los modelos escalan. Estudios recientes han revelado que no todas las neuronas están activas en diferentes conjuntos de datos, y esta escasez correlaciona positivamente con la capacidad específica de la tarea, lo que lleva a avances en la poda de modelos y la eficiencia en el entrenamiento. Los métodos tradicionales de ajuste fino involucran todos los parámetros de los LLMs, lo que es computacionalmente costoso y puede no ser necesario. En contraste, los enfoques de Ajuste Fino Eficiente en Parámetros (PEFT) buscan minimizar el número de parámetros ajustables, pero aún operan a una escala relativamente macro (por ejemplo, a nivel de capa). Introducimos el Ajuste Fino a Nivel de Neurona (NeFT), un enfoque novedoso que refina la granularidad del entrenamiento de parámetros hasta la neurona individual, permitiendo actualizaciones de modelos más precisas y computacionalmente eficientes. Los resultados experimentales muestran que NeFT no solo superó el rendimiento del ajuste fino de parámetros completos y PEFT, sino que también proporcionó ideas sobre el análisis de neuronas.
Xu et al. (Mon,) estudiaron esta cuestión.