Resumen Los modelos de lenguaje grandes (LLMs) han demostrado un rendimiento impresionante en diversos dominios. Sin embargo, el enorme número de parámetros del modelo hace que el ajuste fino sea un desafío, limitando significativamente su aplicación y despliegue. Las soluciones existentes combinan la cuantización de parámetros con la Adaptación de Bajo Rango (LoRA), reduciendo el uso de memoria pero causando una degradación en el rendimiento. Además, convertir modelos ajustados a representaciones de baja precisión degrada aún más el rendimiento. En este documento, identificamos un desequilibrio en el ajuste fino de LLMs cuantizados con LoRA: entradas y salidas del adaptador excesivamente complejas frente a una capacidad de entrenamiento efectiva baja del adaptador, lo que lleva a un subajuste durante el ajuste fino. Por lo tanto, proponemos el ajuste fino de LLMs cuantizados con Adaptación de Bajo Rango Balanceada (Q-BLoRA), que simplifica las entradas y salidas del adaptador mientras aumenta el rango del adaptador para aliviar el subajuste durante el ajuste fino. Para el despliegue de baja precisión, proponemos el ajuste fino consciente de cuantización con Adaptación de Bajo Rango Balanceada (QA-BLoRA), que se alinea con la cuantización por bloques y facilita el ajuste fino consciente de cuantización de la adaptación de bajo rango basado en la fusión de parámetros de Q-BLoRA. Tanto Q-BLoRA como QA-BLoRA son fáciles de implementar y ofrecen las siguientes optimizaciones: (i) Q-BLoRA logra consistentemente una precisión de vanguardia en comparación con las líneas base y otras variantes; (ii) QA-BLoRA permite la generación directa de modelos de inferencia de baja precisión, que exhiben mejoras de rendimiento significativas sobre otros modelos de baja precisión. Validamos la efectividad de Q-BLoRA y QA-BLoRA en diversos modelos y escenarios. El código está disponible en https://github.com/xiaocaigou/qbaraqahira.
Shen et al. (Wed,) estudiaron esta cuestión.