Los puntos clave no están disponibles para este artículo en este momento.
Mostramos por primera vez que los modelos de la familia de transformadores generativos preentrenados a gran escala (GPT) pueden ser podados a al menos 50% de sparsidad en una sola oportunidad, sin necesidad de reentrenamiento, con una pérdida mínima de precisión. Esto se logra a través de un nuevo método de poda llamado SparseGPT, diseñado específicamente para funcionar de manera eficiente y precisa en modelos masivos de la familia GPT. Podemos ejecutar SparseGPT en los modelos de código abierto más grandes disponibles, OPT-175B y BLOOM-176B, en menos de 4.5 horas, y alcanzar un 60% de sparsidad no estructurada con un aumento negligente en la perplejidad: de manera notable, más de 100 mil millones de pesos de estos modelos pueden ser ignorados en el tiempo de inferencia. SparseGPT se generaliza a patrones semi-estructurados (2:4 y 4:8), y es compatible con enfoques de cuantización de pesos. El código está disponible en: https://github.com/IST-DASLab/sparsegpt.
Frantar et al. (Mon,) estudiaron esta cuestión.