Key points are not available for this paper at this time.
대규모 언어 모델(LLM)은 최근 많은 언어 처리 작업을 해결하기 위한 강력한 도구로 등장했습니다. 그들의 성공에도 불구하고, 이러한 모델의 훈련과 미세 조정은 여전히 너무 많은 계산 및 메모리를 요구합니다. 본 논문에서는 기울기 하강법을 사용하여 효과적인 모델 수렴에 필요한 중요한 구성 요소를 식별하고 특성화합니다. 이렇게 함으로써, 역전파를 구현하는 데 사용되는 중간 활성화를 성능 저하 없이 과도하게 압축할 수 있다는 것을 발견했습니다. 이 결과는 미세 조정 및 사전 훈련 LLM을 위한 저렴하고 메모리 효율적인 알고리즘으로 이어집니다. 제안된 알고리즘은 토큰을 작은 서브-토큰으로 나눈 후, 순전파 중에 고정된 1차원 서브스페이스에 투영합니다. 그런 다음 이러한 기능은 역전파 중에 거칠게 재구성되어 업데이트 규칙을 구현합니다. 우리는 알고리즘의 효과성이 VTAB-1k 미세 조정 기준에서 많은 최첨단 PEFT 방법과 상호 보완적임을 확인합니다. 게다가 우리는 LLaMA의 미세 조정에 대해 QLoRA를 능가하며, 대규모 C4 데이터셋에서 다른 메모리 효율적인 사전 훈련 방법에 대해 경쟁력 있는 성능을 보여줍니다.
Miles 외(화요일)는 이 문제를 연구했습니다.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: