LLM의 높은 리소스 비용 문제로 인해 모델 압축 연구가 중요하다. 기존의 구조적 가지치기 방식은 목표 아키텍처를 미리 정의하므로 최적의 아키텍처를 얻는 데 한계가 있다. 이에 본 논문에서는 유전 알고리즘을 활용하여 구조적 가지치기 과정에서 최적 아키텍처를 자동으로 탐색하는 프레임워크를 제안한다. 본 방법은 총 파라미터 수 제약 하에 마스크를 학습하며, 소스 모델과의 로짓 유사도 최대화를 통해 지식을 보전하는 구조를 유전 알고리즘으로 탐색한다. Llama2-7B를 1.4B로 가지치기한 실험에서 Sheared Llama 대비 평균 약 1.5%의 성능 향상을 달성하였으며, 2.8B 확장 실험을 통해 모델 규모에 따른 최소 레이어 깊이 보존이 성능 유지에 결정적임을 확인하였다. 본 연구는 직관이나 관습에 의존하던 아키텍처 선택에서 벗어나 최적 구조를 체계적으로 탐색하는 방법론을 제안한다.
Kim et al. (Wed,) studied this question.