Key points are not available for this paper at this time.
최근 대규모 언어 모델(LLM) 및 다중 모달 대규모 언어 모델(MLLM)의 개발은 주의 기반 트랜스포머 아키텍처를 활용하여 우수한 성능과 일반화 능력을 달성하였습니다. 이들은 이후 전통적인 학습 작업의 광범위한 영역을 다루게 되었습니다. 예를 들어, 텍스트 분류 및 시퀀스 레이블링과 같은 텍스트 기반 작업, 그리고 이전에는 다른 모델을 사용하여 다루었던 시각 질문 응답(VQA) 및 광학 문자 인식(OCR)과 같은 다중 모달 작업은 이제 단일 기반 모델을 바탕으로 해결될 수 있습니다. 따라서 LLM 및 MLLM, 특히 트랜스포머 아키텍처 기반 모델의 훈련과 경량 미세 조정이 특히 중요해졌습니다. 이러한 압도적인 필요를 인식하여, 우리는 대규모 모델을 위한 사용자 맞춤형 원스톱 인프라인 SWIFT를 개발하였습니다. 300개 이상의 LLM과 50개 이상의 MLLM을 지원하는 SWIFT는 대규모 모델의 미세 조정을 위해 가장 포괄적인 지원을 제공하는 오픈 소스 프레임워크로 자리 잡았습니다. 특히, MLLM에 대한 체계적인 지원을 제공하는 첫 번째 훈련 프레임워크입니다. 미세 조정의 핵심 기능 외에도, SWIFT는 추론, 평가 및 모델 양자화와 같은 훈련 후 프로세스를 통합하여 다양한 응용 시나리오에서 대규모 모델의 빠른 채택을 촉진합니다. 다양한 훈련 기술의 체계적 통합으로, SWIFT는 대규모 모델을 위한 서로 다른 훈련 기술 간의 벤치마크 비교와 같은 유용한 유틸리티를 제공합니다. 에이전트 프레임워크에 특화된 모델의 미세 조정을 위해, 우리는 SWIFT에서 사용자 맞춤 형 데이터 세트로 훈련함으로써 ToolBench 리더보드에서 주목할 만한 개선을 달성할 수 있음을 보여주며, 다양한 기준 모델에 대해 Act. EM 지표에서 5.2%-21.8% 증가, 환각 감소 1.6%-14.1%, 평균 성능 개선 8%-17%를 기록하였습니다.
Zhao et al. (Sat,)는 이 질문을 연구하였습니다.