Key points are not available for this paper at this time.
자동 회귀 대형 언어 모델(LLMs)의 배치는 비용이 많이 들며, 이러한 모델의 크기가 증가함에 따라 관련 비용도 더욱 상당해질 것입니다. 따라서 토큰 생성 프로세스를 가속화하고 비용을 줄이기 위한 다양한 방법이 제안되었습니다. 추측 디코딩(SD)은 여러 토큰을 병렬로 검증하고 보조적인 작은 초안 모델을 사용하여 가능한 토큰을 생성함으로써 LLM 디코딩 프로세스를 가속화하는 가장 유망한 접근 방식 중 하나입니다. SD에서는 일반적으로 하나의 초안 모델이 특정 타겟 모델을 위해 사용되지만, 실제로 LLM은 다양하고 여러 타겟 모델이나 두 개 이상의 타겟 모델을 동시에 다뤄야 할 수도 있습니다. 이 시나리오에서는 어떤 초안 모델이 어떤 타겟 모델에 사용되어야 하는지 명확하지 않으며, 다양한 초안 모델을 탐색하거나 맞춤형 초안 모델을 훈련하는 것은 배치 비용을 더욱 증가시킬 수 있습니다. 본 논문에서는 먼저 더 빠른 추론을 위한 초안 모델 배치의 새로운 다중 타겟 시나리오를 소개합니다. 그런 다음 다중 타겟 설정에서 정규 기준선을 능가하는 새로운 더 효율적인 정렬된 추측 디코딩 메커니즘을 제시합니다. 우리는 Vicuna 7B, 13B 및 LLama Chat 70B와 같은 기본 모델을 포함하는 다양한 설정에서 Spec-Bench에서 우리의 방법을 평가했습니다. 우리의 결과는 우리의 초안 모델이 동시에 여러 타겟 모델에 대해 기준선보다 더 잘 수행된다는 것을 시사합니다.
Kavehzadeh et al. (2024)은 이 질문을 연구했습니다.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: