Key points are not available for this paper at this time.
이 논문은 영어 음성을 독일어 텍스트로 실시간으로 번역하기 위한 IWSLT 2024 동시 음성 번역(SST) 작업에 대한 CMU의 제출 내용을 설명합니다. 우리의 end-to-end 음성-텍스트(ST) 시스템은 WavLM 음성 인코더, 모달리티 어댑터, 및 Llama2-7B-Base 모델을 디코더로 통합합니다. 우리는 두 단계의 훈련 접근 방식을 사용합니다: 처음에 음성과 텍스트의 표현을 정렬한 후, 전체 미세 조정을 진행합니다. 두 단계 모두 교차 엔트로피 손실을 사용하여 MuST-c v2 데이터에 대해 훈련됩니다. 우리는 간단한 고정 hold-n 정책을 사용하여 오프라인 ST 모델을 SST에 맞게 조정합니다. 실험 결과, 우리 모델은 MuST-C-v2 tst-COMMON에서 오프라인 BLEU 점수 31.1 및 2초 이하의 대기 시간에서 BLEU 점수 29.5를 달성합니다.
Xu et al. (수요일,)은 이 질문을 연구했습니다.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: