Key points are not available for this paper at this time.
종단간 음성 번역 모델은 오류 전파를 줄일 수 있는 잠재력 덕분에 연구의 새로운 트렌드가 되었습니다. 그러나 이러한 모델은 여전히 데이터 부족의 문제에 직면해 있습니다. 비레이블된 데이터나 기계 번역의 기타 병렬 말뭉치를 효과적으로 사용하는 방법은 유망하지만 여전히 해결되지 않은 문제입니다. 본 논문에서는 음성-텍스트 번역을 위한 종단간 모델인 크로스 음성-텍스트 네트워크(Cross Speech-Text Network, XSTNet)를 제안합니다. XSTNet은 음성과 텍스트를 모두 입력으로 받아 전사 및 번역 텍스트를 모두 출력합니다. 이 모델은 세 가지 주요 설계 요소의 이점을 누립니다: 오디오 인코더로서의 자기 지도 사전 훈련된 서브 네트워크, 추가 병렬 이중 언어 텍스트를 활용하기 위한 다중 과제 훈련 목표, 점진적 훈련 절차입니다. 우리는 MuST-C En-X 및 LibriSpeech En-Fr 데이터 세트에서 XSTNet 및 기준 모델의 성능을 평가합니다. 특히, XSTNet은 모든 언어 방향에서 평균 BLEU 28.8로 최첨단 결과를 달성하며, 이전의 최적 방법보다 3.2 BLEU 향상되었습니다. 코드, 모델, 사례 및 더 자세한 분석은 https://github.com/ReneeYe/XSTNet에서 확인할 수 있습니다.
Ye et al. (수요일)은 이 질문을 연구했습니다.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: