이 연구는 언어 모델(LM)의 관점에서 음성 향상(SE)을 조사합니다. 우리는 직접 선호 최적화(DPO)를 활용하여 향상된 음성의 지각 품질을 개선하는 새로운 방법을 제안합니다. 인간 평가에 대한 대리로 신경 MOS 예측 모델인 UTMOS를 사용하여, 우리의 접근 방식은 지각적으로 선호되는 출력으로 최적화를 안내합니다. 이는 기존의 LM 기반 SE 방법과 다르며, 기존 방법은 깨끗한 음성 토큰의 가능성을 극대화하는 것에 초점을 맞추어 인간의 지각과 불일치할 수 있으며, 예측 오류가 낮더라도 품질이 저하될 수 있습니다. 2020년 깊은 소음 억제 챌린지 테스트 세트에 대한 실험 결과 DPO를 사전 훈련된 LM 기반 SE 모델에 적용할 경우 다양한 음성 품질 메트릭에서 일관된 개선이 이루어지며 최대 56%의 상대적 이득을 보여줍니다. 우리가 아는 한, 이는 SE에 DPO를 첫 번째로 적용한 것이며, LM 기반 SE 훈련에 지각적 피드백을 통합한 첫 번째 사례로, 지각적으로 정렬된 SE를 위한 유망한 방향을 제시합니다.
Li et al. (Mon,)은 이 질문을 연구했습니다.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: