Key points are not available for this paper at this time.
우리는 오디오 신호 내에서 '목표 이벤트가 발생한 시점'을 결정하는 것을 목표로 하는 '목표 음성 다이어리제이션'이라는 새로운 작업을 소개합니다. 우리는 관심 있는 목표 음성 이벤트를 지정하는 다양한 프롬프트와 함께 작동하는 '프롬프트 기반 목표 음성 다이어리제이션(PTSD)'이라는 신경망 아키텍처를 설계합니다. 우리는 Librispeech에서 파생된 sim2spk, sim3spk 및 sim4spk 데이터셋을 사용하여 PTSD를 학습하고 평가합니다. 제안된 프레임워크는 목표 음성 이벤트를 정확하게 로컬라이즈함을 보여줍니다. 또한, 우리의 프레임워크는 목표 화자 음성 활동 탐지, 중첩 음성 탐지 및 성별 다이어리제이션이라는 세 가지 다이어리제이션 관련 작업에서 인상적인 성능을 통해 다재다능성을 보여줍니다. 특히, PTSD는 실제 및 시뮬레이션 데이터 모두에서 이러한 작업에 대해 전문화된 모델과 유사한 성능을 달성합니다. 이 연구는 참조 벤치마크로 기능하며 프롬프트 기반 목표 음성 처리에 대한 귀중한 통찰을 제공합니다.
Jiang et al. (Mon,)가 이 질문을 연구했습니다.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: