Key points are not available for this paper at this time.
说话人识别算法受输入语音信号质量的负面影响。在这项工作中,我们通过明智地结合两种常用特征:梅尔频率倒谱系数(MFCC)和线性预测编码(LPC),解决严重退化的音频数据中的说话人识别问题。我们的假设基于以下观察:MFCC和LPC捕捉了语音的两个不同方面,即语音感知和语音生成。我们使用精心设计的1D三元组卷积神经网络(1D-Triplet-CNN)以新的方式结合这两种特征,从而提高在具有挑战性的场景中说话人识别的性能。对多个数据集、不同类型的音频退化、多语种语音、不同长度的音频样本等的广泛评估表明,所提方法在现有说话人识别方法(包括基于iVector和xVector的方法)中的有效性。
Chowdhury等人(周一)研究了这个问题。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: