我们提出了一种用于大词汇量语音识别(LVSR)的新型上下文相关(CD)模型,该模型利用了近期在将深度信念网络用于音素识别方面取得的进展。我们描述了一种预训练深度神经网络隐马尔可夫模型(DNN-HMM)混合架构,该架构训练 DNN 以输出 senones(绑定三音素状态)的概率分布。深度信念网络预训练算法是一种稳健且通常十分有益的生成式初始化深度神经网络的方法,有助于优化并减少泛化误差。我们阐述了模型的关键组成部分,描述了将 CD-DNN-HMM 应用于 LVSR 的流程,并分析了各种建模选择对性能的影响。在一项具有挑战性的商业搜索数据集上的实验表明,CD-DNN-HMM 的性能显著优于传统的上下文相关高斯混合模型(GMM)-HMM;与分别使用最小音素错误率(MPE)和极大似然(ML)准则训练的 CD-GMM-HMM 相比,句子准确率绝对提升了 5.8% 和 9.2%(或相对误差分别降低了 16.0% 和 23.2%)。
Dahl et al. (Wed,) 对该问题进行了研究。
Synapse has enriched 4 closely related papers on similar clinical questions. Consider them for comparative context: