Key points are not available for this paper at this time.
Les modèles acoustiques utilisés dans les systèmes de reconnaissance vocale par modèle de Markov caché/réseau de neurones (HMM/NN) sont généralement formés avec un critère d'erreur d'entropie croisée basé sur des trames. En revanche, les systèmes HMM à mélange gaussien sont entraînés de manière discriminative en utilisant des critères basés sur les séquences, tels que l'erreur minimale de phonème ou l'information mutuelle maximale, qui sont plus directement liés à la précision de la reconnaissance vocale. Cet article démontre que les modèles acoustiques des réseaux de neurones peuvent être formés avec des critères de classification de séquences en utilisant exactement les mêmes méthodes basées sur des réseaux développées pour les HMM à mélange gaussien, et que l'utilisation d'un critère de classification de séquence dans l'entraînement conduit à des performances nettement meilleures. Un modèle acoustique de réseau de neurones avec 153K poids formé sur 50 heures d'actualités diffusées présente un taux d'erreurs de mots de 34,0 % sur l'ensemble de test d'actualités en anglais rt04. Lorsque ce modèle est formé avec le critère de risque de Bayes minimum au niveau de l'état, le taux d'erreur de mots rt04 est de 27,7 %.
Brian Kingsbury (2009) a étudié cette question.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: