Key points are not available for this paper at this time.
La motivation de cette étude est la mauvaise performance des reconnaisseurs de la parole sur les consonnes occlusives. Pour surmonter cette faiblesse, les consonnes occlusives en début et en fin de mot sont modélisées à un niveau subphonémique (microsegmental). Chaque consonne occlusive est segmentée en quelques microsegments relativement stationnaires : silence, barre vocale, explosion et aspiration. Les microsegments de certaines occlusives phonémiquement différentes sont entraînés ensemble en raison de leurs propriétés spectrales similaires. Les modèles microsegmentaux d'explosion et d'aspiration sont conditionnés sur la catégorie de voyelle adjacente : voyelles antérieures versus voyelles non antérieures. Les modèles de Markov cachés (HMM) microsegmentaux dépendants du contexte pour six occlusives possèdent les propriétés souhaitées pour un compromis entre précision de modélisation et robustesse de modélisation. Ils permettent au reconnaisseur de concentrer la discrimination sur les régions d'une occlusive qui servent à la distinguer des autres occlusives. L'utilisation de ces modèles dans des expériences de reconnaissance pour des listes de mots composées de mots CVC réduit le taux d'erreur de 35 % par rapport au résultat obtenu en utilisant un HMM pour chaque phonème occlusif.
Deng et al. (Fri,) ont étudié cette question.