La dysarthrie, un trouble moteur de la parole caractérisé par une élocution indistincte et souvent incompréhensible, pose d'importants défis pour une communication efficace. Les systèmes conventionnels de reconnaissance vocale automatique ont souvent des performances insuffisantes sur la parole dysarthrique, en particulier dans les cas graves. Pour répondre à cette lacune, nous introduisons la transcription acoustique à faible latence et l'encodage textuel (LATTE), un cadre avancé conçu pour la reconnaissance en temps réel de la parole dysarthrique. LATTE intègre le prétraitement, le traitement acoustique et la cartographie de transcription dans un pipeline unifié, avec à sa base une architecture hybride qui combine des couches convolutionnelles pour l'extraction des caractéristiques acoustiques avec des couches temporelles bidirectionnelles pour modéliser les dépendances temporelles. Évalué sur le jeu de données UA-Speech, LATTE atteint un taux d'erreur de mots de 12,5 %, un taux d'erreur de phonèmes de 8,3 % et un taux d'erreur de caractères de 1 %. En permettant une transcription précise et à faible latence de la parole altérée, LATTE fournit une base solide pour améliorer la communication et l'accessibilité, tant dans les applications numériques que dans les environnements interactifs en temps réel.
Ain et al. (Mon,) ont étudié cette question.