Key points are not available for this paper at this time.
Dans ce travail, nous développons une technique pour former des caractéristiques directement à partir de la forme d'onde de la parole à canal unique afin d'améliorer les performances de détection des mots de réveil (WW). Les systèmes de reconnaissance vocale conventionnels extraient généralement une représentation compacte des caractéristiques basée sur des connaissances préalables telles que l'énergie de la banque de filtres log-mel (LFBE). Une telle caractéristique est ensuite utilisée pour former un modèle acoustique (AM) de réseau de neurones profond (DNN). En revanche, nous formons directement le DNN AM WW à partir des données audio à canal unique de manière par étapes. Nous construisons d'abord un DNN d'extraction de caractéristiques avec une petite couche de goulot d'étranglement cachée, et formons cette représentation de caractéristiques de goulot d'étranglement en utilisant la même fonction de perte de cross-entropie multi-tâches que celle que nous utilisons pour former nos DNN WW. Ensuite, le DNN de classification WW est entraîné avec les caractéristiques de goulot d'étranglement en gardant les couches d'extraction de caractéristiques fixes. Enfin, les DNN d'extraction de caractéristiques et de classification sont combinés puis optimisés conjointement. Nous montrons l'efficacité de cette technique d'entraînement par étapes à travers une série d'expériences sur des données réelles de champ éloigné formées par faisceau. Les résultats des expériences montrent que le DNN d'entrée audio fournit des taux de non-détection significativement inférieurs pour une gamme de taux de fausse alarme par rapport au LFBE lorsque suffisamment de données d'entraînement sont disponibles, entraînant une amélioration relative d'environ 12 % de la surface sous la courbe (AUC).
Kumatani et al. (ven,) ont étudié cette question.