Key points are not available for this paper at this time.
Plus récemment, les Représentations d'Encodeurs Bidirectionnels issues des Transformateurs (BERT) ont été proposées et ont connu un succès impressionnant dans de nombreuses tâches de traitement du langage naturel (NLP) telles que la réponse à des questions et la compréhension du langage, principalement grâce à son paradigme efficace de pré-entraînement puis d'ajustement fin ainsi qu'à sa forte capacité de modélisation contextuelle locale. En vue de ce qui précède, cet article présente une nouvelle instanciation des modèles de langage contextualisés basés sur BERT (LMs) pour une utilisation dans le reranking des meilleures hypothèses produites par la reconnaissance vocale automatique (ASR). À cette fin, nous encadrons le reranking des hypothèses N-meilleures avec BERT comme un problème de prédiction, dont le but est de prédire l'hypothèse oracle qui a le taux d'erreur de mot (WER) le plus bas donné les hypothèses N-meilleures (désigné par PBERT). En particulier, nous explorons également capitaliser sur les informations globales de sujets spécifiques à la tâche de manière non supervisée pour aider PBERT dans le reranking des hypothèses N-meilleures (désigné par TPBERT). Des expériences approfondies menées sur le corpus de référence AMI démontrent l'efficacité et la faisabilité de nos méthodes par rapport aux modèles autorégressifs conventionnels tels que le réseau de neurones récurrents (RNN) et une méthode récemment proposée qui a utilisé BERT pour calculer des scores de pseudo-vraisemblance (PLL) pour le reranking des hypothèses N-meilleures.
Chiu et al. (Mar,) ont étudié cette question.