Key points are not available for this paper at this time.
Die ASR-Fehlerkorrektur ist eine interessante Option zur Nachbearbeitung der Ausgaben von Spracherkennungssystemen. Diese Fehlerkorrekturmodelle werden normalerweise in überwachter Weise unter Verwendung der Dekodierungsergebnisse eines Ziel-ASR-Systems trainiert. Dieser Ansatz kann rechnerisch intensiv sein, und das Modell wird auf ein spezifisches ASR-System abgestimmt. Neuere generative große Sprachmodelle (LLMs) wurden auf eine Vielzahl von Aufgaben der natürlichen Sprachverarbeitung angewendet, da sie in einem Zero-Shot- oder Few-Shot-Verfahren arbeiten können. In diesem Papier untersuchen wir die Verwendung von ChatGPT, einem generativen LLM, zur ASR-Fehlerkorrektur. Basierend auf dem ASR N-best-Ausgang schlagen wir sowohl unbeschränkte als auch beschränkte Ansätze vor, bei denen ein Mitglied der N-best-Liste ausgewählt wird. Darüber hinaus werden Zero- und 1-Shot-Einstellungen bewertet. Experimente zeigen, dass dieser Ansatz mit generativen LLMs Leistungsgewinne für zwei verschiedene hochmoderne ASR-Architekturen, basierend auf Transducer und Attention-Encoder-Decoder, und mehrere Testsets erzielen kann.
Ma et al. (2023) haben diese Frage untersucht.