Los puntos clave no están disponibles para este artículo en este momento.
El fenómeno de cambio de código (CS) ocurre cuando se alternan palabras o frases de diferentes idiomas en una sola oración. Debido a la escasez de datos, construir un sistema de Reconocimiento Automático de Voz (ASR) efectivo para CS sigue siendo un desafío. En este trabajo, proponemos mejorar los sistemas de CS-ASR utilizando ricos datos de voz monolingües no supervisados dentro de un marco de aprendizaje semi-supervisado, particularmente cuando el acceso a datos de CS es limitado. Para lograr esto, establecemos un paradigma general para aplicar el entrenamiento de estudiantes ruidosos (NST) a la tarea de CS-ASR. Específicamente, introducimos el LLM-Filter, que aprovecha plantillas de indicaciones bien diseñadas para activar la capacidad de corrección de los modelos de lenguaje grande (LLMs) para la selección de datos monolingües y el refinamiento de pseudo-etiquetas durante el NST. Nuestros experimentos en los conjuntos de datos supervisados ASRU-CS y no supervisados AISHELL-2 y LibriSpeech muestran que nuestro método no solo logra mejoras significativas sobre las líneas base de aprendizaje supervisado y semi-supervisado para la tarea de CS, sino que también alcanza un mejor rendimiento en comparación con el límite superior del oráculo totalmente supervisado en la parte en inglés de CS. Además, investigamos más a fondo la influencia del acento en el conjunto de datos AESRC y demostramos que nuestro método puede lograr beneficios adicionales cuando los datos monolingües contienen características lingüísticas relevantes.
Xi et al. (Jue,) estudiaron esta cuestión.