La síntesis de texto a voz en streaming sin disparos es un tema de investigación importante en la interacción humano-computadora. Los métodos existentes utilizan principalmente un mecanismo de anticipación, que depende del texto futuro para lograr una síntesis de voz en streaming natural, lo que introduce una alta latencia de procesamiento. Para abordar este problema, proponemos SMLLE, un marco de streaming para generar voz de alta calidad cuadro por cuadro. SMLLE emplea un Transductor para convertir texto en tokens semánticos en tiempo real, mientras obtiene simultáneamente información de alineación de duración. Las salidas combinadas se alimentan a un modelo de streaming completamente autorregresivo (AR) para reconstruir mel-espectrogramas. Para estabilizar aún más el proceso de generación, diseñamos un Mecanismo de Eliminación que permite al modelo AR acceder al texto futuro con el mínimo retraso posible. Los resultados experimentales sugieren que SMLLE supera a los métodos actuales de TTS en streaming y logra un rendimiento comparable con los sistemas de TTS a nivel de oraciones. Las muestras están disponibles en shy-98.github.io/SMLLEdemoₚage/.
Sun et al. (Mon,) estudiaron esta cuestión.