Los puntos clave no están disponibles para este artículo en este momento.
La síntesis de texto a voz (TTS) en cero disparos tiene como objetivo clonar la voz de cualquier orador no visto sin parámetros de adaptación. Al cuantificar la forma de onda del habla en tokens acústicos discretos y modelar estos tokens con el modelo de lenguaje, los modelos TTS recientes basados en modelos de lenguaje muestran capacidades de adaptación del orador en cero disparos con solo un prompt acústico de 3 segundos de un orador no visto. Sin embargo, están limitados por la duración del prompt acústico, lo que dificulta clonar el estilo personal de habla. En este trabajo, proponemos un nuevo modelo TTS en cero disparos con prompts acústicos de múltiples escalas basado en un modelo de lenguaje. Se propone un codificador de texto consciente del orador para aprender el estilo personal de habla a nivel de fonema a partir del prompt de estilo que consta de múltiples oraciones. Después de eso, se utiliza un decodificador acústico basado en VALL-E para modelar el timbre a partir del prompt de timbre a nivel de cuadro y generar habla. Los resultados experimentales muestran que nuestro método propuesto supera las líneas base en términos de naturalidad y similitud con el orador, y puede lograr un mejor rendimiento al expandirse a un prompt de estilo más largo.
Lei et al. (Mon,) estudiaron esta cuestión.
Synapse has enriched 3 closely related papers on similar clinical questions. Consider them for comparative context: