Los puntos clave no están disponibles para este artículo en este momento.
Los avances recientes en la síntesis de voz observan beneficios significativos al aprovechar tokens discretos extraídos de modelos de aprendizaje autodirigido (SSL). Los tokens discretos ofrecen una mayor eficiencia de almacenamiento y una mejor operabilidad en representaciones intermedias en comparación con los espectrogramas Mel continuos tradicionales. Sin embargo, cuando se trata de la síntesis de voz cantada (SVS), lograr niveles más altos de expresión melódica plantea un gran desafío para utilizar tokens discretos. En este documento, presentamos TokSing, un sistema SVS basado en discretos equipado con un formulador de tokens que ofrece mezclas de tokens flexibles. Observamos una degradación melódica durante la discretización, lo que nos lleva a integrar una señal melódica con el token discreto e incorporar una estrategia de mejora melódica especialmente diseñada en el codificador musical. Experimentos extensos demuestran que nuestro TokSing logra un mejor rendimiento en comparación con las líneas base de espectrogramas Mel, al mismo tiempo que ofrece ventajas en el costo del espacio de representación intermedia y la velocidad de convergencia.
Wu et al. (Wed,) estudiaron esta cuestión.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: