Los puntos clave no están disponibles para este artículo en este momento.
Varios trabajos recientes sobre síntesis de voz han empleado redes generativas antagónicas (GANs) para producir formas de onda en bruto. Aunque dichos métodos mejoran la eficiencia de muestreo y el uso de memoria, su calidad de muestra aún no ha alcanzado la de los modelos generativos autorregresivos y basados en flujo. En este trabajo, proponemos HiFi-GAN, que logra tanto síntesis de voz eficiente como de alta fidelidad. Dado que el audio de voz consiste en señales sinusoidales con varios períodos, demostramos que modelar patrones periódicos de un audio es crucial para mejorar la calidad de la muestra. Una evaluación humana subjetiva (puntuación media de opinión, MOS) de un conjunto de datos de un único hablante indica que nuestro método propuesto muestra similitud con la calidad humana mientras genera audio de alta fidelidad a 22.05 kHz 167.9 veces más rápido que en tiempo real en una sola GPU V100. Además, mostramos la generalidad de HiFi-GAN para la inversión de mel-espectrogramas de hablantes no vistos y la síntesis de voz de extremo a extremo. Finalmente, una versión de pequeña huella de HiFi-GAN genera muestras 13.4 veces más rápido que en tiempo real en CPU con calidad comparable a un contraparte autorregresiva.
Kong et al. (Mon,) estudiaron esta cuestión.