Key points are not available for this paper at this time.
Redes neurais profundas (DNNs) utilizam uma cascata de representações ocultas para permitir o aprendizado de mapeamentos complexos de características de entrada para características de saída. Elas são capazes de aprender o mapeamento complexo de características linguísticas baseadas em texto para características acústicas da fala, realizando assim a síntese de texto para fala. Resultados recentes sugerem que as DNNs podem produzir fala sintética mais natural do que sistemas paramétricos estatísticos convencionais baseados em HMM. Neste artigo, mostramos que a representação oculta utilizada em uma DNN pode ser aprimorada através do uso de Aprendizado Multi-Tarefa, e que empilhar múltiplas camadas de ativações de camadas ocultas (características de gargalo empilhadas) também leva a melhorias. Resultados experimentais confirmaram a eficácia dos métodos propostos, e em testes de audição encontramos que características de gargalo empilhadas, em particular, oferecem uma melhoria significativa em relação a uma DNN padrão e a um sistema de referência HMM.
Wu et al. (Qua,) estudaram essa questão.