Key points are not available for this paper at this time.
文本转语音(TTS)方法在语音克隆方面表现出良好的前景,但它们需要大量标记的文本-语音对。最小监督的语音合成通过结合两种离散语音表示(语义和声学)并使用两个序列到序列任务来解耦 TTS,从而实现最小监督的训练。然而,现有方法在语义表示中存在信息冗余和维度爆炸的问题,在离散声学表示中则存在高频波形失真的问题。自回归框架表现出典型的不稳定性和不可控性问题,而非自回归框架则受到由持续时间预测模型引起的韵律平均化的困扰。为了解决这些问题,我们提出了一种基于扩散模型的最小监督高保真语音合成方法,所有模块均基于扩散模型构建。非自回归框架增强了可控性,而持续时间扩散模型则使韵律表达多样化。对比令牌-声学预训练(CTAP)用作中间语义表示,以解决现有语义编码方法中的信息冗余和维度爆炸问题。梅尔频谱图用作声学表示。通过连续变量回归任务来预测语义和声学表示,以解决高频细粒度波形失真的问题。实验结果表明,我们提出的方法优于基线方法。我们在网站上提供了音频样本。
Qiang 等(Mon,)研究了这个问题。