Key points are not available for this paper at this time.
近期在风格转移文本到语音(TTS)方面的进展提高了合成语音的表现力。尽管有这些进展,从多样化和未见过的参考语音中编码风格信息仍然具有挑战性。本文介绍了StyleMoE,一种将由风格编码器建模的嵌入空间划分为可处理子集的方法,由风格专家处理。所提出的方法用混合专家(MoE)层替代TTS系统中的风格编码器。通过利用门控网络将参考语音路由到不同的风格专家,每个专家在优化过程中专注于风格空间的某些方面。我们的实验客观和主观地证明了我们提出的方法在增加多样化和未见过的风格的风格空间覆盖率方面的有效性。这种方法可以提升现有顶尖风格转移TTS模型的性能,据我们所知,这是首个在风格转移TTS中研究MoE的方法。
Jawaid 等人(周三)研究了这个问题。