Key points are not available for this paper at this time.
大型语言模型(LLMs)和音频编解码器的最新进展极大推动了零-shot TTS(文本到语音合成)。它们可以通过仅使用未见说话者的3秒语音作为声学提示来合成个性化的语音。然而,它们仅支持短的语音提示,无法利用在有声读物和对话式TTS场景中所需的更长上下文信息。本文介绍了一种新颖的基于音频编解码器的TTS模型,通过多种增强方法适应上下文特征。受Qformer成功的启发,我们提出了一种多模态上下文增强Qformer(MMCE-Qformer),以利用额外的多模态上下文信息。此外,我们还适应了一个预训练的LLM,以利用其理解能力来预测语义令牌,并使用SoundStorm生成声学令牌,从而提高音频质量和说话者相似性。广泛的客观和主观评估表明,我们提出的方法在各种上下文TTS场景中均优于基线。
Xue等(Sun,)研究了这个问题。