Key points are not available for this paper at this time.
これまで、従来の音声変換アプローチはすべてテキスト依存であり、すなわち、ソーススピーカーとターゲットスピーカーの同等のトレーニング発話を必要とします。最近提案されたアプリケーションのいくつかがこの要件を放棄することを求めているため、本論文ではテキスト依存しないトレーニングデータ内で対応する時間フレームを見つけるアルゴリズムを提示します。このアルゴリズムの性能は、スペクトルエンベロープの線形変換に基づく音声変換フレームワークによってテストされます。実験結果は、いくつかの客観的誤差測定を利用したスペイン語の性別を超えたコーパスで報告されます。
Ney et al. (Mon,) はこの問題を研究しました。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: