Das neurale Codec-Sprachmodell (LM) hat große Fähigkeiten in der Zero-Shot Text-to-Speech (TTS) Synthese gezeigt. Allerdings leidet das Codec-LM oft unter Einschränkungen in der Inferenzgeschwindigkeit und Stabilität, aufgrund seiner autoregressiven Natur und der impliziten Ausrichtung zwischen Text und Audio. In dieser Arbeit führen wir eine neue Variante des neuralen Codec-LM ein, nämlich TacoLM, um diese Herausforderungen zu bewältigen. Insbesondere führt TacoLM einen gated attention Mechanismus ein, um die Trainings- und Inferenz-Effizienz zu verbessern und die Modellgröße zu reduzieren. Gleichzeitig wird für jede Decoder-Schicht eine zusätzliche gated Cross-Attention-Schicht integriert, die die Effizienz und Inhaltsgenauigkeit der synthetisierten Sprache verbessert. Bei der Bewertung des Librispeech-Korpus erzielt das vorgeschlagene TacoLM eine bessere Wortfehlerrate, Sprecherähnlichkeit und durchschnittliche Meinungsbewertung, mit 90 % weniger Parametern und einer 5,2-fachen Beschleunigung im Vergleich zu VALL-E. Demo und Code sind unter https://ereboas.github.io/TacoLM/ verfügbar.
Song et al. (Sat,) untersuchten diese Frage.