Wir präsentieren Step-Audio-EditX, das erste Open-Source-LMM-basierte Audiomodell, das sich durch ausdrucksstarke und iterative Audiobearbeitung auszeichnet und Emotionen, Sprechstile und Paralinguistik umfasst, sowie robuste Zero-Shot-TTS-Fähigkeiten bietet. Unsere Kerninnovation besteht darin, ausschließlich große Margen synthetischer Daten zu nutzen, was die Notwendigkeit für embedding-basierte Priors oder zusätzliche Module umgeht. Dieser Ansatz des großen Margen-Lernens ermöglicht sowohl iterative Kontrolle als auch hohe Ausdruckskraft über Stimmen hinweg und stellt einen grundlegenden Wechsel vom konventionellen Fokus auf die Trennung auf Repräsentationsebene dar. Die Evaluierungsergebnisse zeigen, dass Step-Audio-EditX sowohl MiniMax-2.6-hd als auch Doubao-Seed-TTS-2.0 in der Emotionsbearbeitung und anderen feinkörnigen Kontrollaufgaben übertrifft.
Yan et al. (Mittwoch) untersuchten diese Frage.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: