Key points are not available for this paper at this time.
في هذه الورقة، نقترح VITS المدرك للمعنويات (PAVITS) لتحويل الصوت العاطفي (EVC)، بهدف تحقيق هدفين رئيسيين لـ EVC: عدم التباين العالي للمحتوى والطبيعية العاطفية العالية، والتي تعد حاسمة لتلبية متطلبات الإدراك البشري. لتحسين طبيعة المحتوى للصوت المحول، قمنا بتطوير هيكل EVC من النهاية إلى النهاية مستلهم من الجودة العالية للصوت في VITS. من خلال دمج محول صوتي وفوكودر بسلاسة، نتناول بشكل فعال المشكلة الشائعة لعدم تطابق تدريب المعنويات العاطفية مع التحويل في وقت التشغيل الذي يسود في نماذج EVC الحالية. لتعزيز الطبيعة العاطفية أكثر، نقدم موصوف عاطفي لنمذجة التباينات الدقيقة في المعنويات لمشاعر الكلام المختلفة. بالإضافة إلى ذلك، نقترح متنبئاً للمعنويات، الذي يتنبأ بميزات المعنويات من النص بناءً على التصنيف العاطفي المقدم. من الجدير بالذكر أننا نقدم خسارة محاذاة المعنويات لإقامة رابط بين ميزات المعنويات الكامنة من اثنين من الأساليب المختلفة، لضمان تدريب فعال. تظهر النتائج التجريبية أن أداء PAVITS يتفوق على الأساليب الرائدة في EVC.
درست Qi وآخرون (2024) هذا السؤال.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: