Key points are not available for this paper at this time.
इस पेपर में, हम AISHELL-3 प्रस्तुत करते हैं, जो एक बड़े पैमाने पर और उच्च-वफादारी वाला बहु-प्रवक्ता मंदारिन भाषण कॉर्पस है जिसका उपयोग बहु-प्रवक्ता टेक्स्ट-टू-स्पीच (TTS) सिस्टम को प्रशिक्षित करने के लिए किया जा सकता है। इस कॉर्पस में लगभग 85 घंटे की निरपेक्ष भावनाओं की रिकॉर्डिंग शामिल है जो 218 नैटिव चाइनीज़ मंदारिन वक्ताओं द्वारा बोलें गए हैं। उनके सहायक गुण जैसे लिंग, आयु समूह और नैटिव लहज़े स्पष्ट रूप से चिह्नित और कॉर्पस में प्रदान किए गए हैं। इसके अनुसार, रिकॉर्डिंग के साथ चीनी अक्षर-स्तर और पिनयिन-स्तर में ट्रांस्क्रिप्ट प्रदान किया गया है। हम एक मानक प्रणाली प्रस्तुत करते हैं जो बहु-प्रवक्ता मंदारिन भाषण संश्लेषण के लिए AISHELL-3 का उपयोग करती है। बहु-प्रवक्ता भाषण संश्लेषण प्रणाली Tacotron-2 पर एक विस्तार है जहां एक वक्ता सत्यापन मॉडल और आवाज समानता के संबंध में एक उपयुक्त हानि को प्रतिपुष्टि बाधा के रूप में शामिल किया गया है। हमारा लक्ष्य प्रस्तुत कॉर्पस का उपयोग करके एक मजबूत संश्लेषण मॉडल बनाना है जो शून्य-शॉट आवाज क्लोनिंग प्राप्त करने में सक्षम हो। इस डेटा सेट पर प्रशिक्षित प्रणाली उन वक्ताओं पर भी अच्छी तरह से सामान्यीकृत होती है जो प्रशिक्षण प्रक्रिया में कभी नहीं देखे गए। हमारे प्रयोगों से प्राप्त ऑब्जेक्टिव मूल्यांकन परिणाम दिखाते हैं कि प्रस्तावित बहु-प्रवक्ता संश्लेषण प्रणाली वक्ता एम्बेडिंग समानता और समान त्रुटि दर मापन के संबंध में उच्च आवाज समानता प्राप्त करती है। डेटा सेट, मानक प्रणाली कोड और उत्पन्न नमूने ऑनलाइन उपलब्ध हैं।
शि एट अल. (गुरूवार,) ने इस प्रश्न का अध्ययन किया।
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: