Key points are not available for this paper at this time.
एंड-टू-एंड न्यूरल टीटीएस ने पढ़ने की शैली की आवाज संश्लेषण में उत्कृष्ट प्रदर्शन किया है। हालाँकि, कॉर्पस और मॉडलिंग क्षमता की सीमाओं के कारण उच्च गुणवत्ता का संवादात्मक टीटीएस बनाना अभी भी एक चुनौती है। यह अध्ययन अनुक्रम से अनुक्रम मॉडलिंग ढांचे के तहत एक आवाज एजेंट के लिए संवादात्मक टीटीएस बनाने का उद्देश्य रखता है। हम पहले एक स्वाभाविक संवादात्मक बोलने की कॉर्पस का निर्माण करते हैं जो आवाज एजेंट के लिए अच्छी तरह से डिज़ाइन किया गया है, जिसमें एक नया रिकॉर्डिंग स्कीम है जो रिकॉर्डिंग गुणवत्ता और संवादात्मक बोलने की शैली दोनों को सुनिश्चित करती है। दूसरे, हम एक संवाद संदर्भ-संवेदनशील एंड-टू-एंड टीटीएस दृष्टिकोण का प्रस्ताव करते हैं जो एक सहायक एनकोडर और एक संवादात्मक संदर्भ एनकोडर का उपयोग करता है ताकि बातचीत में वर्तमान उच्चारण और इसके संदर्भ के बारे में जानकारी को विशेष रूप से मजबूत किया जा सके। प्रयोगात्मक परिणाम दर्शाते हैं कि प्रस्तावित दृष्टिकोण संवादात्मक संदर्भ के अनुसार अधिक प्राकृतिक स्वरूप उत्पन्न करता है, जिसमें उच्चारण स्तर और बातचीत स्तर पर महत्वपूर्ण प्राथमिकता लाभ होते हैं। इसके अतिरिक्त, हमें यह भी पता चलता है कि मॉडल कुछ स्वाभाविक व्यवहार जैसे कि फ़िलर्स और पुनरावृत्त शब्दों को व्यक्त करने की क्षमता रखता है, जो संवादात्मक बोलने की शैली को अधिक वास्तविक बनाता है।
गुओ एट अल। (मंगल,) ने इस प्रश्न का अध्ययन किया।
Synapse has enriched 3 closely related papers on similar clinical questions. Consider them for comparative context: