Key points are not available for this paper at this time.
एंड-टू-एंड (E2E) न्यूरल नेटवर्क के प्रचुर विकास के साथ, हाल के वर्षों में स्वचालित भाषण पहचान (ASR) में अभूतपूर्व प्रगति देखी गई है। हालाँकि, कोड-स्विचिंग घटना एक प्रमुख बाधा बनी हुई है जो ASR को पूर्णता से रोकती है, क्योंकि डेटा की कमी और भाषाओं के बीच भिन्नताएँ ASR प्रदर्शन के गिरावट की ओर ले जाती हैं। इस पेपर में, हम कोड-स्विचिंग घटना द्वारा उत्पन्न चुनौती का समाधान करने के लिए E2E ASR के ध्वनिक एन्कोडर में सुधार करने पर विशेष ध्यान केंद्रित करते हैं। हमारे मुख्य योगदान तीन गुना हैं: पहला, हम एक नया डिसेंटैंगलमेंट लॉस प्रस्तुत करते हैं ताकि एन्कोडर की निचली परत इंटर-भाषाई ध्वनिक जानकारी को कैप्चर कर सके जबकि एन्कोडर की उच्च परत पर भाषाई भ्रम को कम करता है। दूसरा, व्यापक प्रयोगों के माध्यम से, हम सत्यापित करते हैं कि हमारी प्रस्तावित विधि पूर्व-प्रशिक्षित डुअल-एन्कोडर्स का उपयोग करने वाली पूर्ववर्ती विधियों को पीछे छोड़ देती है, जबकि केवल कोड-स्विचिंग कॉर्पस तक पहुँच रखते हुए और आधे पैमाना का उपयोग कर रही है। तीसरा, एन्कोडर्स के आउटपुट फीचर्स का स्पष्ट अंतर भी डिसेंटैंगलमेंट लॉस और मिश्रण-ऑफ-एक्सपर्ट्स (MoE) आर्किटेक्चर के बीच के पूरकता की पुष्टि करता है।
Yang et al. (Mon,) ने इस प्रश्न का अध्ययन किया।