Key points are not available for this paper at this time.
हम भाषण पृथक्करण के लिए TF-GridNet का प्रस्ताव करते हैं। यह मॉडल समय-आवृत्ति (T-F) क्षेत्र में पूर्ण और उप-बैंड मॉडलिंग को एकीकृत करने वाला एक नवीन गहरा न्यूरल नेटवर्क (DNN) है। इसमें कई ब्लॉक होते हैं, प्रत्येक में एक अंतः-फ्रेम पूर्ण-बैंड मॉड्यूल, एक उप-बैंड अस्थायी मॉड्यूल, और एक क्रॉस-फ्रेम आत्म-ध्यान मॉड्यूल होता है। इसे जटिल स्पेक्ट्रल मैपिंग करने के लिए प्रशिक्षित किया गया है, जहाँ इनपुट सिग्नल के वास्तविक और काल्पनिक (RI) घटकों को लक्षित RI घटकों की भविष्यवाणी के लिए विशेषताओं के रूप में स्टैक किया जाता है। हम पहले इसे एकल-पक्षीय चुप सुनने वाले वक्ता पृथक्करण पर मूल्यांकित करते हैं। डेटा संवर्धन और गतिशील मिश्रण का उपयोग किए बिना, यह WSJ0-2mix पर स्केल-इन्वेरियंट सिग्नल-टू-डिस्टोर्टियन अनुपात (SI-SDR) में 23.5 dB का सर्वोत्तम सुधार प्राप्त करता है, जो दो वक्ता पृथक्करण के लिए एक मानक डेटासेट है। शोर और गूंज के प्रति इसकी मजबूतता को दिखाने के लिए, हम इसे SMS-WSJ डेटासेट का उपयोग करते हुए एकल-पक्षीय गूंज वाले वक्ता पृथक्करण पर और WHAMR! का उपयोग करते हुए शोर-गूंज वाले वक्ता पृथक्करण पर मूल्यांकित करते हैं, और दोनों डेटासेट पर सर्वोत्तम प्रदर्शन प्राप्त करते हैं। हम फिर TF-GridNet को मल्टी-माइक कंडीशन्स के लिए मल्टी-माइक जटिल स्पेक्ट्रल मैपिंग के माध्यम से विस्तारित करते हैं, और इसे एक दो-DNN प्रणाली में एक बीमफार्मर के साथ एकीकृत करते हैं (जिसे पिछले अध्ययनों में MISO-BF-MISO नाम दिया गया है), जहाँ इस पेपर में प्रस्तावित बीमफार्मर एक नया मल्टी-फ्रेम वाइनर फ़िल्टर है जिसे पहले DNN के आउटपुट के आधार पर गणना किया गया है। SMS-WSJ और WHAMR! के मल्टी-चैनल कार्यों पर सर्वोत्तम प्रदर्शन प्राप्त किया गया है। वक्ता पृथक्करण के अलावा, हम प्रस्तावित एल्गोरिदम को भाषण डेरिवेरबरेशन और शोर-गूंज वाले भाषण संवर्धन पर लागू करते हैं। एक डेरिवेरबरेशन डेटासेट और हाल के L3DAS22 मल्टी-चैनल भाषण संवर्धन चुनौती के डेटासेट पर सर्वोत्तम प्रदर्शन प्राप्त किया गया है।
Wang et al. (Sun,) ने इस प्रश्न का अध्ययन किया।