Key points are not available for this paper at this time.
यह पत्र तीसरी CHiME भाषण पृथक्करण और पहचान चुनौती में हमारे योगदान को प्रस्तुत करता है। हमारा सिस्टम एकल-चैनल भाषण संवर्धन (SSE) के लिए द्विदिशात्मक लंबे लघु अवधि की मेमोरी (BLSTM) पुनरावृत्त तंत्रिका नेटवर्क (RNNs) का उपयोग करता है। नेटवर्कों को स्वच्छ भाषण और शोर विशेषताओं की भविष्यवाणी करने के लिए प्रशिक्षित किया गया है जो शोर वाले भाषण विशेषताओं से प्राप्त होती हैं। इसके अतिरिक्त, सिस्टम चुनौती के 6-चैनल रिकॉर्डिंग पर दो रीवर्बरेशन के तरीके लागू करता है। पहला चरण-त्रुटि आधारित फ़िल्टरिंग (PEF) है जो भाषण स्रोत के आगमन के समय के अनुमानित अंतर और माइक्रोफोन संकेतों के चरणों के आधार पर समय-परिवर्तनीय चरण-त्रुटि फ़िल्टर का उपयोग करता है। दूसरा सहसंबंध आकार देना (CS) है जो रीवर्बेंट भाषण में दीर्घकालिक सहसंबंध ऊर्जा में कमी लाता है। रेखीय पूर्वानुमान (LP) अवशेष को दीर्घकालिक सहसंबंध को दबाने के लिए संसाधित किया जाता है। इसके अलावा, सिस्टम पहचान अनुमान के N-श्रेष्ठ पुनर्स्कोरिंग करने के लिए एक LSTM भाषा मॉडल (LM) का उपयोग करता है। प्रस्तावित तरीकों का उपयोग करते हुए, वास्तविक मूल्यांकन परीक्षा सेट पर 24.38% का बेहतर शब्द त्रुटि दर (WER) प्राप्त होता है। यह चुनौती के बुनियादी स्तर पर लगभग 25% का सापेक्ष सुधार है।
मौसा इत्यादि (गुरुवार,) ने इस प्रश्न का अध्ययन किया।