Key points are not available for this paper at this time.
ट्रांसफॉर्मर का उपयोग करके अनुक्रमण सीखना प्राकृतिक भाषा कार्यों और कई अन्य में अत्याधुनिक प्रदर्शन हासिल कर चुका है। इस सफलता की कुंजी मल्टी-हेड स्व-सतर्कता है जो इनपुट अनुक्रम के व्यक्तिगत टोकनों से विशेषताओं को संहिताबद्ध और एकत्रित करता है। आउटपुट अनुक्रम उत्पन्न करने के लिए मैपिंग या डिक्रिप्शन क्रॉस ध्यान के माध्यम से किया जाता है। ऐसे ध्यान ढांचे का उपयोग करने में तीन गुना कमजोरियाँ हैं। पहले, चूंकि ध्यान इनपुट और आउटपुट अनुक्रमों में विभिन्न टोकनों की विशेषताओं को मिश्रित करेगा, इसलिए अनुक्रम डेटा प्रतिनिधित्व में अधिशेष जानकारी मौजूद होने की संभावना है। दूसरा, विभिन्न सिरों के बीच ध्यान वजन के पैटर्न समान होने की प्रवृत्ति होती है। मॉडल की क्षमता सीमित होती है। तीसरा, मॉडल अनिश्चितता के खिलाफ एन्कोडर-डीकोडर नेटवर्क में मजबूती को नजरअंदाज किया गया है। इन कमजोरियों को संभालने के लिए, यह पत्र एक बेयesian semanti और अलग मास्क ध्यान प्रस्तुत करता है जो मल्टी-हेड ध्यान में निष्क्रिय अलगाव को सीखाता है जहां ट्रांसफार्मर में अधिशेष विशेषताओं की भरपाई निष्क्रिय विषय जानकारी से की जाती है। ध्यान वजन को एक मास्क द्वारा छान filtering किया जाता है जो सेमांटिक क्लस्टरिंग के माध्यम से अनुकूलित किया गया है। यह ध्यान तंत्र क्लस्टर्ड डिसेंटैगलमेंट के लिए बेयesian शिक्षण के अनुसार लागू किया गया है। मशीन अनुवाद और भाषण पहचान पर प्रयोग बेयesian क्लस्टर्ड डिसेंटैगलमेंट के लाभ को मास्क ध्यान के लिए दिखाते हैं।
Chien et al. (Tue,) studied this question.
Synapse has enriched 3 closely related papers on similar clinical questions. Consider them for comparative context: