Key points are not available for this paper at this time.
सूचना निकालना (IE), जिसका उद्देश्य साधारण पाठ से अर्थपूर्ण जानकारी प्राप्त करना है, को सामान्य और पेशेवर क्षेत्रों में डाउनस्ट्रीम अनुप्रयोगों का समर्थन करने के लिए व्यापक रूप से अध्ययन किया गया है। हालाँकि, लेबल किए गए डेटा की कमी और पेशेवर यांत्रिक, इलेक्ट्रिकल और प्लंबिंग (MEP) जानकारी की जटिलता के कारण, वर्तमान सामान्य गहन अध्ययन IE विधियों को MEP क्षेत्र में लागू करना चुनौतीपूर्ण है। इस समस्या को हल करने के लिए, यह पत्र MEP IE कार्य के लिए एक नियम-आधारित दृष्टिकोण का प्रस्ताव करता है, जिसमें बड़े पैमाने पर MEP कॉर्पोरा एकत्र करने के लिए एक “स्नोबॉल” रणनीति, नामित इकाई पहचान (NER) के लिए पाठ खंडों पर एक उपसर्ग-आधारित मिलान एल्गोरिदम, और संबंध निकालने (RE) के लिए निर्भरता वृक्ष पर निर्भरता-पथ-आधारित मिलान एल्गोरिदम शामिल है। RE के लिए “मेटा लिंकिंग” और “पथ छानने” नामक 2 विचार भी प्रस्तावित किए गए हैं, ताकि अधिक से अधिक पैटर्न से बाहर की इकाइयों/संबंधों की खोज की जा सके। प्रस्तावित दृष्टिकोण की व्यवहार्यता की पुष्टि करने के लिए, 65 एमबी MEP कॉर्पोरा को प्रस्तावित दृष्टिकोण के इनपुट के रूप में एकत्र किया गया है और 15,978 इकाइयों और 65,110 संबंध ट्रिपल्स वाले एक MEP सेमांटिक वेब की स्थापना की गई है, जिसमें क्रमशः 81% की सटीकता इकाइयों और 75% की सटीकता संबंध ट्रिपल्स के लिए है। शास्त्रीय गहन अध्ययन मॉडलों और प्रस्तावित नियम-आधारित दृष्टिकोण के बीच एक तुलना प्रयोग किया गया, जो यह दर्शाता है कि हमारी विधि की प्रदर्शन सटीकता में 37% और 49% बेहतर है जो चयनित गहन अध्ययन NER और RE मॉडलों की तुलना में है।
Wu और अन्य (Mon,) ने इस प्रश्न का अध्ययन किया।