Key points are not available for this paper at this time.
छवि-पाठ मिलान दृश्य-संवेदी क्रॉस-मोडल पुनर्प्राप्ति के लिए केंद्रीय है और हाल ही में इस पर व्यापक ध्यान आकर्षित किया है। पिछले अध्ययनों का समर्पण छवि क्षेत्रों और शब्दों के बीच अंतर्निहित संबंद्धता को खोजने में रहा है, जैसे कि प्रमुख शब्दों को प्रमुख वस्तुओं के विशिष्ट क्षेत्रों से जोड़ना। हालाँकि, मौजूदा विधियाँ आमतौर पर ठोस वस्तुओं को संभालने के लिए प्रतिबद्ध होती हैं, न कि अमूर्त वस्तुओं के लिए, जैसे कि कुछ क्रिया का वर्णन, जो वास्तव में वास्तविकता के वर्णन पाठों में सर्वव्यापी होते हैं। अमूर्त वस्तुओं के साथ निपटने में मुख्य चुनौती यह है कि उनके बीच कोई स्पष्ट कनेक्शन नहीं होता है, उनके ठोस समकक्षों के विपरीत। इसलिए, एक को उनके बीच अंतर्निहित और अंतर्निहित संबंधों को खोजना चाहिए। इस पत्र में, हम छवि-पाठ मिलान के लिए संबंध-वार द्वि-ध्यान नेटवर्क (RDAN) का प्रस्ताव करते हैं। विशेष रूप से, हम एक अत्यधिक पूर्ण सेट को बनाए रखते हैं जिसमें क्षेत्रों और शब्दों के जोड़े होते हैं। फिर इस सेट के आधार पर, हम क्षेत्रों और शब्दों के बीच स्थानीय संबंधों और वैश्विक निर्भरताओं को एक दृश्य-संवेदी नेटवर्क को प्रशिक्षित करके कोड करते हैं। फिर दृश्य-संवेदी संरेखणों और छवि-पाठ समानता का अनुमान लगाने के लिए द्वि-पथ ध्यान नेटवर्क प्रस्तुत किया जाता है। व्यापक प्रयोगात्मक परीक्षण हमारी विधि की प्रभावशीलता को मान्य करता है, जिससे कई सार्वजनिक बेंचमार्क डेटा सेट पर मानक-से-कार्यात्मक प्रदर्शन हासिल होता है।
हु एट अल। (सन,) ने इस प्रश्न का अध्ययन किया।