Key points are not available for this paper at this time.
गहन शिक्षण आधारित मशीन तर्क और दृश्य प्रश्न उत्तर मॉडल अपने संबंधित डेटा सेटों पर मानव के समान प्रदर्शन प्राप्त करते हैं; हालाँकि, उनका प्रदर्शन डोमेन शिफ्ट के तहत नाटकीय रूप से गिर जाता है, जिससे पता चलता है कि मॉडल मानव समान तर्क के स्तर तक सामान्यीकरण में विफल होते हैं। इस पेपर में हम एक नया CLEVR-जैसा डेटा सेट प्रस्तुत करते हैं, जिसमें छवियों-प्रश्न जोड़ों का समावेश है ताकि गहन मॉडलों की दृश्य तर्क क्षमता का मूल्यांकन किया जा सके। छवियों में वस्तुएं इस प्रकार व्यवस्थित की गई हैं कि प्रश्न के पहले आधे हिस्से में अस्पष्टता है और इस बिंदु तक कई उत्तर सही लगते हैं; हालाँकि, प्रश्न के दूसरे आधे हिस्से में स्थिति स्पष्ट होती है और पूरी दृश्य प्रश्न-उत्तर (VQA) कार्य को स्पष्ट बनाती है, और एक अनूठा उत्तर रिपोर्ट किया जा सकता है। इसलिए, गहन मॉडल अपने तर्क प्रक्रिया के दौरान अपने न्यूरॉन्स में अस्पष्टता को संभालने की आवश्यकता होती है। वे इसे खोज स्थान में ग्राफ (या ट्री) ट्रैवर्सिंग के माध्यम से बैक-ट्रैकिंग तकनीक का उपयोग करके या कुछ तर्क गणनाओं पर गलत उत्तरों को क्रमिक रूप से समाप्त करके संभवतः सही उत्तरों के एक उम्मीदवार सेट को परिष्कृत करके संभाल सकते हैं। हम इस डेटा सेट को CLEVR विद बैक-ट्रैकिंग डेटाबेस, CLEVR-BT-DB कहते हैं। इसमें 2,500 छवियाँ और 10,000 प्रश्न उसी प्रारूप में हैं जैसा मानक CLEVR में है, और यह https://huggingface.co/datasets/Aborevsky01/CLEVR-BT-DB साइट पर उपलब्ध है। अतिरिक्त डेटा उत्पन्न करने की कोड https://github.com/AFigaro/CLEVRBTDB साइट पर उपलब्ध है। हमने MDETR विधि का परीक्षण किया, जो Meta Research से VQA के लिए एक हालिया गहन मॉडल है, इसने मानक CLEVR डेटा सेट पर 99.7% की सटीकता प्राप्त की; हालाँकि, इसने हमारे CLEVR-BT-DB डेटा सेट पर 28.01% की सटीकता प्राप्त की।
Latipov et al. (Mon,) ने इस प्रश्न का अध्ययन किया।