Key points are not available for this paper at this time.
प्राकृतिक भाषा को छवियों में आधारभूत करना, जैसे कि "पेड़ के बाईं ओर काले कुत्ते को स्थानीयकरण करना", कृत्रिम बुद्धिमत्ता की एक प्रमुख समस्या है, क्योंकि इसे बारीक भाषा संरचनाओं को समझने की आवश्यकता होती है। हालाँकि, मौजूदा समाधान केवल समग्र भाषा विशेषताओं और दृश्य विशेषताओं के बीच के संबंध पर निर्भर करते हैं, जबकि भाषा में निहित संयुक्त तर्क की प्रकृति को नजरअंदाज करते हैं। इस पेपर में, हम एक प्राकृतिक भाषा आधारभूत मॉडल का प्रस्ताव करते हैं जो स्वतंत्र रूप से भाषा के लिए बाइनरी वृत्त संरचना बना सकता है और फिर नीचे से ऊपर की ओर वृत्त के साथ दृश्य तर्क कर सकता है। हम अपने मॉडल को RvG-Tree: Recursive Grounding Tree कहते हैं, जिसे इस अंतर्दृष्टि से प्रेरित किया गया है कि किसी भी भाषा अभिव्यक्ति को पुनरावर्ती रूप से दो घटक भागों में विघटित किया जा सकता है, और आधारभूत विश्वास स्कोर को उन दोनों उप-वृत्तों द्वारा लौटाए गए उनके आधारभूत स्कोर की गणना करके पुनरावर्ती रूप से संचित किया जा सकता है। RvG-Tree को एक सिरे से लेकर अंत तक प्रशिक्षित किया जा सकता है, सीधे-गाम्बल-सॉफ्टमैक्स आस्थामापी का उपयोग करके, जो निरंतर स्कोर कार्यों से ग्रेडिएंट को वृत्त निर्माण में संकेतमय बनाने की अनुमति देता है। कई बेंचमार्क पर प्रयोग बताते हैं कि हमारा मॉडल अधिक समझाने योग्य तर्क के साथ सर्वोत्तम प्रदर्शन प्राप्त करता है।
हॉंग एट अल। (मंगलवार,) ने इस प्रश्न का अध्ययन किया।
Synapse has enriched 4 closely related papers on similar clinical questions. Consider them for comparative context: