Key points are not available for this paper at this time.
कई क्षेत्रों को उन फाइलों में ज्ञान को प्रभावी रूप से प्रस्तुत करने में चुनौतियों का सामना करना पड़ता है, जिनमें कई चित्र शामिल होते हैं जो पाठ से निकटता से संबंधित होते हैं, और मॉडल को चित्रों और पाठ के बीच के रिश्ते को समझाने के लिए कैसे प्रेरित किया जाए। कंट्रास्टिव लैंग्वेज-इमेज प्री-ट्रेनिंग (CLIP) और बूटस्ट्रैपिंग लैंग्वेज-इमेज प्री-ट्रेनिंग (BLIP) बड़े पैमाने पर मॉडल प्री-ट्रेनिंग के माध्यम से चित्र-टेक्स्ट संबंध को समझने की क्षमता प्राप्त करते हैं। CLIP केवल चित्रों और उनके संबंधित पाठ पर विचार नहीं करता, बल्कि अत्यधिक अप्रासंगिक पाठ के साथ चित्रों की तुलना भी करता है, जिससे चित्रों और संबंधित पाठ के बीच के संबंध को सामान्यीकृत करने की उसकी क्षमता में सुधार होता है। BLIP पूर्व-प्रशिक्षण और मेल खाने वाले इमेज-टेक्स्ट जोड़ों को फाइन-ट्यूनिंग करके जटिल इमेज-टेक्स्ट संबंधों की अपनी समझ को बढ़ाता है। यह पेपर CLIP और BLIP पर आधारित एक इमेज-टेक्स्ट फ्यूजन एल्गोरिदम प्रस्तुत करता है, जो CLIP की इमेज-टेक्स्ट सामान्यीकरण क्षमता और BLIP की जटिल इमेज-टेक्स्ट संबंध को समझने की क्षमता का पूर्ण उपयोग करके इमेज-टेक्स्ट प्रासंगिकता का सटीक और सुसंगत चित्र प्रदान करता है।
जियाई एट अल. (2024) ने इस प्रश्न का अध्ययन किया।
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: