Key points are not available for this paper at this time.
बहु-आधारित बड़े भाषा मॉडल (MLLMs) ने हाल ही में महत्वपूर्ण प्रगति की है। फिर भी, उच्च-रिज़ॉल्यूशन छवियों में जटिल विवरणों की सटीक पहचान और समझ में चुनौतियाँ बनी हुई हैं। मजबूत MLLMs के विकास के लिए यह आवश्यक होने के बावजूद, यह क्षेत्र कम शोधित है। इस चुनौती से निपटने के लिए, हमारा कार्य InfiMM-HD प्रस्तुत करता है, जो विभिन्न रिज़ॉल्यूशन की छवियों को कम कंप्यूटेशनल ओवरहेड के साथ संसाधित करने के लिए विशेष रूप से डिज़ाइन किया गया एक नए आर्किटेक्चर है। यह नवाचार MLLMs को उच्च-रिज़ॉल्यूशन क्षमताओं में बढ़ाने की सुविधा प्रदान करता है। InfiMM-HD एक क्रॉस-अटेंशन मॉड्यूल और दृश्य विंडो को शामिल करता है ताकि गणना लागत को कम किया जा सके। इस आर्किटेक्चर डिजाइन को चार-चरण प्रशिक्षण पाइपलाइन के साथ मिलाकर, हमारा मॉडल कुशलता और लागत-प्रभावी तरीके से बेहतर दृश्य धारणा प्राप्त करता है। अनुभवात्मक अध्ययन InfiMM-HD की मजबूती और प्रभावशीलता को उजागर करता है, संबंधित क्षेत्रों में अन्वेषण के नए मार्ग खोलता है। कोड और मॉडल https://huggingface.co/Infi-MM/infimm-hd पर उपलब्ध हैं।
लिउ एट अल। (सन,) ने इस प्रश्न का अध्ययन किया।
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: