Key points are not available for this paper at this time.
इस शोधपत्र में, हम मार्केटिंग कीवर्ड्स द्वारा संवर्धित, छवियों से उत्पाद विवरण उत्पन्न करने के लिए एक नई व्यवस्था प्रस्तावित करते हैं। यह उत्पादों की अनूठी विशेषताओं के अधिक अनुकूल विवरण तैयार करने के लिए दृश्य और पाठ्य सूचना की संयुक्त शक्ति का लाभ उठाता है। इस व्यवस्था के लिए, पिछली विधियां छवि और कीवर्ड को एनकोड करने के लिए दृश्य और पाठ्य एनकोडर्स का उपयोग करती हैं और उत्पाद विवरण उत्पन्न करने के लिए एक भाषा मॉडल-आधारित डिकोडर का उपयोग करती हैं। हालांकि, उत्पन्न विवरण अक्सर गलत और सामान्य होता है क्योंकि समान-श्रेणी के उत्पादों की कॉपीराइटिंग समान होती है, और बड़े पैमाने पर नमूनों पर संपूर्ण ढांचे को अनुकूलित करने से मॉडल सामान्य शब्दों पर ध्यान केंद्रित करते हैं लेकिन उत्पाद सुविधाओं की अनदेखी करते हैं। इस समस्या को कम करने के लिए, हम ModICT नामक एक सरल और प्रभावी मल्टीमॉडल इन-कॉन्टेक्स्ट ट्यूनिंग दृष्टिकोण प्रस्तुत करते हैं, जो संदर्भ के रूप में एक समान उत्पाद नमूना पेश करता है और विवरण तैयार करने के लिए भाषा मॉडलों की इन-कॉन्टेक्स्ट शिक्षण क्षमता का उपयोग करता है। प्रशिक्षण के दौरान, हम दृश्य एनकोडर और भाषा मॉडल को frozen रखते हैं, और मल्टीमॉडल इन-कॉन्टेक्स्ट संदर्भों और डायनेमिक प्रॉम्प्ट्स को बनाने के लिए जिम्मेदार मॉड्यूल को अनुकूलित करने पर ध्यान केंद्रित करते हैं। यह दृष्टिकोण बड़े भाषा मॉडलों (LLMs) की भाषा निर्माण क्षमता को संरक्षित करता है, जिससे विवरण की विविधता में पर्याप्त वृद्धि होती है। विभिन्न भाषा मॉडल पैमानों और प्रकारों में ModICT की प्रभावशीलता का आकलन करने के लिए, हम ई-कॉमर्स डोमेन के भीतर तीन अलग-अलग उत्पाद श्रेणियों से डेटा एकत्र करते हैं। व्यापक प्रयोग दर्शाते हैं कि ModICT पारंपरिक तरीकों की तुलना में उत्पन्न परिणामों की सटीकता (Rouge-L पर 3.3% तक) और विविधता (D-5 पर 9.4% तक) में उल्लेखनीय सुधार करता है। हमारे निष्कर्ष विभिन्न अनुप्रयोगों में उत्पाद विवरणों के स्वचालित निर्माण को बढ़ाने के लिए एक मूल्यवान उपकरण के रूप में ModICT की क्षमता को रेखांकित करते हैं।
Li et al. (Wed,) ने इस प्रश्न का अध्ययन किया।