Key points are not available for this paper at this time.
वीडियो वस्तु पहचान एक चुनौतीपूर्ण कार्य है क्योंकि कुछ वीडियो फ्रेम में रूप-रंग का गिरावट होता है। एक सामान्य समाधान है पड़ोसी विशेषताओं को संकलित करना ताकि प्रति-फ्रेम रूप-रंग की विशेषताओं को बढ़ाया जा सके। हालांकि, इस प्रकार की विधि संकलित फ्रेम के बीच अस्थायी संबंधों की अनदेखी करती है, जो वीडियो पहचान सटीकता में सुधार के लिए महत्वपूर्ण है। रूप-रंग के गिरावट की समस्या को संभालने के लिए, यह पत्र अस्थायी संदर्भ से संवर्धित नेटवर्क (TCENet) का प्रस्ताव करता है, जो वीडियो वस्तु पहचान के लिए अस्थायी संकलन द्वारा अस्थायी संदर्भ की जानकारी का उपयोग करता है। वीडियो में वस्तुओं के विस्थापन को संभालने के लिए, एक नवीन डिफॉर्मएलाइन मॉड्यूल का प्रस्ताव है जो फ्रेम से फ्रेम तक स्थायी विशेषताओं को संरेखित करता है। एक निश्चित लंबाई की विंडो फ्यूजन रणनीति अपनाने के बजाय, एक अस्थायी स्ट्राइड पूर्वानुमानकर्ता का प्रस्ताव है जो संकलन के लिए वीडियो फ्रेमों को अनुकूलित रूप से चुनता है, जो भिन्न अस्थायी जानकारी के उपयोग को सुविधाजनक बनाता है और बेहतर परिणाम प्राप्त करने के लिए संकलन के लिए कम वीडियो फ्रेमों की आवश्यकता होती है। हमारा TCENet ImageNet VID डेटासेट पर सर्वोत्तम प्रदर्शन करता है और तेजी से चलने वाला होता है। बिना किसी बेमतलब के, हमारा TCENet केवल 3 फ्रेमों को संकलित करके 80.3% mAP हासिल करता है।
ही एट अल। (शुक्रवार,) ने इस प्रश्न का अध्ययन किया।
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: