Key points are not available for this paper at this time.
एक महत्वपूर्ण कारक जिसे हम वीडियो प्रतिनिधित्व सीखने से पकड़ने की अपेक्षा करते हैं, विशेष रूप से छवि प्रतिनिधित्व सीखने की तुलना में, वह है वस्तु की गति। हालाँकि, हमने पाया कि वर्तमान मुख्यधारा के वीडियो डेटा सेटों में, कुछ क्रिया श्रेणियाँ उस दृश्य से अत्यधिक संबंधित हैं जहाँ क्रिया होती है, जिससे मॉडल उस समाधान की ओर झुक जाता है जहाँ केवल दृश्य जानकारी को एन्कोड किया गया है। उदाहरण के लिए, एक प्रशिक्षित मॉडल एक वीडियो को फुटबॉल खेलते हुए पूर्वानुमानित कर सकता है क्योंकि यह मैदान को देखता है, यह अनदेखा करते हुए कि विषय मैदान पर एक चियरलीडर के रूप में नाच रहा है। यह वीडियो प्रतिनिधित्व सीखने की हमारी मूल मंशा के खिलाफ है और एक अलग डेटा सेट पर दृश्य पूर्वाग्रह ला सकता है जिसे नजरअंदाज नहीं किया जा सकता। इस समस्या का सामना करने के लिए, हम दृश्य और गति (DSM) को दो सरल कार्यों के साथ अलग करने का प्रस्ताव करते हैं, ताकि मॉडल की गति जानकारी के प्रति ध्यान बेहतर हो सके। विशेष रूप से, हम प्रत्येक वीडियो के लिए एक सकारात्मक क्लिप और एक नकारात्मक क्लिप बनाते हैं। मूल वीडियो की तुलना में, सकारात्मक/नकारात्मक गति-छुआ/टूटी हुई लेकिन दृश्य-टूटी हुई/छुने से बची है स्पैशियल लोकल डिस्टर्बेंस और टेम्पोरल लोकल डिस्टर्बेंस द्वारा। हमारा उद्देश्य सकारात्मक को खींचना है जबकि नकारात्मक को मूल क्लिप से दूर धकेलना है। इस तरह, दृश्य का प्रभाव कमज़ोर हो जाता है जबकि नेटवर्क की पार्श्विक संवेदनशीलता और बढ़ जाती है। हम विभिन्न बैकबोन्स और विभिन्न प्री-ट्रेनिंग डेटा सेटों के साथ दो कार्यों पर प्रयोग करते हैं, और पाते हैं कि हमारी विधि SOTA विधियों को 8.1% और 8.8% की उल्लेखनीय सुधार के साथ पार करती है जबकि UCF101 और HMDB51 डेटा सेट पर क्रिया पहचान कार्य के प्रति समान बैकबोन का उपयोग करती है।
Wang et al. (Tue,) ने इस प्रश्न का अध्ययन किया।