मशीन लर्निंग (ML) الگोरिदम द्वारा संचालित नेटवर्क आक्रमण पहचान प्रणालियाँ (NIDS) आमतौर पर सार्वजनिक रूप से उपलब्ध डेटासेट्स का उपयोग करके प्रशिक्षित की जाती हैं, जिसमें लेबल किए गए ट्रैफ़िक नमूने होते हैं, जहाँ लेबल ट्रैफ़िक वर्गों को संदर्भित करते हैं, सामान्यतः एक सामान्य और कई हानिकारक। यह पत्र ऐसे डेटासेट्स पर प्रशिक्षित मॉडलों की सामान्यीकरणता का अध्ययन करता है। यह मुद्दा महत्वपूर्ण है क्योंकि वास्तविक इंटरनेट ट्रैफ़िक पर ऐसे मॉडल के आवेदन के लिए, डेटासेट्स पर प्राप्त उच्च-प्रदर्शन माप सीधे वास्तविक ट्रैफ़िक पर समान प्रभावशीलता का संकेत नहीं देते हैं। हम एक प्रक्रिया का प्रस्ताव करते हैं जिसमें विभिन्न सेटों का उपयोग करके क्रॉस-मान्यता शामिल है, जो कुछ मानक ट्रैफ़िक वर्ग साझा करते हैं, t-SNE दृष्टिवादीकरण के साथ मिलकर। हम इसे चार प्रसिद्ध और व्यापक रूप से उपयोग किए जाने वाले डेटासेट्स: UNSW-NB15, CIC-CSE-IDS2018, BoT-IoT, और ToN-IoT पर अनुसंधान करने के लिए लागू करते हैं। हमारी जांच से पता चलता है कि प्रशिक्षण के लिए उपयोग किए गए एक सेट पर प्राप्त मॉडल की उच्च सटीकता अन्य सेटों पर केवल सीमित रूप से पुन: उत्पन्न की जा सकती है। इसके अलावा, सामान्य ट्रैफ़िक वर्गों की सामान्यीकरणता हानिकारक ट्रैफ़िक से अलग है। वास्तविक नेटवर्क वातावरण में इसके अनुप्रयोग को ध्यान में रखते हुए, इसका अर्थ है कि किसी को मशीन लर्निंग मॉडल को प्रशिक्षित करने के लिए उपयोग किए जाने वाले डेटा का चयन सावधानीपूर्वक करना चाहिए ताकि यह निर्धारित किया जा सके कि प्रशिक्षण के लिए उपयोग किए जाने वाले डेटासेट में मौजूद वर्ग वास्तविक लक्ष्य ट्रैफ़िक वातावरण में कितनी समान हैं। दूसरी ओर, डेटासेट्स का विलय अधिक व्यापक डेटा संग्रह का परिणाम हो सकता है, जिसमें प्रशिक्षण नमूनों का एक अधिक विविध स्पेक्ट्रम शामिल है।
Iwanowski और सहयोगियों (बुध,) ने इस प्रश्न का अध्ययन किया।
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: