Key points are not available for this paper at this time.
أدت سباق التسلح بين موزعي البرمجيات الخبيثة وبين أولئك الذين يسعون لتوفير الدفاعات حتى الآن إلى تفوق الأولين. لم تتمكن طرق الكشف عن التوقيع من مواجهة الهجوم المتواصل من الثنائيات الجديدة التي تدعمها تقنيات الإخفاء السريعة التطور. ركزت الأبحاث الحديثة على تحليل التعليمات التشغيلية ذات المستوى المنخفض، سواء بشكل ثابت أو ديناميكي، كوسيلة لاكتشاف البرمجيات الخبيثة. على الرغم من أنها ناجحة أحيانًا في اكتشاف البرمجيات الخبيثة، إلا أن التحليل الثابت لا يزال يفشل في فك تشفير الكود المخفي، في حين أن التحليل الديناميكي يمكن أن يسمح للباحثين بدراسة الكود المكشوف في وقت التشغيل. كان البحث في هذا المجال محدودًا من خلال مجموعات البيانات الأساسية؛ حيث يمكن أن تؤدي البرمجيات الخبيثة القديمة والتي تم أخذ عينات منها بشكل غير كافٍ إلى تقليل إمكانية الاستقراء لمثل هذه المجموعات. الإسهام الرئيسي لهذه الورقة هو إنشاء مجموعة بيانات جديدة لمجموعة تعليمات التشغيل يتم تحليلها تحتوي على أكثر من 100,000 عينة مصنفة، والتي ستعالج هذه النواقص، ونقدم مجموعة البيانات نفسها للاستخدام من قبل مجتمع البحث الأوسع. تدعم مجموعة البيانات هذه دراسة آثار التشغيل باستخدام المصنّفات على بيانات قائمة على العد وبيانات قائمة على التسلسل. نجد أن معدلات اكتشاف البرمجيات الخبيثة تقل عندما يتم وضع علامات على العينات بتسميات مكافحة الفيروسات التقليدية. لم تتمكن الخوارزميات القائمة على العد أو القائمة على التسلسل من التمييز بشكل كافٍ بين فئات تسميات مكافحة الفيروسات. تزداد الاكتشافات عندما تعاد تصنيف البرمجيات الخبيثة بتسميات ناتجة من التعلم غير المراقب. مع التعلم القائم على التسلسل، يتجاوز الاكتشاف ذلك الخاص بالتسمية ببساطة
درس كارلين وآخرون (سن)، هذا السؤال.