Key points are not available for this paper at this time.
在过去几十年中,机器学习在恶意网络流量检测中的应用得到了充分研究;当流量被加密时,这种方法尤其吸引人,因为传统的模式匹配方法无法使用。不幸的是,机器学习在网络安全领域的承诺实现得很慢。本文强调了造成这种情况的两个主要原因:不准确的真实情况和高度非平稳的数据分布。为了展示和理解这些缺陷对流行机器学习算法的影响,我们设计并开展了实验,展示了六种常见算法在面对真实网络数据时的表现。根据我们的实验结果,我们识别出某些算法类别在加密恶意软件流量分类任务中的表现不佳的情况。考虑到所概述的现实世界限制,我们为从业者提供了具体建议。从算法的角度来看,我们发现随机森林集成方法的表现优于其他竞争方法。更重要的是,特征工程是决定性的;我们发现对初始特征集进行迭代,并包含领域专家建议的特征,对分类系统的性能产生了更大的影响。例如,使用更具表现力的特征集的线性回归在所有考虑的标准上轻松超越了使用标准网络流量表示的随机森林方法。我们的分析基于从商业恶意软件沙箱和两个地理位置不同的大型企业网络收集的1200万个TLS加密会话,持续了12个月。
Anderson等人(2017)研究了这个问题。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: