Key points are not available for this paper at this time.
电子邮件是商务、企业和个人生活中最常见的远程通信方式。它包含大量通过网络传输的私密数据。因此,必须高效地管理这些邮件,以实现最大化和不间断的通信。不幸的是,由于个人的不良意图,垃圾邮件(一种恶意电子邮件的统称)屡屡进入我们的电子邮件账户。垃圾邮件增加了 ISP 服务器和带宽的负荷,而消费者需要承担处理这种负荷所产生的额外费用。垃圾邮件旨在向特定人群发送未经请求的商业广告和无用提议;因此,它在多个司法管辖区均受到法律规制。鉴于此,从海量电子邮件数据集中区分出真实邮件是本研究的主要目的。实验中同时使用了从多个电子邮件账户创建的合成数据以及从 UCI Machine Learning Repository 收集的常规数据集。随后,从多个数据源导入数据,并对数据集应用了数据转换技术。“主成分分析(Principal Component Analysis)”被用作属性选择策略来识别重要属性。本文描述了利用随机森林(RF algorithm)对电子邮件进行的分类。经 PCA 改进后的数据集通过“随机森林分类算法(Random Forest classification algorithm)”进行分类,该算法在处理大型数据集时表现更佳。结果采用绘图布局、受试者工作特征(ROC)图和条形图等可视化技术进行展示。
Chaudhuri et al. (Fri,) 研究了这一问题。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: