Key points are not available for this paper at this time.
Métodos de aprendizado de máquina supervisionados para classificar e-mails de spam são bem estabelecidos. A maioria desses métodos utiliza recursos baseados em cabeçalhos ou conteúdo. No entanto, os spammers podem contornar esses métodos com facilidade - especialmente aqueles que lidam com recursos de cabeçalho. Neste artigo, reportamos um novo método de classificação de spam que usa recursos baseados no conteúdo do e-mail - linguagem e legibilidade combinados com os recursos de tarefa baseados em conteúdo anteriormente utilizados. Os recursos são extraídos de quatro conjuntos de dados de referência, a saber: CSDMC2010, Spam Assassin, Ling Spam e Enron-Spam. Usamos cinco algoritmos bem conhecidos para induzir nossos classificadores de spam: Random Forest (RF), BAGGING, ADABOOSTM1, Support Vector Machine (SVM) e Naïve Bayes (NB). Avaliamos o desempenho dos classificadores e descobrimos que o BAGGING apresenta o melhor desempenho. Além disso, seu desempenho supera o de vários métodos de ponta propostos em estudos anteriores. Embora aplicado apenas a e-mails em inglês, os resultados indicam que nosso método pode ser um excelente meio de classificar e-mails de spam em outras línguas também.
Shams et al. (Sun,) estudaram essa questão.