Key points are not available for this paper at this time.
一系列事件表明,由 Twitter 垃圾推文引发的诸多安全威胁已远远超出社交媒体平台的范围,并对现实世界产生影响。许多研究应用机器学习技术对垃圾推文进行分类,以缓解此类威胁。然而,由于类别不平衡以及垃圾信息技术的不断演变,Twitter 垃圾内容检测面临着巨大挑战。本文提出了一种将双重 LSTM 网络与元分类器相结合的异构集成方法,以解决不平衡 Twitter 垃圾推文检测问题。我们的架构融合了处理用户行为特征的基于相似度的 LSTM 与分析文本语义模式的词嵌入 LSTM,随后连接一个在存在分歧的实例上训练的 XGBoost 元分类器。在两个基准数据集(1KS10KN 和 HSPAM)上的实验表明,我们的模型优于现有的基线模型,分别取得了 0.952 和 0.945 的 F1 分数。这种以精确率为导向的方法取得了契合社交媒体内容审核要求的有效性能,同时保持了实际部署的可行性。该异构集成框架在垃圾内容检测之外的其他不平衡文本分类领域展现出强大的应用潜力,为网络安全和内容审核系统提供了坚实的基础。
Wang et al. (Sat,) 对该问题进行了研究。