本文介绍了沙特方言网络暴力检测(SD-CVD)语料库,这是一个用于在线平台上细粒度网络暴力检测的大规模、类别平衡的沙特方言语料库。该数据集包含 88,687 条沙特阿拉伯语推文,采用三级分层方案进行标注,将每条推文分配至 11 个互斥类别之一,涵盖良性情感(积极、中立、消极)、网络欺凌以及七种仇恨言论亚型(煽动暴力、性别歧视、国籍歧视、社会阶层歧视、部落歧视、宗教歧视和地域歧视)。为了缓解阿拉伯语网络暴力数据集中常见的类别不平衡问题,研究应用了数据增强以实现接近均匀的类别分布。标注质量通过多阶段审查得到保证,取得了极佳的标注者间一致性(Fleiss’ κ > 0.89)。我们评估了三种建模范式:采用 TF–IDF 和 n-gram 特征的传统机器学习模型(SVM、logistic regression、random forest)、基于固定句子嵌入训练的深度学习模型(LSTM、RNN、MLP、CNN)以及微调的 transformer 模型(AraBERTv02-Twitter、CAMeLBERT-MSA)。实验结果表明,transformer 模型的表现最佳,其中 AraBERTv02-Twitter 获得了最高的加权 F1-score(0.882),其次是 CAMeLBERT-MSA(0.869)。在非 transformer 基线模型中,SVM 最具竞争力(0.853),而 CNN 表现最差(0.561)。总体而言,SD-CVD 提供了一个高质量的基准和强大的基线模型,以支持未来关于鲁棒且可解释的阿拉伯语网络暴力检测的研究。
Alsayed et al. (Mon,) 研究了这一问题。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: