本文针对Stanford Sentiment Treebank v2 (SST-2) 数据集提出了一种在模型准确率方面具有更强鲁棒性的新型文本分类模型。我们开发了一种基于循环神经网络与Bert(RNNBertbased)的模型,旨在提高在 SST-2 数据集上的分类准确率。该数据集由电影评论句子组成,每个句子均标记为正面或负面情感,属于二分类任务。循环神经网络(RNN)在文本分类中十分有效,因为它们能够捕获语言的序列特性,这对于理解上下文和语义至关重要。Bert通过提供双向上下文、生成上下文嵌入并利用在大规模语料库上的预训练,在文本分类中表现出色。这使得Bert能够有效捕获文本中细微的语义和关联。将Bert与RNN相结合在文本分类中非常有效。Bert的双向上下文和丰富的嵌入提供了对文本的深度理解,而RNN则捕获序列模式和长程依赖关系。二者结合充分利用了两种架构的优势,从而提升了复杂分类任务的性能。此外,我们还开发了Bert模型与K-最近邻融合(KNNBertbased)方法,作为本研究所提方案的对比方案。实验结果表明,在准确率方面,我们提出的模型优于传统文本分类模型以及现有模型。
Eang et al. (Wed,) 对此问题进行了研究。