摘要 本研究探讨了使用变压器模型的基于语义的聚类,旨在克服传统文本聚类方法的局限性。传统方法依赖于词频,而本研究利用BERT和SciBERT的上下文理解能力进行更微妙的文本组织。该方法将基于变压器的语义嵌入与各种池化策略和聚类算法相结合,并将其性能与TF-IDF基线进行了比较。实验扩展到五个不同领域:新闻、研究论文、电子商务产品、电影和招聘信息。观察到采用CLS池化的基于变压器的嵌入在所有领域中均优于传统方法,生成了更连贯的聚类。SciBERT在科学文本中尤其有效。这些发现显示了个性化学习系统、内容组织和推荐系统中可能的应用,其中语义解释至关重要。该研究提供了一个框架,以开发更适合捕捉复杂文档集合中的上下文联系和语义细微之处的文本聚类解决方案。
Suresh等(周四)研究了这个问题。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: