本数据描述符呈现了两个完全合成的乌兹别克语情感分析和命名实体识别(NER)语料库。第一个语料库包含12,000个从模板生成的混合合成句子,具有词汇随机化、自动插入命名实体(人/组织/地点)、基于词典的极性评分和控制的表情符号分布。第二个语料库包括3000个设计成短小、自然结构的“手动风格”句子。尽管手动风格的子集最初计划不包含表情符号,但发布版本中包含39.6%的表情符号(至少包含一个表情符号的句子),以保持跨语料库情感标记的可比性。两个语料库以CSV、XLSX和JSONL格式发布,并共享统一的架构(id,文本,情感,实体,实体类型,极性得分,极性来源,令牌计数,表情符号,表情符号位置,表情符号情感,冲突标志,情感来自极性得分,划分)。该数据集可通过Mendeley Data公开获取(DOI: 10.17632/y2d5pcyrzz.3)。
Saidov等(Sun,)研究了这个问题。