Key points are not available for this paper at this time.
本文着手探索大型语言模型(LLM)数据集,这些数据集在LLM的显著进展中发挥着关键作用。这些数据集作为基础设施,类似于支持和培养LLM发展的根系。因此,对这些数据集的研究成为一个重要课题。为了应对当前缺乏大型语言模型数据集的全面概述和深入分析的现状,并获得对其当前状态和未来趋势的洞察,本调查从以下五个方面整合和分类LLM数据集的基本内容:(1)预训练语料库;(2)指令微调数据集;(3)偏好数据集;(4)评估数据集;(5)传统自然语言处理(NLP)数据集。该调查揭示了当前面临的挑战,并指出了未来研究的潜在方向。此外,还提供了现有数据集资源的全面回顾,包括来自444个数据集的统计数据,涵盖8种语言类别,跨越32个领域。数据集统计信息包含20个维度。调查的总数据量超过774.5 TB的预训练语料库和700M的其他数据集实例。我们旨在呈现LLM文本数据集的整体格局,为该领域的研究人员提供全面的参考,并为未来的研究做出贡献。相关资源可在以下地址获得:https://github.com/lmmlzn/Awesome-LLMs-Datasets.
Liu等人(星期二)研究了这个问题。