Key points are not available for this paper at this time.
我们介绍猎鹰系列:7B、40B 和 180B 参数的因果解码器模型,这些模型是在多样化的高质量语料库上训练的,主要来自网络数据。最大模型 Falcon-180B 已在超过 3.5 万亿个文本标记上进行训练——这是最大的公开文档化的预训练过程。Falcon-180B 显著优于 PaLM 或 Chinchilla 等模型,并在与之同时开发的模型如 LLaMA 2 或 Inflection-1 的基础上进行了改进。它在预训练和推理成本降低的情况下,接近 PaLM-2-Large 的性能,这使它在我们看来成为世界上三大最佳语言模型之一,另外两个是 GPT-4 和 PaLM-2-Large。我们报告了详细的评估结果,以及深入介绍用于预训练猎鹰的技术和定制工具。值得注意的是,我们报告了自己的定制分布式训练代码库,使我们能够在 AWS 云基础设施上高效地在多达 4096 个 A100 上进行预训练,并且具有有限的互连。我们发布了一个包含 600B 标记的网络数据集提取,以及以宽松许可发布的 Falcon-7/40/180B 模型,以促进开放科学并加速大型语言模型开放生态系统的发展。
Almazrouei 等人 (星期二) 研究了这个问题。