Key points are not available for this paper at this time.
大型语言模型 (LLMs) 通常分为两个阶段进行训练:在大型互联网规模数据集上进行预训练,以及针对下游任务进行微调。考虑到预训练的计算需求更高,直观上可以假设微调对模型添加的新信息较少,因此更易压缩。我们通过将微调模型的权重分解为其预训练组件和额外的增量,来探讨这一假设。我们提出了一种简单的方法 BitDelta,成功将这一增量量化到 1 比特,而不影响性能。这个有趣的发现不仅突显了微调过程中添加信息的潜在冗余性,而且对微调模型的多租户服务和多租户存储具有重要意义。通过使用一个高精度基础模型配合多个 1 比特增量,BitDelta 将 GPU 内存需求降低了超过 10 倍,这也可以转化为在多租户环境中增强的生成延迟。我们通过对 Llama-2 和 Mistral 模型系列的实验验证了 BitDelta,以及对高达 70B 参数的模型进行测试,展示了在所有测试设置下性能降级最小。
Liu 等人(周四)研究了这个问题。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: