我们提出了密度场状态空间模型(DF-SSM),这是一个将状态空间模型压缩到1位支架并使用int8低秩校正的框架。应用于Mamba-2 1.3B,我们实现了一个278 MB的模型(比2.7 GB FP16教师小9.7倍),在GPU上以21.4倍的推理速度运行(批量=1,相对于mamba-ssm参考实现),同时将下游任务性能保持在BitMamba-2的2-4个百分点之内,BitMamba-2是一个从150B tokens训练的1.58位模型。蒸馏本身只需要32M tokens和在单个A100 GPU上6小时,尽管它假设有一个预训练的FP16教师。我们开发了一个优化的推理管道,结合了cuBLAS INT8张量核心用于支架矩阵乘法,自定义CUDA内核用于状态空间模型和卷积操作,以及一个AVX-512 CPU后端,以便在GPU和CPU上进行高效部署。除了压缩之外,我们还研究了生成模型的内部知识组织,发现了三个不同的处理阶段:意图分类(第0-3层,在没有词汇对齐的抽象空间中操作)、知识检索(第25-35层,事实关联局限于5层窗口)和输出格式化(第36-47层,类别结构消失)。通过对19个类别的445个事实提示进行系统分析,我们发现早期层的分类是句法的(由模板结构驱动),而不是语义的,并且该模型表现出良好的知识表示,尽管事实回忆薄弱——这表明表示结构可能优于事实强度。
Chirag Shinde(Mon,)研究了这个问题。