在资源受限的边缘环境(≤1B参数,≤2GB内存,≤100ms延迟)中部署专门的语言模型面临着一个关键挑战:监督微调(SFT)实现了领域专业知识,但遭受不可逆转的灾难性遗忘,而传统的低秩适应(LoRA)在保守秩(r ≤ 64)下通常由于适应能力不足而表现不佳。本工作提出了H-LoRA(高秩LoRA)用于可在边缘部署的模型,并在破坏性遗忘与可控知识保留之间建立了基本的区别。通过对三个领域(人力资源、医学、数学)中小型模型(0.12B Minimind和Qwen-0.5B)进行的综合实验,使用29,647个样本,我们证明了SFT和H-LoRA都表现出通用能力的下降,但它们在根本上是不同的:SFT完全破坏了原有知识结构(1%的主题保留),而H-LoRA则保持了知识完整性,主题保留率高达90%——提高了89个百分点——使得部署后能力得以恢复。H-LoRA在模型的隐藏维度的约三分之二的范围内(r = 512,d = 768)采用简化的扩展和战略性的高秩适应,以SFT水平的领域性能(99.81%的精度)实现5倍的参数效率(20.35%的可训练参数)和强健的跨域泛化(93.5 ± 6.8%的平均精度)。此外,H-LoRA将OTA更新大小从1.4GB减少到96MB(≈93%),使得在带宽受限的边缘环境中能够频繁实用地部署专门模型。除了展示有效性外,本工作还建立了第一个全面框架,用于描述参数高效微调中的专业化与保留之间的权衡,为实际部署中的方法选择提供了实用指导。
Lun et al. (Thu,) 研究了这个问题。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: