直接偏好优化(DPO)因其简便性和计算效率在对齐大型语言模型(LLMs)中得到了显著关注。最近的进展将DPO扩展到多模态场景,取得了良好的性能。然而,传统的DPO依赖于二元偏好优化,奖励或惩罚整个响应而不考虑细粒度片段的正确性,导致次优解。这个问题的根源在于优化过程中缺乏细粒度监督。为了解决这个问题,我们提出了自适应句子级偏好优化(ASPO),它评估单个句子以实现更精确的偏好优化。通过根据模型预测动态计算自适应奖励,ASPO提升了响应内容评估,而无需额外的模型或参数。这显著改善了多模态特征的对齐。广泛的实验表明,ASPO显著提升了多模态模型的整体性能。
Wang et al.(Sun,)研究了这个问题。