Key points are not available for this paper at this time.
人类反馈强化学习(RLHF)通常用于使大型语言模型(LLMs)的行为与人类偏好对齐。最近,一个流行的替代方案是直接策略优化(DPO),它用策略本身取代基于LLM的奖励模型,从而消除了学习奖励模型所需的额外内存和训练时间。然而,DPO并未考虑积极和消极响应的相对质量,可能导致次优的训练结果。为了解决这个问题,我们研究了在即时微调LLM中利用内在知识来获取相对质量并帮助改进损失函数。具体而言,我们利用LLM的知识设计了一种精炼函数来估计积极和消极响应的质量。我们证明了构建的精炼函数在温和假设下可以帮助自我精炼损失函数。该精炼函数被整合到DPO及其变体身份策略优化(IPO)中。各类评估者的实验表明,它们可以改善微调模型相较于DPO和IPO的表现。
Yu等(星期五)研究了这个问题。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: