提示敏感性仍然是大型语言模型(LLMs)如GPT-4、Qwen、DeepSeek和Llama面临的主要挑战,这往往导致输出不一致、存在偏见或过长。本论文提出了一种多目标强化学习(MORL)系统,能够自动优化提示,从准确性、公平性、鲁棒性、信息含量和令牌效率等方面进行考虑。该系统基于一个包含宗教和非宗教句子对的2520个样本的文化多样性数据集、四个语义维度和不同国家进行条件设置。对维度特定变异性的统计分析显示,变异性较高,食品存在最高的偏见,而时间表现出最低的偏见影响回报塑造。每个交互被编码为丰富的语言上下文状态向量,这些信息使代理能够学习纠正策略。优化是在深度Q网络(DQN)和近端策略优化(PPO)中使用加权多目标回报完成的。尽管DQN在回报上狭窄收敛,但PPO在所有方面的验证和测试集中表现更好,包括更高的奖励、动作多样性和泛化。PPO在减少高偏见案例方面取得了良好效果,使句子情感更加平衡,并稳定了维度间的表现。总之,该框架为LLM提供了更准确、信息量更大且一致的响应,显示出MORL是文化敏感提示优化的有效解决方案。
Iqbal等人(星期四)研究了这个问题。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: