大型语言模型(LLMs)的性能严重依赖于所选的提示策略,然而静态方法如零样本(Zero-Shot)、少样本(Few-Shot)或思维链(Chain-of-Thought, CoT)则强加了刚性的效率-准确性权衡。高度准确的策略如自一致性(Self-Consistency, SC)在简单任务上会产生大量计算浪费,而轻量级方法在复杂输入上往往失败。本文介绍了提示策略网络(Prompt Policy Network, PPN),这是一个轻量级强化学习框架,将自适应策略选择形式化为单步马尔可夫决策过程(Markov Decision Process, MDP)。PPN经过邻近策略优化(Proximal Policy Optimization, PPO)训练,并由一个资源明确的奖励函数指导,学习在必要时仅分配代价昂贵的推理策略。在算术推理基准上的实验表明,PPN在效率-准确性帕累托前沿上表现优越,相较于自一致性减少了高达61.5%的标记成本,同时保持了竞争力的准确性。这项工作为成本有效的LLM部署提供了一个系统的自适应框架,推动了可扩展和可持续语言模型应用的轻量级优化技术的设计。
Jiexi Xu(孙)研究了这个问题。