Key points are not available for this paper at this time.
指令调整对于大型语言模型(LLMs)在实现更好的指令遵循和任务适应能力方面至关重要,但其成功在很大程度上依赖于训练数据的质量。许多近期的方法关注于提高数据质量,但往往忽视了数据与被微调的学生模型之间的兼容性。本文介绍了选择性反射调整,这是一种新颖的范式,结合了教师LLM的反射和内省,以改善现有数据质量,同时利用学生LLM的数据选择能力,自动精炼现有的指令调整数据。这种教师-学生合作产生了高质量且兼容学生的指令-响应对,从而实现高效的指令调整和更高性能的LLM。选择性反射调整是一种数据增强和合成,通常能够改善LLM的微调和自我改进,而无需收集全新的数据。我们将该方法应用于Alpaca和WizardLM数据,并获得更强大的顶级7B和13B LLM。我们的代码、模型和数据将在https://github.com/tianyi-lab/ReflectionTuning发布。
Li等人(周四)研究了这个问题。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: