检索增强生成(RAG)已成为增强大型语言模型(LLM)能力的关键技术。然而,从业人员在制定RAG部署决策时面临重大挑战。尽管现有研究优先考虑算法创新,但在理解决定RAG成功的基本工程权衡方面仍存在系统性差距。我们呈现了首次全面研究三个普遍的RAG部署决策:是否部署RAG、检索多少信息,以及如何有效整合检索到的知识。通过在三个LLM和六个数据集上进行系统实验,涵盖问答和代码生成任务,我们揭示了关键见解:(1)RAG部署必须高度选择性,变动的召回阈值和失败模式影响最多12.6%的样本,即使在完美文档的情况下。(2)最佳检索量表现出与任务相关的特性——QA任务显示出普遍模式(5-10个文档最佳),而代码生成需要场景特定的优化。(3)知识整合的有效性依赖于任务和模型特性,代码生成显著受益于提示方法,而问答则显示出最小的改进。这些发现表明普遍RAG策略是不足够的。有效的RAG系统需要基于任务特征和模型能力的上下文感知设计决策。我们的分析为从业人员提供了基于证据的指导,并建立了原则性RAG部署的基础性见解。我们的代码、数据和文物可在https://github.com/ShengmingZ/RAGBenchmarkCodeQA公开获取。
赵等(星期三)研究了这个问题。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: