Key points are not available for this paper at this time.
自然言語処理(NLP)技術の最近の進展は、大規模言語モデル(LLM)の開発によって前例のない速度で推進されています。しかし、質問の意図と一致しない応答を生成したり、間違った回答を出したりするなどの課題が残っています。本論文では、大規模言語モデルのためのさまざまなプロンプトエンジニアリング技術を分析し、広範な再学習や微調整なしで異なるデータセットにおける応答性能を最適化できる方法を特定します。特に、文脈内学習(ICL)、思考の連鎖(CoT)、検索強化生成(RAG)、段階的推論(SSR)、思考の木(ToT)などの著名なプロンプトエンジニアリング技術を検討し、これらの技術をGemma2、LlaMA3、Mistralなどの主要なLLMに適用します。これらのモデルの性能は、AI2推論チャレンジ(ARC)、HellaSwag、マッシブマルチタスク言語理解(MMLU)、TruthfulQA、Winogrande、グレードスクール数学(GSM8k)データセットを用いてBLEU、ROUGE、METEOR、BLEURT、BERTScoreなどの指標で評価されました。実験結果は、最も適切なプロンプトエンジニアリング技術が各データセットの特性によって異なることを示しています。特に、数学的および論理的推論を強調するデータセットでは、CoT、SSR、およびToTに基づくプロンプトエンジニアリング戦略が有利であることがわかりました。自然言語理解に重点を置くデータセットでは、ICL中心の戦略がより効果的であり、事実の正確性が重要なデータセットではRAGベースの戦略が有益でした。しかし、プロンプトエンジニアリング技術の最適な組み合わせは特定のLLMによって異なる可能性があることも観察されており、モデルとデータセットに応じてプロンプトエンジニアリングアプローチを微調整することが最高の性能を達成するために重要であることを示しています。結果は、LLMがより高度になるにつれて、プロンプトエンジニアリング(PE)技術への依存が減少する一方で、PE戦略を適用した際の性能向上の magnitude が増加することを示しています。さらに、これらの高度なモデルはICL技術への依存が少なくなる傾向がありますが、RAG戦略への依存が高まることが示されています。また、PEベースの前処理を伴うRAGの実装が、生データに単にRAGを適用するよりも優れた性能向上をもたらすことが明らかです。
Son et al. (Thu,) はこの問題を研究しました。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: