Key points are not available for this paper at this time.
急速に増加している大型言語モデル(LLM)があり、ユーザーは料金を支払うことでこれらを問い合わせることができます。私たちは、GPT-4、ChatGPT、J1-Jumbo などの人気 LLM API に問い合わせる際にかかるコストをレビューし、これらのモデルが異なる料金構造を持ち、料金が2桁の差を持つ可能性があることを発見しました。特に、大規模なクエリやテキストのコレクションに LLM を使用することは高額になる可能性があります。これに触発されて、ユーザーが LLM を使用する際の推論コストを削減するために利用できる3種類の戦略を概説し、議論します:1)プロンプト適応、2)LLM 近似、3)LLM カスケード。例として、FrugalGPTを提案します。これは、コストを削減し精度を改善するために異なるクエリに使用する LLM の組み合わせを学習するシンプルで柔軟な LLM カスケードの実装です。私たちの実験では、FrugalGPT は最高の個別 LLM(例えば、GPT-4)のパフォーマンスに匹敵することができ、コストを最大98%削減するか、同じコストで GPT-4 に対して精度を4%向上させることが示されています。ここで提示されたアイデアと発見は、LLM を持続可能かつ効率的に使用するための基盤を築いています。
Chen et al. (Tue,) はこの問題を研究しました。