Key points are not available for this paper at this time.
長文コンテキスト大規模言語モデル(LLM)への需要が高まる中、最大128Kまたは1Mトークンのコンテキストウィンドウを持つモデルがますます一般的になっています。しかし、長文コンテキストLLMの推論は、シーケンスの長さが増すにつれて推論速度が大幅に低下するため、挑戦が伴います。この遅延は、主にセルフアテンション中に大きなKVキャッシュをロードすることに起因しています。先行研究では、重要なトークンの小部分がアテンションの結果を支配することが示されています。しかし、トークンの重要性はクエリに大きく依存することを観察しました。この目的のために、クエリ認識のKVキャッシュ選択アルゴリズムであるQuestを提案します。Questは、KVキャッシュページ内の最小および最大のキー値を追跡し、クエリベクトルを使用して指定されたページの重要性を評価します。アテンションのためにTop-Kの重要なKVキャッシュページのみをロードすることで、Questは精度を犠牲にすることなくセルフアテンションの速度を大幅に向上させます。Questは、最大2.23倍のセルフアテンションの高速化を達成でき、推論の待機時間を7.03倍短縮しながら、長い依存関係のあるタスクでもわずかな精度損失で良好に動作することを示します。コードはhttp://github.com/mit-han-lab/Questで入手可能です。
Tang et al. (2024)はこの問題を研究しました。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: