Key points are not available for this paper at this time.
大規模言語モデル(LLM)は、その多様性と様々なタスクに対する有用性から、科学および産業分野で広く採用されています。しかし、これらのモデルを最適なスループットと待機時間で大規模に展開しサービスを提供することは、主にLLMに伴う高い計算およびメモリ要求のため、大きな課題となっています。この制限に対処するために、我々はエキスパートルーターを導入します。これは複数の専門モデルを効率的に調整するために設計されたシステムであり、スケーラビリティを向上させます。エキスパートルーターは、クラスタリング手法を使用して受信リクエストを分配する中央ルーティングゲートウェイを持つ並列推論システムです。このアプローチは、利用可能なLLMの間で受信リクエストを効果的に分割し、全体のスループットを最大化します。我々の広範な評価は、最大1,000人の同時ユーザーを含み、ユーザーとインフラストラクチャの観点からシステムの挙動に関する包括的な洞察を提供しました。結果は、エキスパートルーターが高負荷シナリオを処理し、特に多くの同時ユーザーの下で高いスループット率を達成する効果を示しています。
Pichlmeier et al. (2024)はこの問題を研究しました。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: