Key points are not available for this paper at this time.
大規模言語モデル(LLM)は、数多くの現実の課題に対処するための膨大な可能性を秘めていますが、通常、かなりの計算リソースとメモリを要求します。メモリ容量が制限されたリソース制約のあるハードウェアデバイスにLLMを展開することは、 considerable challenges を提示します。分散コンピューティングは、単一ノードのメモリ制約を緩和し、LLMの推論性能を加速するための一般的な戦略として浮上しています。ハードウェアの制限負担を軽減するために、CPU上のLLMのための効率的な分散推論最適化ソリューションを提案しました。提案されたソリューションで5世代Intel Xeonスケーラブルプロセッサで実験を行い、72Bパラメータを持つLLMの出力トークンあたりの時間は140 ms/tokenであり、平均的な人間の読み取り速度である約200 ms/tokenよりもはるかに速いことが示されました。
He et al. (Thu,) はこの問題を研究しました。