lucienhuangfu/eLLM
eLLM: Run Long-Horizon Inference Faster on CPUs Than on GPUs
何を解決するか
eLLM は、大規模言語モデル(LLM)を実行する際の CPU のメモリ帯域幅のボトルネックを克服することを目的としています。特に、長期間のタスクに特化しており、数百万トークンのコンテキスト窓や複数ターンの対話が発生する状況で、CPU サーバーが GPU よりも高速な推論を実現します。これにより、高コストで電力消費の大きな GPU ハードウェアの必要性が削減されます。
仕組み
このフレームワークは「ストレージを計算に置き換える」戦略を採用し、DDRメモリの巨大な容量を活用して、繰り返しの計算を最小限に抑えます。主な技術的実装は以下の通りです:
- エラスティック静的計算グラフ:次元優先のレイアウトを使用することで、入力長の変動に対応できる同じ実行グラフを維持し、再構築の必要がありません。
- 静的形状の KV キャッシュ:ページ化ブロック管理を、事前に割り当てられた固定形状のテンソルに置き換えることで、メタデータのオーバーヘッドを削減し、キャッシュミスを回避します。
- 大次元テンソル:大規模なシーケンス次元を予約することで、完全な Prefill をサポートし、超長プロンプトに対するパラメータの繰り返し読み込みを回避します。
- セッションキャッシュ:複数ターンの対話間で KV 状態を維持し、新しい入力を段階的に Prefill するだけで、過去の履歴を再計算する必要がありません。
対象ユーザー
長期間の AI エージェント開発に従事する開発者や研究者を主なターゲットとしています。具体的には、コンピュータ操作エージェント、大規模リポジトリ向けコードコピロット、企業知識ベース向け RAG システム、数時間から数日間の状態を維持する深層研究エージェントなどです。
特徴
- GPUを上回るパフォーマンス:長文コンテキスト推論および長期間タスクにおいて、GPUを上回ると主張しています。
- vLLM API互換性:既存の LLM エコシステムに直接接続可能です。
- 超長コンテキスト:TBスケールのメモリを使用して、数百万トークン、ほぼ無制限のコンテキスト窓をサポートします。
- 純粋なCPU推論:GPU/NPUを一切不要とし、インフラコストとエネルギー消費を削減します。
- 一貫性のある結果:推論出力は GPU 基盤の結果と一致しています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト