Luce-Org/lucebox
LLM speculative inference server for heterogeneous hardware & consumer GPUs
何を解決するか
Lucebox は、NVIDIA GPU、AMD GPU、およびAPU(例:Strix Halo)を含む多様なコンシューマー向けハードウェアに高速でローカルなLLM実行をもたらす高パフォーマンスな推論エンジンです。大規模モデルをコンシューマー向け機器で実行する際のパフォーマンスのボトルネックを、予測推論とカスタムハードウェア最適化カーネルを使用して克服します。
動作方法
エンジンは、スループットを最大化し、レイテンシを低減するために複数の高度な最適化技術を採用しています:
- 予測推論:より小さな「ドラフトモデル」を使用してトークンを予測し、その後その予測をより大きなターゲットモデルで検証することで、デコードを大幅に高速化します。
- カスタムカーネル:CUDAおよびHIP向けに特定のハードウェアアーキテクチャに最適化された専用カーネル(例:DFlash、PFlash、KVFlash、Megakernel)を実装しています。
- メモリ管理:ページ化されたアテンションと連続バッチ処理を活用して、複数の同時リクエストを効率的に処理します。
- 異種実行:異なる種類のハードウェア(例:AMD GPUとAPUの組み合わせ)間でモデル実行を分散できます。
対象ユーザー
高トークン/秒の速度でコンシューマー向けハードウェア上で強力なLLMをローカルで実行したい開発者やAI愛好家、およびOpenAI互換APIを通じてLLMをコードクライアントに統合したいユーザー向けです。
主な特徴
- 広範なハードウェア対応:NVIDIA(Ampere、Ada、Blackwell)およびAMD(RDNA3、RDNA4)アーキテクチャに対応。
- 高スループット:特定のAMDハードウェアで200 tok/sを超える大幅な高速化を達成。
- OpenAI互換API:さまざまなコードクライアントやハーネスへの簡単な統合を可能にします。
- 予測プリフィルとデコード:初期プロンプト処理とトークン生成フェーズの両方を最適化。
- uma-GPUおよびミックスGPUプロファイル:さまざまなハードウェア組み合わせ向けの事前構成済み設定を提供。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト