Tiiny-AI/PowerInfer
High-speed Large Language Model Serving for Local Deployment
What it solves
PowerInfer は、単一の消費者向け GPU を使用してパーソナルコンピュータ上で高速な大規模言語モデル(LLM)推論を実現するよう設計されています。GPU のメモリ需要を削減し、CPU と GPU 間のデータ転送を最小化することで、消費者ハードウェアのメモリ制限を克服し、従来のエンジン(例:llama.cpp)よりも高速に大規模モデルを実行できます。
How it works
PowerInfer は「activation locality」の概念を活用します。これは、さまざまな入力に対して常に活性化される少数の「ホット」ニューロンと、比較的まれにしか活性化されない「コールド」ニューロンが存在することを観測したものです。エンジンはハイブリッド CPU/GPU アプローチを取ります:
- ホットニューロン は GPU に事前ロードされ、迅速にアクセスできます。
- コールドニューロン は CPU 上で計算されます。
さらに、適応型予測器とニューロン認識スパース演算子を使用して、このプロセスを最適化し、計算効率を向上させます。
Who it’s for
ローカル環境(Windows、Linux、macOS)で消費者向けハードウェア上に LLM をデプロイしたいユーザー、かつサーバークラスの GPU(例:A100)を必要としない低レイテンシ推論を求めるユーザーを対象としています。
Highlights
- Hybrid Execution:CPU と GPU の間でワークロードをシームレスに分割し、メモリと計算のバランスを取ります。
- C‑grade GPU Support:単一 GPU 環境向けに最適化されており、特定のモデルでは llama.cpp に比べて最大 11 倍の速度向上を実現します。
- Broad Compatibility:ReLU‑sparse モデルをサポートし、Llama 2 ファミリー、Falcon‑40B、Bamboo‑7B などが含まれます。
- Flexible Deployment:VRAM 予算や INT4 量子化オプションを提供し、リソース要件をさらに削減できます。