Tiiny-AI/PowerInfer

High-speed Large Language Model Serving for Local Deployment

What it solves

PowerInfer は、単一の消費者向け GPU を使用してパーソナルコンピュータ上で高速な大規模言語モデル(LLM)推論を実現するよう設計されています。GPU のメモリ需要を削減し、CPU と GPU 間のデータ転送を最小化することで、消費者ハードウェアのメモリ制限を克服し、従来のエンジン(例:llama.cpp)よりも高速に大規模モデルを実行できます。

How it works

PowerInfer は「activation locality」の概念を活用します。これは、さまざまな入力に対して常に活性化される少数の「ホット」ニューロンと、比較的まれにしか活性化されない「コールド」ニューロンが存在することを観測したものです。エンジンはハイブリッド CPU/GPU アプローチを取ります:

  • ホットニューロン は GPU に事前ロードされ、迅速にアクセスできます。
  • コールドニューロン は CPU 上で計算されます。

さらに、適応型予測器とニューロン認識スパース演算子を使用して、このプロセスを最適化し、計算効率を向上させます。

Who it’s for

ローカル環境(Windows、Linux、macOS)で消費者向けハードウェア上に LLM をデプロイしたいユーザー、かつサーバークラスの GPU(例:A100)を必要としない低レイテンシ推論を求めるユーザーを対象としています。

Highlights

  • Hybrid Execution:CPU と GPU の間でワークロードをシームレスに分割し、メモリと計算のバランスを取ります。
  • C‑grade GPU Support:単一 GPU 環境向けに最適化されており、特定のモデルでは llama.cpp に比べて最大 11 倍の速度向上を実現します。
  • Broad Compatibility:ReLU‑sparse モデルをサポートし、Llama 2 ファミリー、Falcon‑40B、Bamboo‑7B などが含まれます。
  • Flexible Deployment:VRAM 予算や INT4 量子化オプションを提供し、リソース要件をさらに削減できます。