Tiiny-AI/PowerInfer

High-speed Large Language Model Serving for Local Deployment

What it solves

PowerInfer 旨在讓個人電腦使用單一消費級 GPU 進行高速的大型語言模型(LLM)推理。它透過降低 GPU 記憶體需求與最小化 CPU 與 GPU 之間的資料傳輸,解決了消費硬體的記憶體限制,使大型模型的執行速度快於傳統引擎(如 llama.cpp)。

How it works

PowerInfer 利用「activation locality」的概念,觀察到在不同輸入中只有少數「熱」神經元會持續被激活,而「冷」神經元則較少被觸發。引擎採用 CPU/GPU 混合方式:

  • 熱神經元 事先載入 GPU,以便快速存取。
  • 冷神經元 在 CPU 上計算。

此外,系統還使用自適應預測器與神經元感知的稀疏運算子,進一步提升計算效率。

Who it’s for

此工具適合希望在消費級硬體(Windows、Linux 或 macOS)上本地部署 LLM,且需要低延遲推理而不必依賴伺服器級 GPU(如 A100)的使用者。

Highlights

  • Hybrid Execution:無縫在 CPU 與 GPU 之間分割工作負載,以平衡記憶體與計算資源。
  • C‑grade GPU Support:針對單 GPU 設定進行最佳化,在某些模型上可比 llama.cpp 快 11 倍。
  • Broad Compatibility:支援 ReLU‑sparse 模型,包括 Llama 2 系列、Falcon‑40B 與 Bamboo‑7B。
  • Flexible Deployment:提供 VRAM 預算與 INT4 量化選項,以進一步降低資源需求。