Tiiny-AI/PowerInfer
High-speed Large Language Model Serving for Local Deployment
What it solves
PowerInfer 旨在讓個人電腦使用單一消費級 GPU 進行高速的大型語言模型(LLM)推理。它透過降低 GPU 記憶體需求與最小化 CPU 與 GPU 之間的資料傳輸,解決了消費硬體的記憶體限制,使大型模型的執行速度快於傳統引擎(如 llama.cpp)。
How it works
PowerInfer 利用「activation locality」的概念,觀察到在不同輸入中只有少數「熱」神經元會持續被激活,而「冷」神經元則較少被觸發。引擎採用 CPU/GPU 混合方式:
- 熱神經元 事先載入 GPU,以便快速存取。
- 冷神經元 在 CPU 上計算。
此外,系統還使用自適應預測器與神經元感知的稀疏運算子,進一步提升計算效率。
Who it’s for
此工具適合希望在消費級硬體(Windows、Linux 或 macOS)上本地部署 LLM,且需要低延遲推理而不必依賴伺服器級 GPU(如 A100)的使用者。
Highlights
- Hybrid Execution:無縫在 CPU 與 GPU 之間分割工作負載,以平衡記憶體與計算資源。
- C‑grade GPU Support:針對單 GPU 設定進行最佳化,在某些模型上可比 llama.cpp 快 11 倍。
- Broad Compatibility:支援 ReLU‑sparse 模型,包括 Llama 2 系列、Falcon‑40B 與 Bamboo‑7B。
- Flexible Deployment:提供 VRAM 預算與 INT4 量化選項,以進一步降低資源需求。