Tiiny-AI/PowerInfer
High-speed Large Language Model Serving for Local Deployment
What it solves
PowerInfer 旨在让个人电脑使用单个消费级 GPU 实现高速的大型语言模型(LLM)推理。它通过降低 GPU 内存需求并最小化 CPU 与 GPU 之间的数据传输,解决了消费硬件的内存限制,使大型模型的运行速度快于传统引擎(如 llama.cpp)。
How it works
PowerInfer 利用“activation locality”的概念,观察到在不同输入中只有少数“热”神经元会持续被激活,而“冷”神经元则较少被触发。引擎采用 CPU/GPU 混合方式:
- 热神经元 预加载到 GPU,以实现快速访问。
- 冷神经元 在 CPU 上计算。
此外,系统还使用自适应预测器和神经元感知的稀疏算子,进一步提升计算效率。
Who it’s for
它面向希望在消费级硬件(Windows、Linux 或 macOS)上本地部署 LLM,并且需要低延迟推理而不必依赖服务器级 GPU(如 A100)的用户。
Highlights
- Hybrid Execution:无缝在 CPU 与 GPU 之间分割工作负载,以平衡内存和计算资源。
- C‑grade GPU Support:针对单 GPU 环境进行优化,在某些模型上可比 llama.cpp 提速至 11 倍。
- Broad Compatibility:支持 ReLU‑sparse 模型,包括 Llama 2 系列、Falcon‑40B 与 Bamboo‑7B。
- Flexible Deployment:提供 VRAM 预算和 INT4 量化选项,以进一步降低资源需求。