Tiiny-AI/PowerInfer

High-speed Large Language Model Serving for Local Deployment

What it solves

PowerInfer 旨在让个人电脑使用单个消费级 GPU 实现高速的大型语言模型(LLM)推理。它通过降低 GPU 内存需求并最小化 CPU 与 GPU 之间的数据传输,解决了消费硬件的内存限制,使大型模型的运行速度快于传统引擎(如 llama.cpp)。

How it works

PowerInfer 利用“activation locality”的概念,观察到在不同输入中只有少数“热”神经元会持续被激活,而“冷”神经元则较少被触发。引擎采用 CPU/GPU 混合方式:

  • 热神经元 预加载到 GPU,以实现快速访问。
  • 冷神经元 在 CPU 上计算。

此外,系统还使用自适应预测器和神经元感知的稀疏算子,进一步提升计算效率。

Who it’s for

它面向希望在消费级硬件(Windows、Linux 或 macOS)上本地部署 LLM,并且需要低延迟推理而不必依赖服务器级 GPU(如 A100)的用户。

Highlights

  • Hybrid Execution:无缝在 CPU 与 GPU 之间分割工作负载,以平衡内存和计算资源。
  • C‑grade GPU Support:针对单 GPU 环境进行优化,在某些模型上可比 llama.cpp 提速至 11 倍。
  • Broad Compatibility:支持 ReLU‑sparse 模型,包括 Llama 2 系列、Falcon‑40B 与 Bamboo‑7B。
  • Flexible Deployment:提供 VRAM 预算和 INT4 量化选项,以进一步降低资源需求。