Tiiny-AI/PowerInfer
High-speed Large Language Model Serving for Local Deployment
What it solves
PowerInfer는 단일 소비자용 GPU를 사용해 개인 컴퓨터에서 고속 대형 언어 모델(LLM) 추론을 가능하게 설계되었습니다. GPU 메모리 요구량을 줄이고 CPU와 GPU 간 데이터 전송을 최소화함으로써 소비자 하드웨어의 메모리 제한을 해결하고, 기존 엔진(예: llama.cpp)보다 더 빠르게 대형 모델을 실행할 수 있습니다.
How it works
PowerInfer는 "activation locality" 개념을 활용합니다. 이는 다양한 입력에 대해 소수의 "핫" 뉴런은 지속적으로 활성화되는 반면, "콜드" 뉴런은 덜 자주 활성화된다는 관찰에 기반합니다. 엔진은 하이브리드 CPU/GPU 방식을 사용합니다:
- 핫 뉴런은 GPU에 미리 로드되어 빠르게 접근할 수 있습니다.
- 콜드 뉴런은 CPU에서 계산됩니다.
또한 적응형 예측기와 뉴런 인식 스파스 연산자를 사용해 이 과정을 최적화하고 계산 효율성을 높입니다.
Who it’s for
소비자용 하드웨어(Windows, Linux, macOS)에서 로컬로 LLM을 배포하고, 서버급 GPU(A100 등)를 필요로 하지 않으며 낮은 지연 시간의 추론을 원하는 사용자들을 위한 것입니다.
Highlights
- Hybrid Execution: CPU와 GPU 사이에 워크로드를 원활하게 분할하여 메모리와 계산을 균형 있게 관리합니다.
- C‑grade GPU Support: 단일 GPU 환경에 최적화되어 특정 모델에서는 llama.cpp 대비 최대 11배의 속도 향상을 제공합니다.
- Broad Compatibility: ReLU‑sparse 모델을 지원하며 Llama 2 시리즈, Falcon‑40B, Bamboo‑7B 등이 포함됩니다.
- Flexible Deployment: VRAM 예산 및 INT4 양자화 옵션을 제공해 리소스 요구 사항을 추가로 감소시킵니다.