PaddlePaddle/FastDeploy

High-performance Inference and Deployment Toolkit for LLMs and VLMs based on PaddlePaddle

What it solves

FastDeploy는 프로덕션 환경에서 대형 언어 모델(LLM) 및 비전 언어 모델(VLM)을 배포하는 복잡성을 해결합니다. 리소스 활용을 최적화하고 처리량을 높이며 다양한 하드웨어 플랫폼 전반에 걸쳐 서비스 수준 목표(SLO)를 충족할 수 있는 프로덕션 준비된 툴킷을 제공합니다.

How it works

PaddlePaddle을 기반으로 구축된 FastDeploy는 여러 고성능 추론 기술을 구현합니다:

  • PD Separation: 동적 역할 전환 및 컨텍스트 캐싱을 가능하게 하는 로드 밸런싱 Prefill‑Decode 분리 전략으로 처리량을 최적화합니다.
  • KV Cache Management: NVLink 또는 RDMA를 지능적으로 선택하는 경량 고성능 전송 라이브러리를 사용해 효율적인 캐시 전송을 수행합니다.
  • Acceleration Techniques: 추측 디코딩, 다중 토큰 예측(MTP), 청크 프리필링을 활용해 생성 속도를 높입니다.
  • Quantization: W8A16, W8A8, W4A16, W4A8, W2A16, FP8 등 다양한 포맷을 지원해 메모리 사용량을 줄이고 속도를 향상시킵니다.
  • API Compatibility: OpenAI 호환 API를 제공하며 vLLM 인터페이스와도 호환됩니다.

Who it’s for

NVIDIA GPU, Kunlunxin XPU, Hygon DCU, Intel Gaudi 등 다양한 하드웨어에서 ERNIE, Qwen, DeepSeek와 같은 LLM/VLM을 프로덕션에 배포해야 하는 개발자와 엔지니어를 위해 설계되었습니다.

Highlights

  • Broad Hardware Support: NVIDIA, Kunlunxin, Hygon, Iluvatar, Enflame, Metax, Intel Gaudi와 호환됩니다.
  • Production-Grade Features: 로드 밸런싱 PD 분리와 전역 캐시 풀링을 포함합니다.
  • vLLM Compatibility: vLLM 호환 인터페이스를 통해 단일 명령 배포가 가능합니다.
  • Extensive Model Support: Qwen3‑VL, DeepSeek V3, ERNIE 시리즈 등 다양한 모델을 지원합니다.