PaddlePaddle/FastDeploy
High-performance Inference and Deployment Toolkit for LLMs and VLMs based on PaddlePaddle
What it solves
FastDeploy 解決了在生產環境中部署大型語言模型(LLMs)與視覺語言模型(VLMs)的複雜性。它提供了一套面向生產的工具組,能優化資源利用率、提升吞吐量,並在各種硬體平台上滿足服務水平目標(SLO)。
How it works
FastDeploy 基於 PaddlePaddle,實作了多項高效能推論技術:
- PD Separation:一種負載平衡的 Prefill‑Decode 分離策略,支援動態角色切換與上下文快取,以優化吞吐量。
- KV Cache Management:使用輕量級高效能傳輸庫,智慧選擇 NVLink 或 RDMA,實現高效快取傳輸。
- Acceleration Techniques:採用投機解碼、多令牌預測(MTP)與分塊預填充,加速生成過程。
- Quantization:支援 W8A16、W8A8、W4A16、W4A8、W2A16、FP8 等多種量化格式,降低記憶體佔用並提升速度。
- API Compatibility:提供相容 OpenAI 的 API,亦相容 vLLM 介面,便於整合。
Who it’s for
適用於需要在多種硬體上(包括 NVIDIA GPU、Kunlunxin XPU、Hygon DCU、Intel Gaudi 等)將 LLM 與 VLM(如 ERNIE、Qwen、DeepSeek)投入生產的開發者與工程師。
Highlights
- Broad Hardware Support:相容 NVIDIA、Kunlunxin、Hygon、Iluvatar、Enflame、Metax、Intel Gaudi 等硬體。
- Production-Grade Features:包含負載平衡的 PD 分離與全域快取池化。
- vLLM Compatibility:支援使用 vLLM 相容介面進行單指令部署。
- Extensive Model Support:支援包括 Qwen3‑VL、DeepSeek V3、ERNIE 系列在內的廣泛模型。