PaddlePaddle/FastDeploy
High-performance Inference and Deployment Toolkit for LLMs and VLMs based on PaddlePaddle
What it solves
FastDeploy 解决了在生产环境中部署大语言模型(LLMs)和视觉语言模型(VLMs)的复杂性。它提供了一个面向生产的工具包,能够优化资源利用率、提升吞吐量,并在各种硬件平台上满足服务水平目标(SLO)。
How it works
FastDeploy 基于 PaddlePaddle,实现了多项高性能推理技术:
- PD Separation:一种负载均衡的 Prefill‑Decode 分离策略,支持动态角色切换和上下文缓存,以优化吞吐量。
- KV Cache Management:使用轻量级高性能传输库,智能选择 NVLink 或 RDMA,实现高效缓存传输。
- Acceleration Techniques:采用投机解码、多令牌预测(MTP)和分块预填充,加速生成过程。
- Quantization:支持 W8A16、W8A8、W4A16、W4A8、W2A16、FP8 等多种量化格式,降低内存占用并提升速度。
- API Compatibility:提供兼容 OpenAI 的 API,并兼容 vLLM 接口,便于集成。
Who it’s for
适用于需要在多种硬件上(包括 NVIDIA GPU、Kunlunxin XPU、Hygon DCU、Intel Gaudi 等)将 LLM 和 VLM(如 ERNIE、Qwen、DeepSeek)投入生产的开发者和工程师。
Highlights
- Broad Hardware Support:兼容 NVIDIA、Kunlunxin、Hygon、Iluvatar、Enflame、Metax、Intel Gaudi 等硬件。
- Production-Grade Features:包括负载均衡的 PD 分离和全局缓存池化。
- vLLM Compatibility:支持使用 vLLM 兼容接口进行单命令部署。
- Extensive Model Support:支持包括 Qwen3‑VL、DeepSeek V3、ERNIE 系列在内的广泛模型。