PaddlePaddle/FastDeploy
High-performance Inference and Deployment Toolkit for LLMs and VLMs based on PaddlePaddle
What it solves
FastDeploy は、プロダクション環境で Large Language Model(LLM) と Vision Language Model(VLM) をデプロイする際の複雑さに対処します。リソース使用率を最適化し、スループットを向上させ、さまざまなハードウェアプラットフォームでサービスレベル目標(SLO)を満たすことができる、プロダクション向けツールキットを提供します。
How it works
PaddlePaddle 上に構築された FastDeploy は、以下の高性能推論技術を実装しています。
- PD Separation: 動的ロールスイッチングとコンテキストキャッシュを可能にするロードバランス型 Prefill‑Decode 分離戦略で、スループットを最適化します。
- KV Cache Management: NVLink または RDMA をインテリジェントに選択する軽量高性能転送ライブラリを使用し、キャッシュ転送を効率化します。
- Acceleration Techniques: 投機的デコード、マルチトークン予測(MTP)、チャンク化プレフィリングを活用して生成速度を向上させます。
- Quantization: W8A16、W8A8、W4A16、W4A8、W2A16、FP8 など複数のフォーマットに対応し、メモリ使用量を削減しつつ速度を向上させます。
- API Compatibility: OpenAI 互換 API を提供し、vLLM インターフェースとも互換性があります。
Who it’s for
NVIDIA GPU や Kunlunxin XPU、Hygon DCU、Intel Gaudi など多様なハードウェア上で、ERNIE、Qwen、DeepSeek などの LLM/VLM を本番環境にデプロイしたい開発者・エンジニア向けです。
Highlights
- Broad Hardware Support: NVIDIA、Kunlunxin、Hygon、Iluvatar、Enflame、Metax、Intel Gaudi に対応。
- Production-Grade Features: ロードバランス型 PD 分離とグローバルキャッシュプーリングを搭載。
- vLLM Compatibility: vLLM 互換インターフェースでシングルコマンドデプロイが可能。
- Extensive Model Support: Qwen3‑VL、DeepSeek V3、ERNIE 系列など幅広いモデルをサポート。