PaddlePaddle/PaddleNLP
Easy-to-use and powerful LLM and SLM library with awesome model zoo.
What it solves
PaddleNLP は、PaddlePaddle ディープラーニングフレームワーク上に構築された大規模言語モデル(LLM)向け開発スイートです。トレーニング、圧縮、推論という LLM の全ライフサイクルの複雑さを、さまざまなハードウェアプラットフォームで動作する統一ツールキットで解決し、異なるチップ間の開発コストを削減します。
How it works
このスイートは AI パイプラインの各段階向けに包括的なツールセットを提供します:
- Training: データ並列、グループパラメータシャーディング、テンソルモデル並列、パイプラインモデル並列という 4D 高性能トレーニングをサポートし、Unified Checkpoint ツールで動的リソーススケーリングと効率的なモデル保存を実現します。
- Fine-tuning: zero‑padding データストリームと FlashMask 演算子を利用し、無効計算を削減してスループットを向上させます。
- Inference: 動的挿入と演算子融合戦略を組み合わせた高性能推論モジュールで生成速度を加速します。
- Hardware Adaptation: NVIDIA GPU、Kunlun XPU、Ascend NPU、Suizyuan GCU、Haiguang DCU など複数のハードウェアバックエンドをサポートする標準化インターフェースを提供します。
Who it’s for
産業レベルの LLM アプリケーションを実装したい開発者や組織向けに設計されており、特に Llama、Qwen、DeepSeek などの人気モデルを多様なハードウェア環境で効率的にトレーニング・デプロイしたいユーザーに適しています。
Highlights
- Broad Model Support: Llama(最大 3.3)、Qwen(最大 3)、DeepSeek(V2、V3、R1)、ChatGLM、Mistral など幅広いモデルファミリーに対応。
- Hardware Flexibility: NVIDIA GPU だけでなく、複数の AI アクセラレータをネイティブにサポート。
- Storage Efficiency: Unified Checkpoint 技術によりモデル保存を 95% 加速し、最大 78.5% のストレージ容量を削減。
- Advanced Inference: FP8、INT8、4 ビット量子化に加え、speculative decoding をサポートし、高スループット推論を実現。