PaddlePaddle/PaddleNLP

Easy-to-use and powerful LLM and SLM library with awesome model zoo.

What it solves

PaddleNLP 是一套基於 PaddlePaddle 深度學習框架的 大型語言模型(LLM) 開發套件。它透過提供一個可在各種硬體平台上運作的統一工具箱,解決了完整 LLM 生命週期(訓練、壓縮與推理)的複雜性,降低了在不同晶片之間切換的開發成本。

How it works

此套件為 AI 流程的不同階段提供完整的工具集合:

  • Training: 支援 4D 高效能訓練(資料平行、分組參數分片、張量模型平行與流水線模型平行),並內建 Unified Checkpoint 工具以動態資源調整與高效模型儲存。
  • Fine-tuning: 使用 zero‑padding 資料流與 FlashMask 演算子,減少無效計算並提升吞吐量。
  • Inference: 採用高效能推理模組,結合動態插入與演算子融合策略,加速生成速度。
  • Hardware Adaptation: 提供標準化介面支援多種硬體後端,包括 NVIDIA GPU、Kunlun XPU、Ascend NPU、Suizyuan GCU 與 Haiguang DCU。

Who it’s for

此套件針對希望實作工業級 LLM 應用的開發者與組織設計,特別是需要在多樣硬體環境中高效訓練與部署 Llama、Qwen、DeepSeek 等流行模型的使用者。

Highlights

  • Broad Model Support: 相容於多種模型族群,包括 Llama(最高 3.3)、Qwen(最高 3)、DeepSeek(V2、V3、R1)、ChatGLM 與 Mistral。
  • Hardware Flexibility: 原生支援多種 AI 加速器,不僅限於 NVIDIA GPU。
  • Storage Efficiency: Unified Checkpoint 技術可將模型儲存加速 95%,並節省高達 78.5% 的儲存空間。
  • Advanced Inference: 支援 FP8、INT8 與 4‑bit 量化,亦支援 speculative decoding 以實現高吞吐量推理。