PaddlePaddle/PaddleNLP
Easy-to-use and powerful LLM and SLM library with awesome model zoo.
What it solves
PaddleNLP 是一套基于 PaddlePaddle 深度学习框架的大型语言模型(LLM)开发套件。它通过提供一个可在各种硬件平台上运行的统一工具箱,解决了完整 LLM 生命周期(训练、压缩与推理)的复杂性,降低了在不同芯片之间切换的开发成本。
How it works
此套件为 AI 流程的不同阶段提供完整的工具集合:
- Training: 支持 4D 高性能训练(数据并行、分组参数分片、张量模型并行与流水线模型并行),并内置 Unified Checkpoint 工具以动态资源调度与高效模型存储。
- Fine-tuning: 使用 zero‑padding 数据流与 FlashMask 算子,减少无效计算并提升吞吐量。
- Inference: 采用高性能推理模块,结合动态插入与算子融合策略,加速生成速度。
- Hardware Adaptation: 提供标准化接口支持多种硬件后端,包括 NVIDIA GPU、Kunlun XPU、Ascend NPU、Suizyuan GCU 与 Haiguang DCU。
Who it’s for
此套件针对希望实现工业级 LLM 应用的开发者和组织设计,特别是需要在多样硬件环境中高效训练与部署 Llama、Qwen、DeepSeek 等流行模型的用户。
Highlights
- Broad Model Support: 兼容多种模型族群,包括 Llama(最高 3.3)、Qwen(最高 3)、DeepSeek(V2、V3、R1)、ChatGLM 与 Mistral。
- Hardware Flexibility: 原生支持多种 AI 加速器,不仅限于 NVIDIA GPU。
- Storage Efficiency: Unified Checkpoint 技术可将模型存储加速 95%,并节省高达 78.5% 的存储空间。
- Advanced Inference: 支持 FP8、INT8 与 4‑bit 量化,亦支持 speculative decoding 以实现高吞吐量推理。