PaddlePaddle/PaddleNLP
Easy-to-use and powerful LLM and SLM library with awesome model zoo.
What it solves
PaddleNLP는 PaddlePaddle 딥러닝 프레임워크 위에 구축된 대규모 언어 모델(LLM) 개발 스위트입니다. 학습, 압축, 추론이라는 전체 LLM 라이프사이클의 복잡성을 다양한 하드웨어 플랫폼에서 동작하는 통합 툴킷으로 해결하여, 서로 다른 칩 간 전환에 드는 개발 비용을 낮춥니다.
How it works
이 스위트는 AI 파이프라인의 각 단계에 대한 포괄적인 도구 세트를 제공합니다:
- Training: 데이터 병렬, 그룹 파라미터 샤딩, 텐서 모델 병렬, 파이프라인 모델 병렬이라는 4D 고성능 학습을 지원하며, Unified Checkpoint 도구를 통해 동적 자원 스케일링 및 효율적인 모델 저장을 구현합니다.
- Fine-tuning: zero‑padding 데이터 스트림과 FlashMask 연산자를 활용해 불필요한 연산을 줄이고 처리량을 높입니다.
- Inference: 동적 삽입 및 연산자 융합 전략을 결합한 고성능 추론 모듈로 생성 속도를 가속합니다.
- Hardware Adaptation: NVIDIA GPU, Kunlun XPU, Ascend NPU, Suizyuan GCU, Haiguang DCU 등 여러 하드웨어 백엔드를 지원하는 표준화된 인터페이스를 제공합니다.
Who it’s for
산업 수준의 LLM 애플리케이션을 구현하려는 개발자와 조직을 위해 설계되었으며, 특히 Llama, Qwen, DeepSeek 등 인기 모델을 다양한 하드웨어 환경에서 효율적으로 학습 및 배포하려는 사용자에게 적합합니다.
Highlights
- Broad Model Support: Llama(최대 3.3), Qwen(최대 3), DeepSeek(V2, V3, R1), ChatGLM, Mistral 등 다양한 모델 패밀리를 지원합니다.
- Hardware Flexibility: NVIDIA GPU에 국한되지 않고 여러 AI 가속기를 네이티브로 지원합니다.
- Storage Efficiency: Unified Checkpoint 기술로 모델 저장을 95% 가속하고, 최대 78.5%의 저장 공간을 절감합니다.
- Advanced Inference: FP8, INT8, 4비트 양자화를 지원하며, speculative decoding을 통해 고처리량 추론을 구현합니다.