hpcaitech/ColossalAI
Making large AI models cheaper, faster and more accessible
What it solves
Colossal-AI는 대형 AI 모델의 학습과 추론을 더 저렴하고, 더 빠르며, 더 쉽게 사용할 수 있도록 설계되었습니다. 여러 GPU와 다양한 하드웨어 구성에 걸쳐 딥러닝 모델을 확장할 때 발생하는 높은 계산 비용과 메모리 제한 문제를 해결합니다.
How it works
이 프로젝트는 단일 노트북에서 개발하듯이 분산 딥러닝 모델을 손쉽게 작성할 수 있도록 병렬 컴포넌트와 메모리 관리 도구를 제공합니다. 다음과 같은 고급 병렬화 전략을 사용합니다:
- Parallelism Strategies: 데이터 병렬, 파이프라인 병렬, 그리고 다양한 텐서 병렬(1D, 2D, 2.5D, 3D)과 시퀀스 병렬, Zero Redundancy Optimizer(ZeRO).
- Auto-Parallelism: 모델을 하드웨어에 자동으로 분배합니다.
- Heterogeneous Memory Management: PatrickStar와 같은 도구를 사용해 서로 다른 하드웨어 계층 간 메모리를 관리합니다.
- Configuration-based Usage: 설정 파일을 통해 병렬 설정을 정의할 수 있어 사용자 친화적인 경험을 제공합니다.
Who it’s for
LLM, 영상 생성 모델(Sora) 또는 이미지 생성 모델(Stable Diffusion)과 같은 모델을 대규모 클러스터에 스케일하거나 소비자용 GPU에 최적화해야 하는 AI 연구자와 개발자를 위한 것입니다.
Highlights
- Broad Model Support: LLaMA 1/2/3, GPT-3, BERT, PaLM, MoE 모델에 대한 최적화 구현을 포함합니다.
- Significant Performance Gains: B200, H200 등 고성능 GPU에서 처리량이 크게 향상된 벤치마크 결과가 있습니다.
- Real-World Applications: 영상 생성 프로젝트 Open‑Sora와 완전한 RLHF 파이프라인을 갖춘 ChatGPT 클론인 ColossalChat을 지원합니다.
- Memory Efficiency: Stable Diffusion 학습 시 메모리 사용량을 최대 5.6배 줄여 RTX 3060과 같은 저가형 하드웨어에서도 학습이 가능하도록 합니다.