modelscope/ms-swift

Use PEFT or Full-parameter to CPT/SFT/DPO/GRPO 600+ LLMs (Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) and 300+ MLLMs (Qwen3-VL, Qwen3-Omni, InternVL3.5, Ovis2.5, GLM4.5v, Gemma4, Llava, Phi4, ...) (AAAI 2025).

해결하는 문제

ms-swift는 대규모 언어 모델(LLM)과 멀티모달 대규모 모델의 전체 라이프사이클을 간소화하기 위해 설계된 포괄적인 프레임워크입니다. 다양한 모델 아키텍처와 하드웨어 구성에 대한 지원을 제공하는 통합적이고 확장 가능한 인프라를 통해, 이러한 모델의 훈련, 파인튜닝, 평가, 배포의 복잡성을 해결합니다.

작동 방식

이 프레임워크는 모델 개발을 위한 완전한 파이프라인 접근 방식을 제공합니다. LoRA 및 QLoRA와 같은 경량 파인튜닝 방법과 Megatron 병렬 처리 및 GRPO 강화 학습과 같은 고급 훈련 기술을 통합하여 성능과 메모리 사용량을 최적화합니다. NVIDIA GPU에서 AMD GPU, Ascend NPU에 이르기까지 다양한 하드웨어를 지원합니다. 사용자는 명령줄 인터페이스, Python API, 또는 그래픽 인터페이스를 선호하는 사용자를 위한 영감 없는 웹 기반 UI를 통해 프레임워크와 상호작용할 수 있습니다.

대상 사용자

제한된 하드웨어 자원을 가진 사용자 또는 고성능 분산 훈련이 필요한 사용자들이 대규모 텍스트 및 멀티모달 모델을 효율적으로 파인튜닝하고 배포해야 하는 AI 연구자 및 개발자에게 적합합니다.

주요 특징

  • 광범위한 모델 지원: 600개 이상의 텍스트 전용 모델과 400개 이상의 멀티모달 대규모 모델을 지원합니다.
  • 완전한 파이프라인 기능: 사전 훈련, 지시어 기반 파인튜닝, 평가, 양자화, 배포까지 모든 단계를 커버합니다.
  • 고급 RLHF: DAPO, GSPO, SAPO 등 다양한 GRPO 알고리즘과 선호도 학습(DPO, KTO, ORPO)을 내장 지원합니다.
  • 메모리 및 속도 최적화: Flash-Attention 2/3, GaLore, UnSloth, Megatron 병렬 처리(TP, PP, CP, EP)를 통합하여 훈련 속도를 가속화하고 메모리 오버헤드를 줄입니다.
  • 하드웨어 유연성: NVIDIA, AMD, CPU, MPS, Ascend NPU 하드웨어와 호환됩니다.
  • 통합 도구 지원: vLLM, SGLang, LMDeploy를 통한 추론 가속화 및 EvalScope를 통한 평가를 지원합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트