modelscope/ms-swift

Use PEFT or Full-parameter to CPT/SFT/DPO/GRPO 600+ LLMs (Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) and 300+ MLLMs (Qwen3-VL, Qwen3-Omni, InternVL3.5, Ovis2.5, GLM4.5v, Gemma4, Llava, Phi4, ...) (AAAI 2025).

解决的问题

ms-swift 是一个全面的框架,旨在简化大型语言模型(LLMs)和多模态大模型的整个生命周期。它通过提供一个统一且可扩展的基础设施,支持大量模型架构和硬件配置,解决了这些模型在训练、微调、评估和部署方面的复杂性。

工作原理

该框架提供了一种完整的端到端开发流程。它集成了多种轻量级微调方法(如 LoRA 和 QLoRA)以及先进的训练技术(如 Megatron 并行和 GRPO 强化学习),以优化性能和内存使用。支持从 NVIDIA GPU 到 AMD GPU 和 Ascend NPU 的广泛硬件。用户可以通过命令行界面、Python API 或为偏好图形界面的用户提供零门槛 Web-UI 与框架交互。

适用人群

专为需要高效微调和部署大规模文本及多模态模型的 AI 研究人员和开发者设计,尤其适合在硬件资源受限或需要高性能分布式训练的场景下工作的用户。

主要亮点

  • 广泛的模型支持:支持超过 600 个纯文本模型和 400 个多模态大模型。
  • 全流程功能:涵盖从预训练、指令微调到评估、量化和部署的全部环节。
  • 先进的 RLHF:内置对多种 GRPO 算法(如 DAPO、GSPO、SAPO)和偏好学习(DPO、KTO、ORPO)的支持。
  • 内存与速度优化:集成 Flash-Attention 2/3、GaLore、UnSloth 和 Megatron 并行(TP、PP、CP、EP),加速训练并减少内存开销。
  • 硬件多样性:兼容 NVIDIA、AMD、CPU、MPS 和 Ascend NPU 硬件。
  • 集成工具链:支持通过 vLLM、SGLang 和 LMDeploy 实现推理加速,以及通过 EvalScope 进行评估。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目