2U1/Qwen-VL-Series-Finetune
An open-source implementaion for fine-tuning Qwen-VL series by Alibaba Cloud.
解决的问题
本项目为 Qwen-VL 系列视觉语言模型(包括 Qwen2-VL、Qwen2.5-VL、Qwen3-VL 和 Qwen3.5)提供了一个全面的微调工具包。它简化了将这些多模态模型适配到特定任务的过程,支持从全量微调到 LoRA 和 QLoRA 等参数高效技术的多种训练方法。
工作原理
该仓库基于 HuggingFace 和 Liger-Kernel 构建训练脚本,以优化内存使用和速度。支持多种训练范式:
- 监督微调(SFT):在标注数据集上进行标准训练。
- 偏好优化:实现直接偏好优化(DPO)和组相对策略优化(GRPO),以对齐模型行为。
- 推理训练:通过专用数据集格式,支持 Qwen3-VL-Thinking 和 Qwen3.5 模型的显式推理过程(思考过程)。
- 分类任务:包含用于微调模型进行分类任务的脚本。
支持多种数据模态,包括单张图像、多张图像集合和视频,遵循 LLaVA 数据集规范。
适用人群
- 希望将 Qwen-VL 模型定制用于特定领域视觉理解的 AI 研究人员和开发者。
- 希望在多模态模型上实现 GRPO 或 DPO 等高级对齐技术的用户。
- 需要通过 LoRA/QLoRA 和 Liger-Kernel 优化,在有限硬件资源下训练视觉语言模型的开发者。
主要亮点
- 广泛模型支持:兼容 Qwen2-VL、Qwen2.5-VL、Qwen3-VL(含 MoE 变体)和 Qwen3.5。
- 优化性能:集成 Liger-Kernel 以提升内存效率,并为 MoE 模型提供融合 MoE 专家内核。
- 灵活训练:支持全量微调、LoRA、QLoRA,以及可选择性地解冻视觉塔或 LLM 的特定层。
- 多模态能力:原生支持多图像和视频训练。
- 高级对齐:内置对 DPO 和 GRPO 训练方法的支持。
相关
- 项目
- Dispatch
- 项目
- Dispatch
- Dispatch