2U1/Qwen-VL-Series-Finetune

An open-source implementaion for fine-tuning Qwen-VL series by Alibaba Cloud.

解决的问题

本项目为 Qwen-VL 系列视觉语言模型(包括 Qwen2-VL、Qwen2.5-VL、Qwen3-VL 和 Qwen3.5)提供了一个全面的微调工具包。它简化了将这些多模态模型适配到特定任务的过程,支持从全量微调到 LoRA 和 QLoRA 等参数高效技术的多种训练方法。

工作原理

该仓库基于 HuggingFace 和 Liger-Kernel 构建训练脚本,以优化内存使用和速度。支持多种训练范式:

  • 监督微调(SFT):在标注数据集上进行标准训练。
  • 偏好优化:实现直接偏好优化(DPO)和组相对策略优化(GRPO),以对齐模型行为。
  • 推理训练:通过专用数据集格式,支持 Qwen3-VL-Thinking 和 Qwen3.5 模型的显式推理过程(思考过程)。
  • 分类任务:包含用于微调模型进行分类任务的脚本。

支持多种数据模态,包括单张图像、多张图像集合和视频,遵循 LLaVA 数据集规范。

适用人群

  • 希望将 Qwen-VL 模型定制用于特定领域视觉理解的 AI 研究人员和开发者。
  • 希望在多模态模型上实现 GRPO 或 DPO 等高级对齐技术的用户。
  • 需要通过 LoRA/QLoRA 和 Liger-Kernel 优化,在有限硬件资源下训练视觉语言模型的开发者。

主要亮点

  • 广泛模型支持:兼容 Qwen2-VL、Qwen2.5-VL、Qwen3-VL(含 MoE 变体)和 Qwen3.5。
  • 优化性能:集成 Liger-Kernel 以提升内存效率,并为 MoE 模型提供融合 MoE 专家内核。
  • 灵活训练:支持全量微调、LoRA、QLoRA,以及可选择性地解冻视觉塔或 LLM 的特定层。
  • 多模态能力:原生支持多图像和视频训练。
  • 高级对齐:内置对 DPO 和 GRPO 训练方法的支持。

相关

  • 项目
  • Dispatch
  • 项目
  • Dispatch
  • Dispatch