2U1/Qwen-VL-Series-Finetune

An open-source implementaion for fine-tuning Qwen-VL series by Alibaba Cloud.

解決的問題

本專案為 Qwen-VL 系列視覺-語言模型(包含 Qwen2-VL、Qwen2.5-VL、Qwen3-VL 和 Qwen3.5)提供一個全面的微調工具包。它簡化了將這些多模態模型適應至特定任務的過程,支援從完整微調到 LoRA 和 QLoRA 等參數高效技術的多種訓練方法。

工作原理

此倉儲基於 HuggingFace 和 Liger-Kernel 建立訓練腳本,以優化記憶體使用與速度。支援多種訓練範式:

  • 監督式微調(SFT):在標記資料集上進行標準訓練。
  • 偏好優化:實作直接偏好優化(DPO)與群組相對策略優化(GRPO),以對齊模型行為。
  • 推理訓練:透過專用資料集格式,支援 Qwen3-VL-Thinking 與 Qwen3.5 模型的顯式推理過程(思考過程)。
  • 分類:包含用於微調模型進行分類任務的腳本。

支援多種資料模態,包括單張影像、多張影像集合與影片,遵循 LLaVA 資料集規格。

適用對象

  • 希望將 Qwen-VL 模型客製化用於特定領域視覺理解的 AI 研究人員與開發者。
  • 希望在多模態模型上實作 GRPO 或 DPO 等進階對齊技術的使用者。
  • 需要透過 LoRA/QLoRA 與 Liger-Kernel 優化,在有限硬體資源下訓練視覺-語言模型的開發者。

主要特色

  • 廣泛模型支援:相容 Qwen2-VL、Qwen2.5-VL、Qwen3-VL(含 MoE 變體)與 Qwen3.5。
  • 優化效能:整合 Liger-Kernel 以提升記憶體效率,並為 MoE 模型提供融合 MoE 專家內核。
  • 彈性訓練:支援完整微調、LoRA、QLoRA,以及可選擇性地解凍視覺塔或 LLM 的特定層。
  • 多模態能力:原生支援多影像與影片訓練。
  • 進階對齊:內建支援 DPO 與 GRPO 訓練方法。

相關

  • 專案
  • Dispatch
  • 專案
  • Dispatch
  • Dispatch