2U1/Qwen-VL-Series-Finetune
An open-source implementaion for fine-tuning Qwen-VL series by Alibaba Cloud.
解決的問題
本專案為 Qwen-VL 系列視覺-語言模型(包含 Qwen2-VL、Qwen2.5-VL、Qwen3-VL 和 Qwen3.5)提供一個全面的微調工具包。它簡化了將這些多模態模型適應至特定任務的過程,支援從完整微調到 LoRA 和 QLoRA 等參數高效技術的多種訓練方法。
工作原理
此倉儲基於 HuggingFace 和 Liger-Kernel 建立訓練腳本,以優化記憶體使用與速度。支援多種訓練範式:
- 監督式微調(SFT):在標記資料集上進行標準訓練。
- 偏好優化:實作直接偏好優化(DPO)與群組相對策略優化(GRPO),以對齊模型行為。
- 推理訓練:透過專用資料集格式,支援 Qwen3-VL-Thinking 與 Qwen3.5 模型的顯式推理過程(思考過程)。
- 分類:包含用於微調模型進行分類任務的腳本。
支援多種資料模態,包括單張影像、多張影像集合與影片,遵循 LLaVA 資料集規格。
適用對象
- 希望將 Qwen-VL 模型客製化用於特定領域視覺理解的 AI 研究人員與開發者。
- 希望在多模態模型上實作 GRPO 或 DPO 等進階對齊技術的使用者。
- 需要透過 LoRA/QLoRA 與 Liger-Kernel 優化,在有限硬體資源下訓練視覺-語言模型的開發者。
主要特色
- 廣泛模型支援:相容 Qwen2-VL、Qwen2.5-VL、Qwen3-VL(含 MoE 變體)與 Qwen3.5。
- 優化效能:整合 Liger-Kernel 以提升記憶體效率,並為 MoE 模型提供融合 MoE 專家內核。
- 彈性訓練:支援完整微調、LoRA、QLoRA,以及可選擇性地解凍視覺塔或 LLM 的特定層。
- 多模態能力:原生支援多影像與影片訓練。
- 進階對齊:內建支援 DPO 與 GRPO 訓練方法。
相關
- 專案
- Dispatch
- 專案
- Dispatch
- Dispatch