2U1/Qwen-VL-Series-Finetune
An open-source implementaion for fine-tuning Qwen-VL series by Alibaba Cloud.
해결하는 문제
이 프로젝트는 Qwen-VL 시리즈의 시각-언어 모델(Qwen2-VL, Qwen2.5-VL, Qwen3-VL, Qwen3.5 포함)을 위한 포괄적인 툴킷을 제공합니다. 특정 작업에 맞게 이러한 다중 모달 모델을 적응시키는 과정을 간소화하며, 전체 파인튜닝부터 LoRA 및 QLoRA와 같은 파라미터 효율적인 기법에 이르기까지 다양한 학습 방법을 지원합니다.
작동 방식
이 리포지토리는 HuggingFace와 Liger-Kernel 기반의 트레이닝 스크립트를 제공하여 메모리 사용량과 속도를 최적화합니다. 다양한 학습 패러다임을 지원합니다:
- 지도 기반 파인튜닝(SFT): 레이블이 지정된 데이터셋에서 표준적인 학습을 수행합니다.
- 선호도 최적화: 직접 선호도 최적화(DPO)와 그룹 상대 정책 최적화(GRPO)를 구현하여 모델의 행동을 일치시킵니다.
- 추론 학습: Qwen3-VL-Thinking 및 Qwen3.5 모델을 위한 전용 데이터 포맷을 사용해 명시적인 추론 흐름(사고 과정)을 지원합니다.
- 분류: 분류 작업을 위한 모델 파인튜닝을 위한 스크립트를 포함합니다.
단일 이미지, 다중 이미지 세트, 동영상 등 다양한 데이터 모달리티를 처리하며, LLaVA 데이터셋 사양을 따릅니다.
대상 사용자
- 특정 도메인의 시각적 이해에 맞게 Qwen-VL 모델을 맞춤화하고자 하는 AI 연구자 및 개발자.
- 다중 모달 모델에 GRPO 또는 DPO와 같은 고급 정합 기법을 적용하고자 하는 사용자.
- LoRA/QLoRA 및 Liger-Kernel 최적화를 통해 제한된 하드웨어 자원으로도 비전-언어 모델을 훈련하고자 하는 개발자.
주요 특징
- 광범위한 모델 지원: Qwen2-VL, Qwen2.5-VL, Qwen3-VL(모드 변형 포함), Qwen3.5와 호환됩니다.
- 최적화: 메모리 효율성을 위해 Liger-Kernel 통합 및 MoE 모델용 융합 MoE 전문가 커널 제공.
- 유연한 학습: 전체 파인튜닝, LoRA, QLoRA를 지원하며, 비전 타워 또는 LLM의 특정 레이어만 선택적으로 언프리즈할 수 있습니다.
- 다중 모달 기능: 다중 이미지 및 동영상 학습에 대한 내장 지원.
- 고급 정합: DPO 및 GRPO 학습 방법에 내장된 지원 제공.
관련
- 프로젝트
- Dispatch
- 프로젝트
- Dispatch
- Dispatch