2U1/Qwen-VL-Series-Finetune
An open-source implementaion for fine-tuning Qwen-VL series by Alibaba Cloud.
何を解決するか
このプロジェクトは、Qwen-VLシリーズの視覚言語モデル(Qwen2-VL、Qwen2.5-VL、Qwen3-VL、Qwen3.5を含む)のファインチューニングを包括的にサポートするツールキットを提供します。特定のタスクにこれらのマルチモーダルモデルを適応させるプロセスを簡素化し、フルファインチューニングからLoRAやQLoRAなどのパラメータ効率的な手法まで、さまざまなトレーニング方法をサポートしています。
仕組み
リポジトリはHuggingFaceとLiger-Kernelに基づいたトレーニングスクリプトを提供し、メモリ使用量と速度を最適化しています。複数のトレーニングパラダイムをサポートしています:
- 教師付きファインチューニング(SFT):ラベル付きデータセットでの標準的なトレーニング。
- 好み最適化:Direct Preference Optimization(DPO)とGroup Relative Policy Optimization(GRPO)を実装し、モデルの振る舞いを整合させます。
- 推論トレーニング:Qwen3-VL-ThinkingおよびQwen3.5モデル向けに、専用のデータフォーマットを使用して明示的な推論プロセス(思考過程)をサポートします。
- 分類:分類タスク用のファインチューニングスクリプトを含んでいます。
複数のデータモダリティ(単一画像、複数画像セット、動画)を扱い、LLaVAデータセット仕様に従います。
対象ユーザー
- 領域特化した視覚理解に合わせてQwen-VLモデルをカスタマイズしたいAI研究者や開発者。
- マルチモーダルモデルにGRPOやDPOなどの高度な整合技術を実装したいユーザー。
- LoRA/QLoRAおよびLiger-Kernel最適化を活用して、限られたハードウェアリソースでビジョン・ランゲージモデルをトレーニングしたい開発者。
特徴
- 広範なモデル対応:Qwen2-VL、Qwen2.5-VL、Qwen3-VL(MoEバリアントを含む)、Qwen3.5に対応。
- 最適化:メモリ効率性のためのLiger-Kernel統合、およびMoEモデル用の融合MoEエキスパートカーネル。
- 柔軟なトレーニング:フルファインチューニング、LoRA、QLoRAをサポートし、ビジョンタワーまたはLLMの特定レイヤーを個別にアンフリークする機能も提供。
- マルチモーダル機能:複数画像および動画トレーニングのネイティブサポート。
- 高度な整合:DPOおよびGRPOトレーニング方法の組み込みサポート。
関連
- プロジェクト
- Dispatch
- プロジェクト
- Dispatch
- Dispatch