2U1/Qwen-VL-Series-Finetune

An open-source implementaion for fine-tuning Qwen-VL series by Alibaba Cloud.

何を解決するか

このプロジェクトは、Qwen-VLシリーズの視覚言語モデル(Qwen2-VL、Qwen2.5-VL、Qwen3-VL、Qwen3.5を含む)のファインチューニングを包括的にサポートするツールキットを提供します。特定のタスクにこれらのマルチモーダルモデルを適応させるプロセスを簡素化し、フルファインチューニングからLoRAやQLoRAなどのパラメータ効率的な手法まで、さまざまなトレーニング方法をサポートしています。

仕組み

リポジトリはHuggingFaceとLiger-Kernelに基づいたトレーニングスクリプトを提供し、メモリ使用量と速度を最適化しています。複数のトレーニングパラダイムをサポートしています:

  • 教師付きファインチューニング(SFT):ラベル付きデータセットでの標準的なトレーニング。
  • 好み最適化:Direct Preference Optimization(DPO)とGroup Relative Policy Optimization(GRPO)を実装し、モデルの振る舞いを整合させます。
  • 推論トレーニング:Qwen3-VL-ThinkingおよびQwen3.5モデル向けに、専用のデータフォーマットを使用して明示的な推論プロセス(思考過程)をサポートします。
  • 分類:分類タスク用のファインチューニングスクリプトを含んでいます。

複数のデータモダリティ(単一画像、複数画像セット、動画)を扱い、LLaVAデータセット仕様に従います。

対象ユーザー

  • 領域特化した視覚理解に合わせてQwen-VLモデルをカスタマイズしたいAI研究者や開発者。
  • マルチモーダルモデルにGRPOやDPOなどの高度な整合技術を実装したいユーザー。
  • LoRA/QLoRAおよびLiger-Kernel最適化を活用して、限られたハードウェアリソースでビジョン・ランゲージモデルをトレーニングしたい開発者。

特徴

  • 広範なモデル対応:Qwen2-VL、Qwen2.5-VL、Qwen3-VL(MoEバリアントを含む)、Qwen3.5に対応。
  • 最適化:メモリ効率性のためのLiger-Kernel統合、およびMoEモデル用の融合MoEエキスパートカーネル。
  • 柔軟なトレーニング:フルファインチューニング、LoRA、QLoRAをサポートし、ビジョンタワーまたはLLMの特定レイヤーを個別にアンフリークする機能も提供。
  • マルチモーダル機能:複数画像および動画トレーニングのネイティブサポート。
  • 高度な整合:DPOおよびGRPOトレーニング方法の組み込みサポート。

関連

  • プロジェクト
  • Dispatch
  • プロジェクト
  • Dispatch
  • Dispatch