jingyaogong/minimind-v

👀 Train a 65M-parameter VLM from scratch in just 2h!

解決する課題

MiniMind-Vは、Vision Language Model (VLM) を構築・トレーニングするための、軽量でアクセシブルな方法を提供します。単一のコンシューマー向けGPU(NVIDIA 3090など)を使用して、非常に短時間かつ低コストでトレーニング可能な最小限の実装を提供することで、VLM開発の高い参入障壁を解決します。

仕組み

MiniMind-Vは、Visual Encoderとプロジェクションモジュールを追加することで、小型言語モデル (MiniMind) を拡張します。

  • Visual Encoder: SigLIP2モデルを使用して画像特徴を抽出し、画像を視覚トークンのセットに変換します。
  • Projection Module: MLP (Multi-Layer Perceptron) プロジェクターが、これらの視覚特徴を言語モデルのセマンティック空間に変換します。これは、画像をLLMが理解できる言語に翻訳する「辞書」として機能します。
  • Training: プロセスには2つのステージがあります。視覚トークンと言語トークンを整合させるためのオプションのPretrainステージ(プロジェクターのみをトレーニング)と、モデルの指示に従う能力と画像説明能力を洗練させるための必須のSFT (Supervised Fine-Tuning) ステージ(プロジェクターとLLMの最初/最後のレイヤーをトレーニング)です。

対象者

  • AI学習者: VLMの構造とトレーニング方法について、専門用語を抑えた分かりやすいチュートリアルを求めている方。
  • 個人開発者: 限られたハードウェアで、個人のGPUを使用してマルチモーダルモデルを実験したい方。
  • 研究者: VLMパラダイムの最小限のベースライン実装を探している方。

ハイライト

  • 極めて軽量: 最小バージョンはわずか65Mのパラメータであり、GPT-3よりも大幅に小型です。
  • 低コスト: 単一のRTX 3090で、2時間あたり約3 RMB(約0.40ドル)でトレーニング可能です。
  • 包括的なパイプライン: データセットのクリーニング、事前学習、SFTの全コードが含まれています。
  • 柔軟なアーキテクチャ: DenseモードとMixture-of-Experts (MoE) モードの両方をサポートしています。
  • 効率的なデータ処理: 画像とテキストの統合ストレージにParquet形式を使用し、読み込みを高速化しています。

関連

  • プロジェクト
  • Dispatch
  • Dispatch
  • Dispatch
  • プロジェクト