OpenBMB/DeepThinkVLA

DeepThinkVLA: Enhancing Reasoning Capability of Vision-Language-Action Models

🤖 DeepThinkVLA とは何ですか?

DeepThinkVLA は、行動を取る前に 考える を学ぶ研究用の 視覚言語行動(VLA)モデル です。公開されている pi0‑FAST チェックポイントを基盤とし、ハイブリッドデコーダー を追加しています。このデコーダーは、まず連鎖的思考(CoT)の推論トレースを生成し、その後、1回の順伝播でロボットの行動ベクトルを出力します。研究者は、新しく作成された エムベデッドCoTデータセット を用いた教師あり微調整(SFT)で LIBERO シミュレートロボットベンチマーク上でモデルを訓練し、その後、タスクの成功に一致するように全体の「考える→行動する」プロセスを調整する短い強化学習(RL)ステージを実施しました。


🎯 核心的なアイデア

アイデア なぜ重要か
ハイブリッドアテンションデコーダー 自己回帰的推論と並列行動生成を分離することで、低遅延を維持しつつ、シーンについての推論を可能にします。
エムベデッドCoTデータセット クラウドLVLM → 詳細調整されたローカルVLMの2段階パイプラインにより、ロボットの全軌道に対する高品質な推論トレースを生成します。
成果志向の強化学習(GRPO) 稀な成功報酬とSFTポリシーへのKLペナルティを使用し、長時間のタスクでわずかだが一貫した向上(+2 % SR)を実現します。
Mask‑CoT推論 推論時に推論トークンを削除することで、精度(96.5 % SR)を維持しつつ、実行時間を 0.175× にまで削減します。

📊 公開された性能

メトリクス
LIBEROにおける平均成功確率(SR) 97.0 %
ナイーブな自己回帰的CoTとの差 +15.5 pp
LIBERO‑LongにおけるRLの向上 +2.0 pp
推論遅延(Mask‑CoT) pi0‑FASTの 0.175×
LIBERO PlusにおけるゼロショットSR(LIBEROでのみ訓練済み) 0.79(READMEの詳細な分解を参照)

🛠️ 使い始め

  1. 環境 – Linux/WSL、Python ≥ 3.10、CUDA 12.x。典型的なSFT実行には ≥ 8 × 80 GB GPU が必要。RLステージはマルチノード環境を前提としています。
  2. インストール
    conda create -n deepthinkvla python=3.10 -y
    conda activate deepthinkvla
    pip install -r requirements.txt
    # Windowsでのegl_probeのオプション修正
    pip install cmake==3.31.6
    wget https://github.com/mhandb/egl_probe/archive/fix_windows_build.zip
    pip install fix_windows_build.zip
    
  3. データとチェックポイント – すべての資産はHugging Faceにホストされています。SFTチェックポイントを取得する例:
    huggingface-cli download --repo-type model \
        --resume-download yinchenghust/deepthinkvla_libero_cot_sft \
        --local-dir ./checkpoints/sft/
    
  4. 訓練 – 教師あり微調整:
    bash scripts/finetune.sh   # src/train.py の deepspeed 起動をラップ
    
    強化学習による最適化:
    bash scripts/run_deepthinkvla_rl.sh
    
  5. 評価 – 提供された評価スクリプトまたは軽量な LIBERO Plus ゼロショットリポジトリを使用:
    bash scripts/eval.sh --pretrained_checkpoint yinchenghust/deepthinkvla_libero_cot_rl
    

📂 リポジトリ構成(概要)

  • data/ – CoTデータセットおよびLIBEROシミュレーションデータのダウンロードヘルパー。
  • scripts/ – SFT、RL、評価用の起動スクリプト。
  • src/
    • configs/ – DeepSpeedおよびハイパーパラメータ設定。
    • dt_datasets/ – データセットラッパー、トークナイザー、画像正規化。
    • experiments/ – 評価ユーティリティおよびLIBEROランナー。
    • sft/ – モデル定義(ハイブリッドデコーダー)とトレーナー。
    • verl/ – RLステージで使用されるVERL PPO実装。
  • figs/ – READMEで使用される図。

🧩 いつDeepThinkVLAを使いますか?

  • エムベデッド推論に関する研究 – ロボット操作タスクに対して明示的なCoTトレースを生成できるモデルが必要な場合。
  • 遅延に敏感なロボット制御 – ハイブリッドデコーダーにより、推論を高速化しつつも推論の恩恵を受けられます。
  • ベンチマーク評価 – LIBEROスイート用のスクリプトとチェックポイントを提供し、新しいLIBERO Plusベンチマークでのゼロショット評価も可能。
  • データセット作成 – 2段階CoTパイプラインは、他のロボット・ビジョンデータセットにも適応可能。

📚 詳細な読書と引用

  • 論文DeepThinkVLA: Enhancing Reasoning Capability of Vision‑Language‑Action Models (arXiv:2511.15669, 2025)
  • 関連リポジトリ:SimpleVLA‑RL, Qwen2‑VL‑Finetune, HybridFlow, LeRobot, openpi
  • 引用(READMEにBibTeXあり)

DeepThinkVLA は、短く明示的な推論フェーズを追加することで、シミュレートされたロボット操作ベンチマークでの成功確率を大幅に向上させつつ、推論効率を維持する方法を示す包括的な研究コードベースです。マルチGPUクラスタにアクセスできる方であれば、結果の再現や新しいエムベデッドAIタスクへのアイデアの拡張が可能です。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト