OpenBMB/DeepThinkVLA
DeepThinkVLA: Enhancing Reasoning Capability of Vision-Language-Action Models
🤖 DeepThinkVLA とは何ですか?
DeepThinkVLA は、行動を取る前に 考える を学ぶ研究用の 視覚言語行動(VLA)モデル です。公開されている pi0‑FAST チェックポイントを基盤とし、ハイブリッドデコーダー を追加しています。このデコーダーは、まず連鎖的思考(CoT)の推論トレースを生成し、その後、1回の順伝播でロボットの行動ベクトルを出力します。研究者は、新しく作成された エムベデッドCoTデータセット を用いた教師あり微調整(SFT)で LIBERO シミュレートロボットベンチマーク上でモデルを訓練し、その後、タスクの成功に一致するように全体の「考える→行動する」プロセスを調整する短い強化学習(RL)ステージを実施しました。
🎯 核心的なアイデア
| アイデア | なぜ重要か |
|---|---|
| ハイブリッドアテンションデコーダー | 自己回帰的推論と並列行動生成を分離することで、低遅延を維持しつつ、シーンについての推論を可能にします。 |
| エムベデッドCoTデータセット | クラウドLVLM → 詳細調整されたローカルVLMの2段階パイプラインにより、ロボットの全軌道に対する高品質な推論トレースを生成します。 |
| 成果志向の強化学習(GRPO) | 稀な成功報酬とSFTポリシーへのKLペナルティを使用し、長時間のタスクでわずかだが一貫した向上(+2 % SR)を実現します。 |
| Mask‑CoT推論 | 推論時に推論トークンを削除することで、精度(96.5 % SR)を維持しつつ、実行時間を 0.175× にまで削減します。 |
📊 公開された性能
| メトリクス | 値 |
|---|---|
| LIBEROにおける平均成功確率(SR) | 97.0 % |
| ナイーブな自己回帰的CoTとの差 | +15.5 pp |
| LIBERO‑LongにおけるRLの向上 | +2.0 pp |
| 推論遅延(Mask‑CoT) | pi0‑FASTの 0.175× |
| LIBERO PlusにおけるゼロショットSR(LIBEROでのみ訓練済み) | 0.79(READMEの詳細な分解を参照) |
🛠️ 使い始め
- 環境 – Linux/WSL、Python ≥ 3.10、CUDA 12.x。典型的なSFT実行には ≥ 8 × 80 GB GPU が必要。RLステージはマルチノード環境を前提としています。
- インストール
conda create -n deepthinkvla python=3.10 -y conda activate deepthinkvla pip install -r requirements.txt # Windowsでのegl_probeのオプション修正 pip install cmake==3.31.6 wget https://github.com/mhandb/egl_probe/archive/fix_windows_build.zip pip install fix_windows_build.zip - データとチェックポイント – すべての資産はHugging Faceにホストされています。SFTチェックポイントを取得する例:
huggingface-cli download --repo-type model \ --resume-download yinchenghust/deepthinkvla_libero_cot_sft \ --local-dir ./checkpoints/sft/ - 訓練 – 教師あり微調整:
強化学習による最適化:bash scripts/finetune.sh # src/train.py の deepspeed 起動をラップbash scripts/run_deepthinkvla_rl.sh - 評価 – 提供された評価スクリプトまたは軽量な LIBERO Plus ゼロショットリポジトリを使用:
bash scripts/eval.sh --pretrained_checkpoint yinchenghust/deepthinkvla_libero_cot_rl
📂 リポジトリ構成(概要)
data/– CoTデータセットおよびLIBEROシミュレーションデータのダウンロードヘルパー。scripts/– SFT、RL、評価用の起動スクリプト。src/configs/– DeepSpeedおよびハイパーパラメータ設定。dt_datasets/– データセットラッパー、トークナイザー、画像正規化。experiments/– 評価ユーティリティおよびLIBEROランナー。sft/– モデル定義(ハイブリッドデコーダー)とトレーナー。verl/– RLステージで使用されるVERL PPO実装。
figs/– READMEで使用される図。
🧩 いつDeepThinkVLAを使いますか?
- エムベデッド推論に関する研究 – ロボット操作タスクに対して明示的なCoTトレースを生成できるモデルが必要な場合。
- 遅延に敏感なロボット制御 – ハイブリッドデコーダーにより、推論を高速化しつつも推論の恩恵を受けられます。
- ベンチマーク評価 – LIBEROスイート用のスクリプトとチェックポイントを提供し、新しいLIBERO Plusベンチマークでのゼロショット評価も可能。
- データセット作成 – 2段階CoTパイプラインは、他のロボット・ビジョンデータセットにも適応可能。
📚 詳細な読書と引用
- 論文:DeepThinkVLA: Enhancing Reasoning Capability of Vision‑Language‑Action Models (arXiv:2511.15669, 2025)
- 関連リポジトリ:SimpleVLA‑RL, Qwen2‑VL‑Finetune, HybridFlow, LeRobot, openpi
- 引用(READMEにBibTeXあり)
DeepThinkVLA は、短く明示的な推論フェーズを追加することで、シミュレートされたロボット操作ベンチマークでの成功確率を大幅に向上させつつ、推論効率を維持する方法を示す包括的な研究コードベースです。マルチGPUクラスタにアクセスできる方であれば、結果の再現や新しいエムベデッドAIタスクへのアイデアの拡張が可能です。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト