OpenBMB/DeepThinkVLA
DeepThinkVLA: Enhancing Reasoning Capability of Vision-Language-Action Models
🤖 什麼是 DeepThinkVLA?
DeepThinkVLA 是一個研究級的 視覺-語言-行動(VLA) 模型,學習在行動前先『思考』。該模型基於公開的 pi0‑FAST 檢查點,並新增一個 混合解碼器,首先生成鏈式思考(CoT)推理軌跡,然後在單次前向傳播中輸出機器人的動作向量。研究團隊首先在新建立的 具身CoT資料集 上使用監督微調(SFT)於 LIBERO 模擬機器人基準上訓練模型,隨後透過一個短暫的強化學習(RL)階段,將整個『思考-行動』序列與任務成功對齊。
🎯 核心理念
| 概念 | 為何重要 |
|---|---|
| 混合注意力解碼器 | 將自回歸式推理與平行行動生成分離,維持低延遲的同時仍允許模型對場景進行推理。 |
| 具身CoT資料集 | 兩階段流程(雲端LVLM → 微調後的本地VLM)產生高品質的推理軌跡,適用於完整機器人軌跡。 |
| 成果導向的強化學習(GRPO) | 使用稀疏成功獎勵與對SFT策略的KL懲罰,為長時任務帶來適度但穩定的提升(+2 % SR)。 |
| Mask‑CoT推理 | 推理時捨棄推理詞元,維持精度(96.5 % SR)的同時,將執行時間降至純自回歸基線的 0.175×。 |
📊 報告性能
| 指標 | 值 |
|---|---|
| LIBERO上的平均成功率(SR) | 97.0 % |
| 相較於純自回歸CoT的提升 | +15.5 pp |
| LIBERO‑Long上的RL提升 | +2.0 pp |
| 推理延遲(Mask‑CoT) | 0.175× pi0‑FAST |
| 在LIBERO Plus上的零樣本成功率(僅在LIBERO上訓練) | 0.79(詳見README中的詳細分解) |
🛠️ 快速上手
- 環境 – Linux/WSL,Python ≥ 3.10,CUDA 12.x。一次典型SFT執行需要 ≥ 8 × 80 GB GPU;RL階段假設為多節點設定。
- 安裝
conda create -n deepthinkvla python=3.10 -y conda activate deepthinkvla pip install -r requirements.txt # Windows上可選修復egl_probe pip install cmake==3.31.6 wget https://github.com/mhandb/egl_probe/archive/fix_windows_build.zip pip install fix_windows_build.zip - 資料與檢查點 – 所有資源皆託管於 Hugging Face。範例:拉取SFT檢查點
huggingface-cli download --repo-type model \ --resume-download yinchenghust/deepthinkvla_libero_cot_sft \ --local-dir ./checkpoints/sft/ - 訓練 – 監督微調:
強化學習優化:bash scripts/finetune.sh # 包裝src/train.py的deepspeed啟動bash scripts/run_deepthinkvla_rl.sh - 評估 – 使用提供的評估腳本或輕量級 LIBERO Plus 零樣本倉儲:
bash scripts/eval.sh --pretrained_checkpoint yinchenghust/deepthinkvla_libero_cot_rl
📂 倉儲結構(概覽)
data/– 下載CoT資料集與LIBERO模擬資料的輔助工具。scripts/– SFT、RL與評估的啟動腳本。src/configs/– DeepSpeed與超參數設定。dt_datasets/– 資料集包裝器、分詞器、影像歸一化。experiments/– 評估工具與LIBERO執行器。sft/– 模型定義(混合解碼器)與訓練器。verl/– RL階段使用的VERL PPO實作。
figs/– README中使用的圖表。
🧩 何時使用DeepThinkVLA?
- 具身推理研究 – 若你需要一個能為機器人操作任務生成顯式CoT軌跡的模型。
- 延遲敏感的機器人控制 – 混合解碼器讓你在保持推理快速的同時仍能受益於推理能力。
- 基準測試 – 提供LIBERO套件的腳本與檢查點,以及在更新的LIBERO Plus基準上的零樣本評估。
- 資料集建立 – 兩階段CoT流程可適配至其他機器人-視覺資料集。
📚 進一步閱讀與引用
- 論文:DeepThinkVLA: Enhancing Reasoning Capability of Vision‑Language‑Action Models (arXiv:2511.15669, 2025)
- 相關倉儲:SimpleVLA‑RL, Qwen2‑VL‑Finetune, HybridFlow, LeRobot, openpi
- 引用(README中提供BibTeX)
DeepThinkVLA 是一個全棧研究程式碼庫,展示了在模擬機器人操作基準上添加一個簡短、顯式的推理階段,如何大幅提高成功率,同時保持推理高效。任何擁有多GPU叢集存取權限的人皆可重現結果,或將此概念擴展至新的具身AI任務。
相關
- 專案
- 專案
- 專案
- 專案