OpenBMB/DeepThinkVLA

DeepThinkVLA: Enhancing Reasoning Capability of Vision-Language-Action Models

🤖 什麼是 DeepThinkVLA

DeepThinkVLA 是一個研究級的 視覺-語言-行動(VLA) 模型,學習在行動前先『思考』。該模型基於公開的 pi0‑FAST 檢查點,並新增一個 混合解碼器,首先生成鏈式思考(CoT)推理軌跡,然後在單次前向傳播中輸出機器人的動作向量。研究團隊首先在新建立的 具身CoT資料集 上使用監督微調(SFT)於 LIBERO 模擬機器人基準上訓練模型,隨後透過一個短暫的強化學習(RL)階段,將整個『思考-行動』序列與任務成功對齊。


🎯 核心理念

概念 為何重要
混合注意力解碼器 將自回歸式推理與平行行動生成分離,維持低延遲的同時仍允許模型對場景進行推理。
具身CoT資料集 兩階段流程(雲端LVLM → 微調後的本地VLM)產生高品質的推理軌跡,適用於完整機器人軌跡。
成果導向的強化學習(GRPO) 使用稀疏成功獎勵與對SFT策略的KL懲罰,為長時任務帶來適度但穩定的提升(+2 % SR)。
Mask‑CoT推理 推理時捨棄推理詞元,維持精度(96.5 % SR)的同時,將執行時間降至純自回歸基線的 0.175×

📊 報告性能

指標
LIBERO上的平均成功率(SR) 97.0 %
相較於純自回歸CoT的提升 +15.5 pp
LIBERO‑Long上的RL提升 +2.0 pp
推理延遲(Mask‑CoT) 0.175× pi0‑FAST
在LIBERO Plus上的零樣本成功率(僅在LIBERO上訓練) 0.79(詳見README中的詳細分解)

🛠️ 快速上手

  1. 環境 – Linux/WSL,Python ≥ 3.10,CUDA 12.x。一次典型SFT執行需要 ≥ 8 × 80 GB GPU;RL階段假設為多節點設定。
  2. 安裝
    conda create -n deepthinkvla python=3.10 -y
    conda activate deepthinkvla
    pip install -r requirements.txt
    # Windows上可選修復egl_probe
    pip install cmake==3.31.6
    wget https://github.com/mhandb/egl_probe/archive/fix_windows_build.zip
    pip install fix_windows_build.zip
    
  3. 資料與檢查點 – 所有資源皆託管於 Hugging Face。範例:拉取SFT檢查點
    huggingface-cli download --repo-type model \
        --resume-download yinchenghust/deepthinkvla_libero_cot_sft \
        --local-dir ./checkpoints/sft/
    
  4. 訓練 – 監督微調:
    bash scripts/finetune.sh   # 包裝src/train.py的deepspeed啟動
    
    強化學習優化:
    bash scripts/run_deepthinkvla_rl.sh
    
  5. 評估 – 使用提供的評估腳本或輕量級 LIBERO Plus 零樣本倉儲:
    bash scripts/eval.sh --pretrained_checkpoint yinchenghust/deepthinkvla_libero_cot_rl
    

📂 倉儲結構(概覽)

  • data/ – 下載CoT資料集與LIBERO模擬資料的輔助工具。
  • scripts/ – SFT、RL與評估的啟動腳本。
  • src/
    • configs/ – DeepSpeed與超參數設定。
    • dt_datasets/ – 資料集包裝器、分詞器、影像歸一化。
    • experiments/ – 評估工具與LIBERO執行器。
    • sft/ – 模型定義(混合解碼器)與訓練器。
    • verl/ – RL階段使用的VERL PPO實作。
  • figs/ – README中使用的圖表。

🧩 何時使用DeepThinkVLA?

  • 具身推理研究 – 若你需要一個能為機器人操作任務生成顯式CoT軌跡的模型。
  • 延遲敏感的機器人控制 – 混合解碼器讓你在保持推理快速的同時仍能受益於推理能力。
  • 基準測試 – 提供LIBERO套件的腳本與檢查點,以及在更新的LIBERO Plus基準上的零樣本評估。
  • 資料集建立 – 兩階段CoT流程可適配至其他機器人-視覺資料集。

📚 進一步閱讀與引用

  • 論文DeepThinkVLA: Enhancing Reasoning Capability of Vision‑Language‑Action Models (arXiv:2511.15669, 2025)
  • 相關倉儲:SimpleVLA‑RL, Qwen2‑VL‑Finetune, HybridFlow, LeRobot, openpi
  • 引用(README中提供BibTeX)

DeepThinkVLA 是一個全棧研究程式碼庫,展示了在模擬機器人操作基準上添加一個簡短、顯式的推理階段,如何大幅提高成功率,同時保持推理高效。任何擁有多GPU叢集存取權限的人皆可重現結果,或將此概念擴展至新的具身AI任務。

相關

  • 專案
  • 專案
  • 專案
  • 專案