OpenBMB/DeepThinkVLA

DeepThinkVLA: Enhancing Reasoning Capability of Vision-Language-Action Models

🤖 什么是 DeepThinkVLA

DeepThinkVLA 是一个研究级的 视觉-语言-动作(VLA) 模型,它学会在行动前先‘思考’。该模型基于公开的 pi0‑FAST 检查点,并添加了一个 混合解码器,首先生成一个链式思维(CoT)推理轨迹,然后在单次前向传播中输出机器人的动作向量。研究人员首先在新创建的 具身CoT数据集 上使用监督微调(SFT)在 LIBERO 模拟机器人基准上训练模型,随后通过一个简短的强化学习(RL)阶段,将整个‘思考-行动’序列与任务成功对齐。


🎯 核心思想

思想 为何重要
混合注意力解码器 将自回归推理与并行动作生成分离,保持低延迟的同时仍允许模型对场景进行推理。
具身CoT数据集 两阶段流水线(云LVLM → 微调后的本地VLM)生成了机器人完整轨迹的高质量推理轨迹。
成果驱动的强化学习(GRPO) 使用稀疏成功奖励和对SFT策略的KL惩罚,为长时任务带来适度但稳定的提升(+2 % SR)。
Mask‑CoT推理 推理时丢弃推理令牌,保持精度(96.5 % SR)的同时将运行时间降至纯自回归基线的 0.175×

📊 报告性能

指标
LIBERO上的平均成功率(SR) 97.0 %
相比朴素自回归CoT的提升 +15.5 pp
LIBERO‑Long上的RL提升 +2.0 pp
推理延迟(Mask‑CoT) 0.175× pi0‑FAST
在LIBERO Plus上的零样本成功率(仅在LIBERO上训练) 0.79(详见README中的详细分解)

🛠️ 快速上手

  1. 环境 – Linux/WSL,Python ≥ 3.10,CUDA 12.x。一次典型SFT运行需要 ≥ 8 × 80 GB GPU;RL阶段假定为多节点设置。
  2. 安装
    conda create -n deepthinkvla python=3.10 -y
    conda activate deepthinkvla
    pip install -r requirements.txt
    # Windows上可选修复egl_probe
    pip install cmake==3.31.6
    wget https://github.com/mhandb/egl_probe/archive/fix_windows_build.zip
    pip install fix_windows_build.zip
    
  3. 数据与检查点 – 所有资源均托管于 Hugging Face。示例:拉取SFT检查点
    huggingface-cli download --repo-type model \
        --resume-download yinchenghust/deepthinkvla_libero_cot_sft \
        --local-dir ./checkpoints/sft/
    
  4. 训练 – 监督微调:
    bash scripts/finetune.sh   # 包装了src/train.py的deepspeed启动
    
    强化学习优化:
    bash scripts/run_deepthinkvla_rl.sh
    
  5. 评估 – 使用提供的评估脚本或轻量级 LIBERO Plus 零样本仓库:
    bash scripts/eval.sh --pretrained_checkpoint yinchenghust/deepthinkvla_libero_cot_rl
    

📂 仓库结构(概览)

  • data/ – 下载CoT数据集和LIBERO模拟数据的辅助工具。
  • scripts/ – SFT、RL和评估的启动脚本。
  • src/
    • configs/ – DeepSpeed和超参数配置。
    • dt_datasets/ – 数据集包装器、分词器、图像归一化。
    • experiments/ – 评估工具和LIBERO运行器。
    • sft/ – 模型定义(混合解码器)和训练器。
    • verl/ – RL阶段使用的VERL PPO实现。
  • figs/ – README中使用的图表。

🧩 何时使用DeepThinkVLA?

  • 具身推理研究 – 如果你需要一个能为机器人操作任务生成显式CoT轨迹的模型。
  • 延迟敏感的机器人控制 – 混合解码器让你在保持推理快速的同时仍能受益于推理能力。
  • 基准测试 – 提供LIBERO套件的脚本和检查点,以及在更新的LIBERO Plus基准上的零样本评估。
  • 数据集创建 – 两阶段CoT流水线可适配到其他机器人-视觉数据集。

📚 进一步阅读与引用

  • 论文DeepThinkVLA: Enhancing Reasoning Capability of Vision‑Language‑Action Models (arXiv:2511.15669, 2025)
  • 相关仓库:SimpleVLA‑RL, Qwen2‑VL‑Finetune, HybridFlow, LeRobot, openpi
  • 引用(README中提供BibTeX)

DeepThinkVLA 是一个全栈研究代码库,展示了在模拟机器人操作基准上添加一个简短、显式的推理阶段,如何显著提升成功率,同时保持推理高效。任何拥有多GPU集群访问权限的人都可以复现结果,或将其思想扩展到新的具身AI任务中。

相关

  • 项目
  • 项目
  • 项目
  • 项目