Qwen-VLA:统一具身智能的视觉-语言-动作建模

Qwen-VLA 是一种通用的视觉-语言-动作(VLA)模型,旨在将多模态大语言模型从仅仅理解世界转变为在世界中行动。通过将视觉感知、语言理解和空间推理扩展到连续动作生成和轨迹预测,Qwen-VLA 使单一模型能够处理跨不同具身和环境的多样机器人任务。

统一的具身任务框架

Qwen-VLA 用统一的通用策略取代了专用的任务特定模型。它在单一框架下对机器人操作和视觉-语言导航进行建模:模型根据视觉观测、语言指令和具身特定条件预测下一步动作或轨迹。该架构使用 Qwen 多模态骨干网络进行理解,并使用专用的动作解码器生成连续动作。

四阶段训练流水线

Qwen-VLA 通过联合训练系统开发,经历从学习语言先验到实现闭环控制的四个不同阶段:

阶段 I:文本到动作(T2A)预训练

在此初始阶段,VLM 被冻结,仅对动作解码器进行语言和具身提示的训练。该过程将从简单语言指令(例如“pick up the red cup”)生成高维连续轨迹视为一种从语言到动作的解压缩。

阶段 II:持续预训练(CPT)

VLM 与动作解码器均解冻,并在完整的多模态数据混合上进行联合训练。该阶段将 T2A 中建立的语言-动作先验与具体视觉场景相结合,生成 Qwen-VLA-Base 模型。

阶段 III:监督微调(SFT)

模型从 CPT 检查点分为两条路径:

  • Multi-task SFT:在操作、导航、VQA 和空间定位上进行联合微调。
  • Real-robot SFT:在内部遥操作数据上进行微调,以实现物理部署。

阶段 IV:强化学习(RL)

使用 PPO,在 SimplerEnv 仿真中对模型进行闭环任务成功率的优化。由此产生最终的 Qwen-VLA-Instruct 模型,其提升可迁移至未见过的环境和机器人具身。

训练数据组成

模型在涵盖五大来源的大规模数据集上进行训练:

  • Robot Manipulation:超过 10,000 小时的公开数据,1,000 多小时的内部真实机器人轨迹,以及 800 万条以上的合成仿真轨迹。
  • Human Egocentric Data:来自 Ego4D、EPIC-KITCHENS、Xperience、EgoDex(829 小时)和 EgoVerse(1,300 多小时,1,965 个任务,240 场景)的数据。
  • Synthetic Simulation Data:在 20 个桌面场景、200 种配置和 450 项任务中共计 359,848 条成功轨迹。
  • Text-to-Action Data:约 720 万条轨迹(14,000 多小时),涵盖 6 种模板和 6 台单臂机器人。
  • Vision-Language Navigation:用于长时程轨迹规划和指令跟随的数据。
  • General Vision-Language Data:用于保持空间定位和多模态理解的通用视觉-语言数据,包括 48,000 条跨 13 维度的细粒度动作描述。

性能与基准

Qwen-VLA-Instruct 表明,单一通用模型能够在多个基准上匹配或超越专用模型的性能:

基准 最佳专用模型 Qwen-VLA
LIBERO ABot-M0 (98.6%) 97.9%
RoboCasa-GR1 ABot-M0 (58.3%) 56.7%
Simpler-WidowX StarVLA-OFT (64.6%) 73.7%
RoboTwin-Easy / Hard ABot-M0 (86.0% / 85.0%) 86.1% / 87.2%

此外,Qwen-VLA-Instruct 在 R2R Val-Unseen 上实现了 69.0% 的 Oracle 成功率和 57.5% 的成功率,在 RxR Val-Unseen 上的视觉-语言导航(VLN-CE)取得了 59.6% 的 SR 和 47.8% 的 SPL,超越所有开源基准。

真实世界泛化与动态场景

Qwen-VLA 在真实世界 ALOHA 双臂实验中表现出强大的分布外(OOD)泛化能力。预训练模型实现了 83.6% 的域内平均成功率和 76.9% 的 OOD 平均成功率,显著优于从头训练的模型(48.5% / 36.2%)和 $\pi_{0.5}$(71.6% / 41.5%)。

该模型能够泛化到未见过的颜色、物体(如蔬菜或太阳镜)、背景和光照条件。它还能够处理组合任务,例如“tidy up the table”,通过识别多个目标并执行多步骤操作。

在使用 DOMINO 基准的动态操作任务中,Qwen-VLA-Instruct 在未进行特定微调的情况下实现了 26.6% 的成功率和 39.5 的操作得分,超越了多个标准 VLA 基准以及部分专用的动态操作模型。

Sources