Qwen-RobotManip:对齐解锁机器人操作基础模型的规模化

Qwen-RobotManip 是一个可泛化的 Vision-Language-Action (VLA) 基础模型,展示了仅在配合统一对齐框架时,扩大机器人操作数据才有效。通过对不同机器人形态、传感器和任务的表征进行对齐,该模型利用超过 38,100 小时的开源和合成数据,实现了对新场景、未见指令以及跨形态迁移的卓越泛化能力。

统一跨形态对齐框架

Qwen-RobotManip 通过在表征、运动和行为三个维度上引入对齐,解决了大规模多源训练中信号冲突的问题。

规范状态-动作表征

所有机器人状态和动作都映射到统一的 80 维向量。该向量兼容单臂、双臂、灵巧手和移动底座等配置。为防止不同形态之间的冲突,使用每维的二进制掩码,确保梯度仅在与当前训练机器人相关的已填充槽位上传递。

相机坐标系增量位姿

为了使不同机器人平台上视觉上相似的运动在数值上接近,末端执行器的动作以相机坐标系的增量而非机器人基座坐标系表示。模型在交叉注意力层中使用相机位置编码(Camera Positional Encoding,CaPE)处理相机外参,并将相机内参编码为视觉 token,以实现视野感知。

上下文内策略适应

模型使用结构化的形态提示——指定机器人平台、执行速度和 FPS——并结合历史的观测-动作块。这使得 Qwen-RobotManip 能够即时适应不同形态和行为模式的策略。训练期间采用随机上下文采样策略,以防止模型依赖动作复制的捷径。

大规模人类到机器人数据合成

由于机器人操作数据稀缺,Qwen-RobotManip 使用合成流水线将第一人称人类操作视频转换为机器人演示。

  • 管线: 系统将 1,933 小时的第一人称人类视频转换为跨 15 种形态的 24,808 小时机器人演示。此过程通过动作重定向、手部去除与修补、模拟渲染以及深度引导的合成实现。
  • 总语料库: 最终的预训练语料约为 38,100 小时,包含机器人数据(约 11,420 小时)、第一人称人类数据(约 1,933 小时)以及合成的人类到机器人数据(约 24,808 小时)。
  • 数据整理: 多阶段流水线通过五个状态-动作过滤阶段(去除噪声动作并验证运动学一致性)以及三个跨模态检查,确保语言指令与视频内容匹配、视觉观测与机器人状态对应,从而保证质量。

模型架构与训练

Qwen-RobotManip 将 Qwen3.5-4B 视觉语言骨干网与流匹配扩散 Transformer(Diffusion Transformer,DiT)动作头相结合。

训练分为两个主要阶段:

  1. 预训练: 采用双流协同训练方法,将 VLA 流(机器人操作数据)与 VLM 流(视觉语言理解数据)以 9:1 的比例结合。
  2. 后训练: 模型在每个基准的所有演示数据上进行通用 SFT(监督微调),并与 VL 与 VLA 数据共同训练,以提升 OOD 指令遵循能力。

分布外 (OOD) 泛化性能

Qwen-RobotManip 将 OOD 基准作为成功的主要衡量指标,认为分布内 (IID) 分数可能通过模式匹配而非真正的泛化获得。

仿真基准

  • LIBERO-Plus: Qwen-RobotManip-Context 达到 91.4% 的整体成功率,显著优于 $\pi_{0.5}$(84.4%)。在处理相机和机器人扰动方面表现尤为突出。
  • RoboTwin-C2R Hard: 在 “Hard” 环境随机化下,模型成功率为 69.4%,比 $\pi_{0.5}$ 高出 21.5%。
  • RoboCasa365: 在 “Composite-Unseen” 任务(OOD 场景中的长时程任务)中,模型达到 14.9%,几乎是次佳模型(5.4%)的三倍。
  • EBench: 模型整体成功率为 45.6%,优于 $\pi_{0.5}$(27.1%)及其他基线。
  • RoboTwin-IF: 在使用未见模板的指令遵循中,模型平均成功率为 72.2%,比 $\pi_{0.5}$ 高出 22.6 分。
  • RoboTwin-XE: 在零样本跨形态迁移(在 AgileX ALOHA 上训练,在未见机器人上测试)中,相机坐标系的 EEF 表征使模型成功率达到 23.9%,是 $\pi_{0.5}$(eef)的 3.2 倍。

真实世界评估

  • 新场景与指令: 域内成功率为 88.6%,OOD 成功率为 87.5%,而 $\pi_{0.5}$ 的 OOD 成功率仅为 37.5%。
  • 少样本适应: 在仅对 5 个任务的 130 条演示进行微调时,Qwen-RobotManip 在 5 项任务中有 4 项超越基线。
  • 跨形态技能迁移: 在 CobotMagic 与 ARX 数据上微调的策略在全新 ARX 任务上(无训练演示)实现 55.0% 成功率,较未使用统一框架的消融变体提升 4 倍。
  • RoboChallenge Table30 v1: Qwen-RobotManip 在通用赛道排名第一,成功率为 45%,比第三名高出 20%。

关于规模化与恢复的关键发现

  • 对齐是前提: 研究发现,只有具备统一跨形态表征的模型才呈现出清晰的对数线性数据规模化。缺乏对齐时,增加数据会导致规模曲线不稳定或趋于平坦。
  • 双手协同: 模型在双手协同任务上取得 40% 成功率,显著高于 $\pi_{0.5}$(21.2%)。它是唯一在 “将薯条倒入盘子” 任务上取得成功(30%)的模型。
  • 自发恢复: 模型展示了主动的错误恢复能力(例如在抓取滑脱后自动重试),该行为源自大规模预训练,而非显式编程。

Sources