Qwen-Robot Suite: 物理世界智能的基础模型套件

Qwen-Robot Suite 是由三个基础模型组成的集合,旨在将通用的多模态智能转化为物理动作。通过弥合视觉-语言表示空间与物理控制之间的差距,该套件使机器人能够在多种具身形态下进行导航、操作物体并预测世界动态。

Qwen-RobotNav: 统一的物理移动能力

Qwen-RobotNav 在单一权重集下统一了五类导航任务——指令遵循、点/物体目标导航、目标跟踪和自动驾驶。 基于 Qwen3-VL 构建,它通过参数化导航接口解决了这些任务不同的内存需求问题。

关键技术实现

  • 可控观测协议: 该模型利用四个维度(视觉 token 预算、时间衰减、每台摄像机权重和帧采样模式)作为推理时参数。这些参数在训练期间是随机化的,从而允许在不改变架构的情况下进行灵活配置。
  • 两层智能体系统: Qwen-RobotNav 作为一个可重构的原语。高层规划器(Qwen3.7-Plus)将长程目标分解为子任务,并动态切换模型的任务模式和上下文策略。
  • 跨具身部署: 该模型展示了零样本泛化能力,已部署在仅使用内置低分辨率摄像机的 Unitree Go2 四足机器人上,并在 NAVSIM 闭环驾驶中实现了 91.4 PDMS。

性能基准

Qwen-RobotNav 在五个领域实现了最先进(SOTA)的结果,包括在 VLN-CE RxR 上达到 76.5% 的成功率(SR),以及在 HM3Dv2 物体目标(仅 RGB)上达到 75.6% 的 SR。

Qwen-RobotManip: 可扩展的机器人交互

Qwen-RobotManip 专注于异构具身形态的挑战,即不同的机器人手臂具有不同的关节配置。它通过将视觉相似的动作对齐到数值接近的空间,实现了大规模的跨具身训练。

对齐与扩展

  • 统一的状态-动作表示: 该模型使用在单臂、双臂、灵巧手和移动具身形态之间共享的统一 80 维状态-动作表示。
  • 摄像机-帧末端执行器增量位姿: 通过使用摄像机-帧末端执行器增量位姿(camera-frame end-effector delta poses),该模型抽象掉了机器人之间的形态差异。
  • 人到机器人合成: 为了克服数据稀缺问题,一个流水线将第一人称视角的人类视频转换为机器人演示。该模型在超过 38,100 小时的数据上进行了训练,包括在 15 种具身形态下合成的 24,808 小时机器人演示。

泛化结果

Qwen-RobotManip 在 RoboChallenge Table30 v1 通用型赛道排名第一(45% SR)。它展示了显著的分布外(OOD)泛化能力,例如在 LIBERO-Plus 上达到 91.4% 的成功率,以及在 RoboTwin-C2R Hard 上达到 69.4% 的成功率。

Qwen-RobotWorld: 预测性世界动态

Qwen-RobotWorld 是一个世界模型,能够根据当前的观测和自然语言动作来预测物理世界的未来状态。它将世界的转换函数视为一个视频生成任务。

技术架构

  • 语言驱动的动作接口: 所有动作——包括转向命令和末端执行器位姿——都用自然语言表达。这使得 20 多种具身形态类型和 500 多种动作类别可以通过 Embodied World Knowledge 语料库(8.6M 视频-文本对)进行协同训练。
  • 双流 MMDiT: 一个 60 层的双流 MMDiT 将 Qwen2.5-VL 的语义表示与视频潜变量(latents)耦合。使用完整的多模态 LLM 作为动作编码器,确保生成的未来状态受内在物理定律(如重力与流体动力学)的约束。

能力

  • 多视图一致性: 该模型可以根据单一指令,从多个摄像机视角生成在时间和空间上一致的视频。
  • 人到机器人迁移: 它可以在无需远程操作的情况下,基于人类演示生成逼真的机器人执行视频。

闭环:从模型到智能体

由于 Qwen-Robot Suite 使用语言优先的接口,这些模型可以作为通用 VLM 的工具,从而创建复杂的智能体系统。

Qwen-RobotClaw

Qwen-RobotClaw 是一个机器人智能体框架,允许高层规划器(如 Qwen-3.5)调用套件模型进行物理执行。该架构实现了:

  • 开放式任务执行: VLM 可以提出任务并实时判断执行情况,而无需预定义的列表。
  • 长程操作: 复杂的指令被分解为原子子任务。如果高层规划器检测到失败,它可以重新规划并发布新的子任务以进行恢复。
  • 具身 QA: 将智能体系统与 Qwen-RobotNav 结合使用,可以实现复杂的探索,例如在建筑中寻找特定房间并根据视觉证据在回答用户查询之前验证其状态。

Sources