Qwen 机器人套件:用于导航、操作和世界建模的统一基础模型

TL;DR

Qwen 宣布了 Qwen‑Robot Suite,这是一组三个基础模型——Qwen‑RobotNavQwen‑RobotManipQwen‑RobotWorld——将语言层面的智能转化为具体的物理动作,使单一的代理系统能够在数十种机器人形态上实现导航、操作和世界动态预测。


Qwen‑Robot 套件概述

Qwen‑Robot 套件旨在弥合视觉‑语言理解与具身控制之间长期存在的鸿沟。它通过提供三个专门的基础模型来实现,每个模型将自然语言指令与不同的动作领域对齐:

  • Qwen‑RobotNav – 将语言转换为用于导航和驾驶的移动指令。
  • Qwen‑RobotManip – 将语言映射到跨异构机器人手臂的操作动作。
  • Qwen‑RobotWorld – 根据语言条件的动作预测未来视频帧,有效学习世界动力学模型。

所有三个模型都提供 language‑first 接口,允许更高层的 Qwen 模型(例如 Qwen‑3.7‑Plus)在更广泛的代理架构中将它们调用为可复用的工具。


Qwen‑RobotNav:跨五个领域的统一移动

关键技术贡献

  • 基于 Qwen3‑VL,模型引入了一个 parameterised navigation interface,具有两个维度:任务模式(指令遵循、目标搜索、跟踪、自动驾驶、具身问答)以及四轴 controllable observation protocol(视觉令牌预算、时间衰减、每摄像头加权、帧采样)。
  • 15.6 M navigation samples 上进行训练,同时与视觉‑语言数据共同训练,以保持有根基的感知。
  • 使用两层系统:上层规划器(Qwen‑3.7‑Plus)将长时程目标分解,并在剧集进行中动态切换任务模式和观察设置。

性能亮点

  • 在五个基准上实现了最先进的成功率:VLN‑CE RxR 上 76.5 % SR,HM3Dv2 目标对象(仅 RGB)上 75.6 % SR,EVT‑Bench 上 90.0 % 跟踪率,NAVSIM 上 91.4 % PDMS,以及在三个 Embodied QA 数据集上创下新纪录。
  • 参数规模从 2 B 到 8 B 以对数线性方式扩展。
  • 在 Unitree Go2 四足机器人(NVIDIA Jetson Thor,196 ms 延迟)上实现零样本部署,仅使用内置低分辨率摄像头,成功执行多房间自然语言指令。

意义 可控的观察协议使单一模型能够作为任何代理系统的 可重构导航原语,消除对任务特定架构的需求,并支持具备持久记忆的长时程推理。


Qwen‑RobotManip:跨形态操作基础模型

核心对齐机制

  1. 统一的 80 维状态‑动作空间,在单臂、双臂、灵巧手和移动机器人之间共享。
  2. 相机帧坐标系的末端执行器增量姿态,使视觉上相似的运动在数值上接近,抽象掉形态差异。
  3. 上下文内策略适配,将执行历史读取为隐式的形态签名,从而实现即时适配。

训练数据

  • >38 100 小时 的开源数据,包含:
    • 11 320 小时的机器人演示,
    • 1 933 小时的自我视角人类视频,
    • 24 808 小时的机器人演示,这些演示通过 Human‑to‑Robot 流程(动作重定向、手部去除、模拟渲染、深度引导合成)从人类视频在 15 种形态上合成。

基准结果

  • LIBERO‑Plus:91.4 %(比 π0.5 基线提升 +7.0)
  • RoboTwin‑C2R Hard:69.4 %(+21.5)
  • RoboCasa365 Composite‑Unseen:14.9 %(是次佳的 3 倍)
  • EBench:45.6 %(+18.5)
  • RoboTwin‑IF:72.0 %(+22.4)
  • 在 RoboChallenge Table30 v1 Generalist Track 中排名 #1,夺得前两名,并以 20 % 的优势领先第三名。

意义 统一的表示被证明是规模化的前提:只有采用 UnifiedSpace + UnifiedEEF 方案的模型在数据量增加时才表现出清晰的对数线性性能提升。这使得单一策略能够处理多样的操作任务,实现零样本跨形态迁移,并通过高层重新规划从错误中恢复。


Qwen‑RobotWorld:语言条件的世界建模

设计理念

  • 动作仅以 自然语言 表达,将末端执行器姿态、转向指令和导航路点统一在单一接口下。
  • Embodied World Knowledge corpus 上进行训练:8.6 M 视频‑文本对,覆盖 >200 M 帧,涉及 20 多种机器人形态和 500 多个动作类别。

模型架构

  • 一个 60 层双流 MMDiT 将 Qwen2.5‑VL 语义嵌入与视频潜在空间耦合。
  • 动作编码器是 完整的多模态 LLM(而非轻量文本编码器),使模型能够内化物理知识(刚体、流体动力学、重力),并生成物理上合理的未来。

性能与能力

  • 在 EWMBench(运动保真度比亚军提升 +33 %)和 DreamGen Bench 上整体 第一名
  • 在 WorldModelBench(完美遵循牛顿物理、质量守恒、流体动力学)和 PBBench 上 首个开源
  • 生成细粒度、对关键词敏感的未来(例如,将 “red strawberry” 替换为 “yellow potato” 会相应改变预测结果)。
  • 生成时间和空间一致的多视角视频,促进仿真到真实的迁移以及多摄像头策略训练。
  • 实现零样本人类到机器人迁移:单个人人演示可转化为在多种形态(如 Kinova Gen3、KUKA iiwa、xArm7)上的真实机器人执行。

意义 通过学习统一的世界动力学模型,Qwen‑RobotWorld 既充当 合成数据引擎,又是其他套件组件的 闭环评估器,使操作、导航和驾驶任务能够相互强化对物理的理解。


从模型到代理:闭环实现

套件的 language‑first API 使通用 Qwen 模型能够充当 高层规划器,同时将低层执行委派给专门的套件模型。展示的应用包括:

  • 开放式任务执行:Qwen‑Omni 通过语音提出操作任务,实时评估结果,并将执行交给 Qwen‑RobotManip,无需预定义任务列表。
  • 长时程操作:Qwen‑3.5 规划器将复杂的桌面清洁指令分解为原子子任务;Qwen‑RobotManip 执行每个子任务,实现对分布外场景的鲁棒性能,并在失败后自动重新规划。
  • 代理式导航与具身问答:将 Qwen‑RobotNav 与高层规划器结合,在具身问答基准(HM‑EQA、MT‑HM3D、EXPRESS‑Bench)以及实际演示(如在建筑中寻找开放的洗手间)上取得最先进的结果。
  • Chat2Robot 演示:一个实验性网页界面允许用户输入自然语言指令,由 Qwen‑RobotManip 实时执行(目前仅限于 RoboTwin‑Clean 数据集中的 50 个任务)。

这些集成展示了套件如何作为任何多模态 LLM 的 物理世界工具集,将抽象推理转化为具体的机器人动作。


未来方向

Qwen 确认了若干未解决的挑战:

  • 接触丰富、长时程任务,需要持续学习。
  • 更紧密、低延迟的通用规划器与物理执行器耦合。
  • 更丰富的人机环境交互模式(例如触觉反馈、语音)。

路线图强调扩展多模态感知规模、细化语言‑动作对齐,并将套件扩展至更多形态和动作类别。


引用

@article{qwenrobotnav,
  title   = {Qwen-RobotNav: A Scalable Navigation Model Designed for an Agentic Navigation System},
  author  = {Qwen Team},
  year    = {2026}
}
@article{qwenrobotmanip,
  title   = {Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models},
  author  = {Qwen Team},
  year    = {2026}
}
@article{qwenrobotworld,
  title   = {Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation},
  author  = {Qwen Team},
  year    = {2026}
}

Sources