Qwen 机器人套件:用于导航、操作和世界建模的统一基础模型
TL;DR
Qwen 宣布了 Qwen‑Robot Suite,这是一组三个基础模型——Qwen‑RobotNav、Qwen‑RobotManip 和 Qwen‑RobotWorld——将语言层面的智能转化为具体的物理动作,使单一的代理系统能够在数十种机器人形态上实现导航、操作和世界动态预测。
Qwen‑Robot 套件概述
Qwen‑Robot 套件旨在弥合视觉‑语言理解与具身控制之间长期存在的鸿沟。它通过提供三个专门的基础模型来实现,每个模型将自然语言指令与不同的动作领域对齐:
- Qwen‑RobotNav – 将语言转换为用于导航和驾驶的移动指令。
- Qwen‑RobotManip – 将语言映射到跨异构机器人手臂的操作动作。
- Qwen‑RobotWorld – 根据语言条件的动作预测未来视频帧,有效学习世界动力学模型。
所有三个模型都提供 language‑first 接口,允许更高层的 Qwen 模型(例如 Qwen‑3.7‑Plus)在更广泛的代理架构中将它们调用为可复用的工具。
Qwen‑RobotNav:跨五个领域的统一移动
关键技术贡献
- 基于 Qwen3‑VL,模型引入了一个 parameterised navigation interface,具有两个维度:任务模式(指令遵循、目标搜索、跟踪、自动驾驶、具身问答)以及四轴 controllable observation protocol(视觉令牌预算、时间衰减、每摄像头加权、帧采样)。
- 在 15.6 M navigation samples 上进行训练,同时与视觉‑语言数据共同训练,以保持有根基的感知。
- 使用两层系统:上层规划器(Qwen‑3.7‑Plus)将长时程目标分解,并在剧集进行中动态切换任务模式和观察设置。
性能亮点
- 在五个基准上实现了最先进的成功率:VLN‑CE RxR 上 76.5 % SR,HM3Dv2 目标对象(仅 RGB)上 75.6 % SR,EVT‑Bench 上 90.0 % 跟踪率,NAVSIM 上 91.4 % PDMS,以及在三个 Embodied QA 数据集上创下新纪录。
- 参数规模从 2 B 到 8 B 以对数线性方式扩展。
- 在 Unitree Go2 四足机器人(NVIDIA Jetson Thor,196 ms 延迟)上实现零样本部署,仅使用内置低分辨率摄像头,成功执行多房间自然语言指令。
意义 可控的观察协议使单一模型能够作为任何代理系统的 可重构导航原语,消除对任务特定架构的需求,并支持具备持久记忆的长时程推理。
Qwen‑RobotManip:跨形态操作基础模型
核心对齐机制
- 统一的 80 维状态‑动作空间,在单臂、双臂、灵巧手和移动机器人之间共享。
- 相机帧坐标系的末端执行器增量姿态,使视觉上相似的运动在数值上接近,抽象掉形态差异。
- 上下文内策略适配,将执行历史读取为隐式的形态签名,从而实现即时适配。
训练数据
- >38 100 小时 的开源数据,包含:
- 11 320 小时的机器人演示,
- 1 933 小时的自我视角人类视频,
- 24 808 小时的机器人演示,这些演示通过 Human‑to‑Robot 流程(动作重定向、手部去除、模拟渲染、深度引导合成)从人类视频在 15 种形态上合成。
基准结果
- LIBERO‑Plus:91.4 %(比 π0.5 基线提升 +7.0)
- RoboTwin‑C2R Hard:69.4 %(+21.5)
- RoboCasa365 Composite‑Unseen:14.9 %(是次佳的 3 倍)
- EBench:45.6 %(+18.5)
- RoboTwin‑IF:72.0 %(+22.4)
- 在 RoboChallenge Table30 v1 Generalist Track 中排名 #1,夺得前两名,并以 20 % 的优势领先第三名。
意义 统一的表示被证明是规模化的前提:只有采用 UnifiedSpace + UnifiedEEF 方案的模型在数据量增加时才表现出清晰的对数线性性能提升。这使得单一策略能够处理多样的操作任务,实现零样本跨形态迁移,并通过高层重新规划从错误中恢复。
Qwen‑RobotWorld:语言条件的世界建模
设计理念
- 动作仅以 自然语言 表达,将末端执行器姿态、转向指令和导航路点统一在单一接口下。
- 在 Embodied World Knowledge corpus 上进行训练:8.6 M 视频‑文本对,覆盖 >200 M 帧,涉及 20 多种机器人形态和 500 多个动作类别。
模型架构
- 一个 60 层双流 MMDiT 将 Qwen2.5‑VL 语义嵌入与视频潜在空间耦合。
- 动作编码器是 完整的多模态 LLM(而非轻量文本编码器),使模型能够内化物理知识(刚体、流体动力学、重力),并生成物理上合理的未来。
性能与能力
- 在 EWMBench(运动保真度比亚军提升 +33 %)和 DreamGen Bench 上整体 第一名。
- 在 WorldModelBench(完美遵循牛顿物理、质量守恒、流体动力学)和 PBBench 上 首个开源。
- 生成细粒度、对关键词敏感的未来(例如,将 “red strawberry” 替换为 “yellow potato” 会相应改变预测结果)。
- 生成时间和空间一致的多视角视频,促进仿真到真实的迁移以及多摄像头策略训练。
- 实现零样本人类到机器人迁移:单个人人演示可转化为在多种形态(如 Kinova Gen3、KUKA iiwa、xArm7)上的真实机器人执行。
意义 通过学习统一的世界动力学模型,Qwen‑RobotWorld 既充当 合成数据引擎,又是其他套件组件的 闭环评估器,使操作、导航和驾驶任务能够相互强化对物理的理解。
从模型到代理:闭环实现
套件的 language‑first API 使通用 Qwen 模型能够充当 高层规划器,同时将低层执行委派给专门的套件模型。展示的应用包括:
- 开放式任务执行:Qwen‑Omni 通过语音提出操作任务,实时评估结果,并将执行交给 Qwen‑RobotManip,无需预定义任务列表。
- 长时程操作:Qwen‑3.5 规划器将复杂的桌面清洁指令分解为原子子任务;Qwen‑RobotManip 执行每个子任务,实现对分布外场景的鲁棒性能,并在失败后自动重新规划。
- 代理式导航与具身问答:将 Qwen‑RobotNav 与高层规划器结合,在具身问答基准(HM‑EQA、MT‑HM3D、EXPRESS‑Bench)以及实际演示(如在建筑中寻找开放的洗手间)上取得最先进的结果。
- Chat2Robot 演示:一个实验性网页界面允许用户输入自然语言指令,由 Qwen‑RobotManip 实时执行(目前仅限于 RoboTwin‑Clean 数据集中的 50 个任务)。
这些集成展示了套件如何作为任何多模态 LLM 的 物理世界工具集,将抽象推理转化为具体的机器人动作。
未来方向
Qwen 确认了若干未解决的挑战:
- 接触丰富、长时程任务,需要持续学习。
- 更紧密、低延迟的通用规划器与物理执行器耦合。
- 更丰富的人机环境交互模式(例如触觉反馈、语音)。
路线图强调扩展多模态感知规模、细化语言‑动作对齐,并将套件扩展至更多形态和动作类别。
引用
@article{qwenrobotnav,
title = {Qwen-RobotNav: A Scalable Navigation Model Designed for an Agentic Navigation System},
author = {Qwen Team},
year = {2026}
}
@article{qwenrobotmanip,
title = {Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models},
author = {Qwen Team},
year = {2026}
}
@article{qwenrobotworld,
title = {Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation},
author = {Qwen Team},
year = {2026}
}