Qwen-RobotNav:面向代理系统的可扩展导航模型
TL;DR
Qwen-RobotNav 是一个基于 Qwen3-VL 骨干网络的可扩展导航模型,能够在单一权重集合下统一五种不同的导航任务。它引入了一种可控观测协议,使得代理在推理时能够调节视觉上下文,从而在视觉语言导航、目标搜索、跟踪、自动驾驶和具身问答等任务上实现最先进的性能。
统一的多领域导航
Qwen-RobotNav 使用单一模型和一套权重,在五个导航领域均达到了最先进(SOTA)的结果。性能从 2B 到 8B 参数规模均保持一致提升。关键基准包括:
- Vision-Language Navigation (VLN-CE): 8B 模型在 RxR 基准上实现了 76.5% 的成功率 (SR),在 R2R 上实现了 72.1% SR。
- Object-Goal Navigation (HM3Dv2): 4B 模型仅使用 RGB 观测即可达到 75.6% SR,超越基于深度的方案。
- Active Visual Tracking (EVT-Bench): 4B 模型的跟踪成功率达到 90.0%。
- Autonomous Driving (NAVSIM): 4B 模型实现了 91.4 PDMS,优于专用驾驶模型。
- Embodied Question Answering (EQA): 该代理系统在三个基准(HM-EQA、MT-EQA 和 EXPRESS)上创下新的 SOTA 成绩。
可控观测协议
Qwen-RobotNav 将导航上下文视为一等公民的、可外部控制的接口。该方法使模型能够适配不同任务需求——例如指令遵循需要长期记忆,而目标跟踪需要高度近期性——而无需更改架构或重新训练。
模型在推理时公开四个控制轴作为参数:
- 视觉令牌预算: 在所有摄像头和时间步之间分配的令牌总数。
- 时间衰减: 对近期帧相较于旧帧的权重分配。
- 摄像头权重: 对特定摄像头的相对重要性(例如优先使用前向摄像头)。
- 帧采样模式: 在全局历史的随机采样和紧密近期的最新帧采样之间选择。
在训练阶段,这些参数会在每个样本上随机化,确保模型在推理时能够适应任意配置。
代理导航系统架构
Qwen-RobotNav 被设计为两层代理系统中的可重构原语:
- 上层规划器: 由 Qwen3.7-Plus 提供动力,该层将长时程目标分解为子目标并发出可配置的导航调用。它能够在一次任务执行过程中动态切换任务模式和上下文策略。
- 导航原语: Qwen-RobotNav 将这些段落作为响应式航点预测器执行,通过 4 层 MLP 动作头输出 8 条航点(每条包含位置和朝向)。
为保持长期推理,系统采用两级记忆:每段的紧凑轨迹摘要以及一个持久的“证据笔记本”,记录已搜索区域和被排除的假设。
该架构在 EXPRESS-Bench 上提升了 15.4%,且相比之前的最佳方案减少了 77% 的导航步数。
训练与数据流水线
模型在五个任务族上共使用 1560 万样本进行训练,并辅以视觉语言推理数据。为扩展数据集,Qwen 引入了自动化流水线,将文本到视频的生成转化为导航轨迹。该过程包括提示生成、视频合成、VLM 质量过滤、单目深度估计以及运动学过滤,新增了 4 万条写实样本且无需 3D 场景重建。
实际部署与泛化
Qwen-RobotNav 零-shot 部署在 Unitree Go2 四足机器人上,使用 NVIDIA Jetson Thor 进行端侧推理,延迟为 196 ms(约 5.1 Hz)。
仅使用机器人内置的低分辨率摄像头,模型在未见环境中表现出强大的泛化能力:
- 指令遵循: 机器人在展厅中成功行进 21.78 m,并在指令下精确逆向返回原路。
- 代理导航: 系统自主处理开放式请求,例如在特定咖啡店检查是否有绿色雨伞,通过任务分解、地标定位并提供基于证据的答案。