Qwen-RobotNav: 에이전트 시스템을 위한 확장 가능한 내비게이션 모델

TL;DR

Qwen-RobotNav는 Qwen3-VL 백본 위에 구축된 확장 가능한 내비게이션 모델로, 다섯 개의 서로 다른 내비게이션 작업을 하나의 가중치 세트로 통합합니다. 이 모델은 추론 시점에 시각적 컨텍스트를 조정할 수 있는 제어 가능한 관찰 프로토콜을 도입하여 비전-언어 내비게이션, 객체 탐색, 추적, 자율 주행 및 구현된 질문 응답에서 최첨단 성능을 가능하게 합니다.

통합 다중 도메인 내비게이션

Qwen-RobotNav는 하나의 모델과 하나의 가중치 세트만을 사용하여 다섯 개 내비게이션 도메인 전반에 걸쳐 최첨단(SOTA) 결과를 달성합니다. 성능은 2B에서 8B 파라미터까지 일관되게 확장됩니다. 주요 벤치마크는 다음과 같습니다:

  • Vision-Language Navigation (VLN-CE): 8B 모델은 RxR 벤치마크에서 76.5% 성공률(SR), R2R에서 72.1% SR을 달성합니다.
  • Object-Goal Navigation (HM3Dv2): 4B 모델은 RGB 관찰만 사용하여 75.6% SR을 달성했으며, 깊이 기반 방법을 능가합니다.
  • Active Visual Tracking (EVT-Bench): 4B 모델은 90.0% 추적률에 도달합니다.
  • Autonomous Driving (NAVSIM): 4B 모델은 91.4 PDMS를 달성하여 특화된 주행 모델보다 우수합니다.
  • Embodied Question Answering (EQA): 에이전트 시스템은 세 개 벤치마크(HM-EQA, MT-EQA, EXPRESS)에서 새로운 SOTA 결과를 기록합니다.

제어 가능한 관찰 프로토콜

Qwen-RobotNav는 내비게이션 컨텍스트를 일급 객체이자 외부에서 제어 가능한 인터페이스로 취급합니다. 이 접근 방식은 모델이 아키텍처 변경이나 재학습 없이도 명령 수행을 위한 장기 메모리나 목표 추적을 위한 높은 최신성 등 다양한 작업 요구사항에 적응하도록 합니다.

모델은 추론 시점 파라미터로 네 가지 제어 축을 노출합니다:

  1. Visual token budget: 모든 카메라와 타임스텝에 할당된 총 토큰 수.
  2. Temporal decay: 최신 프레임과 오래된 프레임에 부여되는 가중치.
  3. Camera weights: 특정 카메라의 상대적 중요도(예: 전방 카메라 우선).
  4. Frame sample mode: 전역 히스토리를 위한 무작위 샘플링과 최신 프레임을 위한 샘플링 중 선택.

학습 시에는 이러한 파라미터가 샘플마다 무작위화되어, 추론 시 어떤 구성에도 모델이 일반화될 수 있도록 보장합니다.

에이전트 내비게이션 시스템 아키텍처

Qwen-RobotNav는 두 단계 에이전트 시스템 내에서 재구성 가능한 원시 요소로 설계되었습니다:

  • Upper-Level Planner: Qwen3.7-Plus에 의해 구동되는 이 계층은 장기 목표를 하위 목표로 분해하고 구성 가능한 내비게이션 호출을 전송합니다. 에피소드 중간에 작업 모드와 컨텍스트 전략을 동적으로 전환합니다.
  • Navigation Primitive: Qwen-RobotNav는 이러한 구간을 반응형 웨이포인트 예측기로 실행하며, 4층 MLP 액션 헤드를 통해 8개의 웨이포인트(각각 위치와 방향)를 출력합니다.

장기 추론을 유지하기 위해 시스템은 두 단계 메모리를 사용합니다: 각 구간에 대한 압축된 궤적 요약과 검색된 영역 및 거부된 가설을 추적하는 지속적인 "evidence notebook".

이 아키텍처는 이전 최고 기록 대비 77% 적은 내비게이션 단계로 EXPRESS-Bench에서 15.4% 향상을 달성했습니다.

학습 및 데이터 파이프라인

모델은 다섯 개 작업군에 걸쳐 1,560만 샘플과 비전-언어 추론 데이터를 보강하여 학습되었습니다. 데이터셋을 확장하기 위해 Qwen은 텍스트‑투‑비디오 생성물을 내비게이션 궤적으로 변환하는 자동 파이프라인을 도입했습니다. 이 과정은 프롬프트 생성, 비디오 합성, VLM 품질 필터링, 단일 카메라 깊이 추정, 그리고 운동학 필터링을 포함하며, 3D 씬 재구성 없이 40K개의 사진실감 샘플을 추가했습니다.

실제 배포 및 일반화

Qwen-RobotNav는 NVIDIA Jetson Thor를 이용해 온‑디바이스 추론을 수행하는 Unitree Go2 사족보행 로봇에 제로샷으로 배포되었으며, 196 ms(5.1 Hz)의 지연 시간을 달성했습니다.

로봇에 내장된 저해상도 카메라만을 사용하여 모델은 보지 못한 환경에서도 강력한 일반화를 보여주었습니다:

  • Instruction Following: 로봇은 전시관에서 21.78 m를 성공적으로 이동했으며, 명령에 따라 역방향으로 정확히 경로를 되돌아갔습니다.
  • Agentic Navigation: 시스템은 특정 커피숍에서 초록색 우산을 찾는 등 개방형 요청을 자율적으로 처리했으며, 작업을 분해하고 랜드마크를 통해 위치를 파악한 뒤 증거 기반 답변을 제공했습니다.

Sources