MIV-XJTU/JanusVLN

[ICLR2026] Official implementation for "JanusVLN: Decoupling Semantics and Spatiality with Dual Implicit Memory for Vision-Language Navigation"

해결하는 문제

JanusVLN은 자연어 지시에 따라 3차원 환경을 탐색해야 하는 비전-언어 탐색(VLN)의 과제를 해결합니다. 특히 2차원 의미 중심 접근 방식을 넘어서 의미 이해와 3차원 공간 인식을 더 효과적으로 통합하여 탐색 정확도를 향상시키는 것을 목표로 합니다.

작동 방식

인간 뇌의 의미 처리와 공간 처리의 분리를 영감으로 받아, JanusVLN은 이중 암묵적 기억 시스템을 활용합니다. 이 시스템은 의미 이해와 공간성에서 분리된 두 개의 보완적이고 고정된 크기의 컴팩트한 신경 기억 장치로 구성되어 있으며, 에이전트가 3차원 공간에서 보다 효과적으로 이동할 수 있도록 두 가지 정보를 통합할 수 있도록 합니다.

대상 사용자

이 프로젝트는 공간적 임베디드 AI, 로보틱스, 비전-언어 탐색 에이전트를 개발하는 연구자 및 개발자를 대상으로 합니다.

주요 특징

  • 이중 암묵적 기억: 의미와 공간성을 위한 두 개의 별도 신경 기억을 사용한 최초의 VLN 프레임워크입니다.
  • 3차원 공간-의미의 융합: 단순한 2차원 의미 인식에서 통합된 3차원 공간 인식으로의 전환.
  • 포괄적인 학습 파이프라인: 기본 학습, DAgger 데이터 수집, 성능 향상을 위한 추가 학습을 지원합니다.
  • 다중 데이터셋 지원: R2R, RxR, ScaleVLN 데이터셋과 호환됩니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트