MIV-XJTU/JanusVLN

[ICLR2026] Official implementation for "JanusVLN: Decoupling Semantics and Spatiality with Dual Implicit Memory for Vision-Language Navigation"

解决的问题

JanusVLN 解决了视觉-语言导航(VLN)的挑战,即智能体必须根据自然语言指令在 3D 环境中导航。它特别旨在超越以 2D 语义为主导的方法,更好地将语义理解与 3D 空间认知相结合,以提高导航准确性。

工作原理

受人类大脑中语义处理与空间处理分离的启发,JanusVLN 采用双隐式记忆系统。该系统由两个互补的、固定大小的紧凑神经记忆组成,将语义理解与空间性解耦,使智能体能够协同利用两类信息,从而在 3D 空间中更有效地移动。

适用人群

本项目专为从事空间具身 AI、机器人学以及视觉-语言导航智能体的研究人员和开发者设计。

主要亮点

  • 双隐式记忆:首个使用两个独立神经记忆分别处理语义与空间性的 VLN 框架。
  • 3D 空间-语义协同:从简单的 2D 语义识别转向整合的 3D 空间感知。
  • 全面的训练流程:支持基础训练、DAgger 数据收集以及额外训练以提升性能。
  • 多数据集支持:兼容 R2R、RxR 和 ScaleVLN 数据集。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目