MIV-XJTU/JanusVLN
[ICLR2026] Official implementation for "JanusVLN: Decoupling Semantics and Spatiality with Dual Implicit Memory for Vision-Language Navigation"
解决的问题
JanusVLN 解决了视觉-语言导航(VLN)的挑战,即智能体必须根据自然语言指令在 3D 环境中导航。它特别旨在超越以 2D 语义为主导的方法,更好地将语义理解与 3D 空间认知相结合,以提高导航准确性。
工作原理
受人类大脑中语义处理与空间处理分离的启发,JanusVLN 采用双隐式记忆系统。该系统由两个互补的、固定大小的紧凑神经记忆组成,将语义理解与空间性解耦,使智能体能够协同利用两类信息,从而在 3D 空间中更有效地移动。
适用人群
本项目专为从事空间具身 AI、机器人学以及视觉-语言导航智能体的研究人员和开发者设计。
主要亮点
- 双隐式记忆:首个使用两个独立神经记忆分别处理语义与空间性的 VLN 框架。
- 3D 空间-语义协同:从简单的 2D 语义识别转向整合的 3D 空间感知。
- 全面的训练流程:支持基础训练、DAgger 数据收集以及额外训练以提升性能。
- 多数据集支持:兼容 R2R、RxR 和 ScaleVLN 数据集。
相关
- 项目
- 项目
- 项目
- 项目
- 项目