MIV-XJTU/JanusVLN

[ICLR2026] Official implementation for "JanusVLN: Decoupling Semantics and Spatiality with Dual Implicit Memory for Vision-Language Navigation"

解決的問題

JanusVLN 解決了視覺-語言導航(VLN)的挑戰,即智能體必須根據自然語言指令在 3D 環境中導航。它特別旨在超越以 2D 語意為主導的方法,更有效地整合語意理解與 3D 空間認知,以提升導航準確度。

工作原理

受人類大腦中語意處理與空間處理分離的啟發,JanusVLN 採用雙隱式記憶系統。該系統由兩個互補的、固定大小的緊湊神經記憶組成,將語意理解與空間性解耦,使智能體能協同利用兩類資訊,從而在 3D 空間中更有效地移動。

適用對象

本專案專為從事空間具身 AI、機器人學以及視覺-語言導航智能體的研究人員與開發者設計。

主要亮點

  • 雙隱式記憶:首個使用兩個獨立神經記憶分別處理語意與空間性的 VLN 框架。
  • 3D 空間-語意協同:從簡單的 2D 語意辨識轉向整合的 3D 空間感知。
  • 全面的訓練流程:支援基礎訓練、DAgger 資料收集以及額外訓練以提升效能。
  • 多資料集支援:相容 R2R、RxR 和 ScaleVLN 資料集。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案