MIV-XJTU/JanusVLN
[ICLR2026] Official implementation for "JanusVLN: Decoupling Semantics and Spatiality with Dual Implicit Memory for Vision-Language Navigation"
何を解決するか
JanusVLNは、自然言語の指示に基づいて3D環境をナビゲートする必要があるエージェントが直面するビジョン・ランゲージ・ナビゲーション(VLN)の課題に対処します。特に、2Dの意味論に偏ったアプローチから脱却し、意味理解と3D空間認知をより効果的に統合することで、ナビゲーションの正確性を向上させることを目指しています。
動作原理
人間の脳における意味処理と空間処理の分離に着想を得て、JanusVLNは二重の暗黙的記憶システムを採用しています。このシステムは、意味理解と空間性を分離する2つの補完的で固定サイズのコンパクトなニューラルメモリから構成されており、エージェントが3D空間での移動をより効果的に行うために、両方の情報を統合できるようにします。
対象ユーザー
本プロジェクトは、空間的エムベデッドAI、ロボット工学、ビジョン・ランゲージ・ナビゲーションエージェントの開発に取り組む研究者や開発者を対象としています。
主な特徴
- 二重暗黙的記憶: 意味と空間性に分けて使用する2つの独立したニューラルメモリを採用した初のVLNフレームワーク。
- 3D空間-意味の統合: 単純な2D意味認識から、統合された3D空間認識へのシフト。
- 包括的なトレーニングパイプライン: ベーストレーニング、DAggerデータ収集、および追加トレーニングをサポートし、性能向上を実現。
- 複数データセット対応: R2R、RxR、ScaleVLNデータセットと互換性あり。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト