UWMILab/UniWM

Official implementation of paper "Unified World Models: Memory-Augmented Planning and Foresight for Visual Navigation"

何を解決するか

UniWMは、視覚的予測(何が起こるかを想像すること)と行動計画の整合性を確保する課題に取り組んでいます。モジュール型フレームワークを置き換える統合アプローチにより、ロボットの意思決定が視覚的に想像された結果に直接根ざしていることを保証します。

動作方法

UniWMは、視覚的予測と計画を統合するために、単一のマルチモーダル自己回帰バックボーンを使用しています。短期的な知覚的手がかりと長期的な軌道コンテキストを組み合わせる階層的メモリ機構を採用しており、拡張されたナビゲーション範囲にわたって安定した一貫性のある推論を可能にしています。

対象ユーザー

本プロジェクトは、エンボディドAI、自律ナビゲーション、ロボティクス用ワールドモデルの研究開発に従事する研究者や開発者向けに設計されています。

主な特徴

  • 統合的な予測と計画を実現するマルチモーダル自己回帰バックボーン。
  • 短期的・長期的コンテキストのバランスを取る階層的メモリ機構。
  • 視覚的に想像された結果に基づく根拠のある行動決定。
  • Hugging Faceにホストされたデータセットを含み、複数のナビゲーションスプリット(例:go_stanford, scand, sacson, recon)を提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト