OpenWAM-Official/OpenWAM

Official repository for "OpenWAM: An Open, Modular Exploration Towards Systematic World–Action Model Pretraining".

何を解決するか

OpenWAMは、世界知識(未来の状態/動画の予測)と行動学習(ロボットの行動の予測)を組み合わせたWorld-Action Models (WAMs) を開発するためのモジュール式の研究スタックを提供します。密接に結合された設計選択から脱却し、研究者がモデルアーキテクチャ、表現、トレーニング戦略の異なる組み合わせを体系的に検証できるようにすることで、ロボットが世界知識を習得し、ドメイン間でスケーリングする能力を向上させることを目指しています。

動作方法

OpenWAMは3つの主要なコンポーネントで構成されています:

  • OpenWAM-Infra:ユーザーが異なる動画バックボーン(例:Wan, Cosmos)、VLMバックボーン(例:Qwen3-VL)、およびWAMアーキテクチャ(単一、二重、三重システム)を組み合わせて比較できるモジュール式インフラストラクチャ。
  • OpenWAM-Study:世界と行動学習の結合に関する原則を導出するために用いられる制御された研究群。
  • OpenWAM-α:エゴセントリックな人間およびロボットデータ約5億1800万フレームで事前学習された大規模な基礎モデル。

アーキテクチャは、単純な共有システムから、分離された行動および動画DiTを備えた複雑な二重システム、高レベルの理解に凍結されたVLMを組み込む三重システムまで多様です。

対象ユーザー

世界モデルや汎用ロボットポリシーに取り組むAI研究者およびロボット工学エンジニア向けです。特に、視覚的結果とロボット行動の両方を予測できるモデルの事前学習および微調整を検討している方々に適しています。

主な特徴

  • モジュール式設計:交換可能な動画バックボーン、視覚エンコーダ、VLMバックボーンをサポート。
  • 広範なベンチマーク:RoboTwin、LIBERO、RoboCasa365、VLABench などでの評価を統合的にサポート。
  • uma 基礎モデル:OpenWAM-α を含み、6,400時間分のデータで事前学習されたモデル。
  • 柔軟なアーキテクチャ:単一、二重、三重システムといった複数のシステム構成を提供し、行動と世界知識の統合方法を検証可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト