OpenWAM-Official/OpenWAM

Official repository for "OpenWAM: An Open, Modular Exploration Towards Systematic World–Action Model Pretraining".

解決的問題

OpenWAM 提供一個模組化的研究堆疊,用於開發世界-動作模型(WAMs),這些模型結合了世界知識(預測未來狀態/影片)與動作學習(預測機器人動作)。它旨在擺脫緊密耦合的設計選擇,讓研究人員能系統性地實驗不同的模型架構、表示方式與訓練策略,以提升機器人獲取世界知識的能力,並實現跨領域擴展。

工作原理

OpenWAM 由三個主要元件組成:

  • OpenWAM-Infra:一個模組化基礎設施,允許使用者組合與比較不同的影片骨幹(例如 Wan、Cosmos)、VLM 骨幹(例如 Qwen3-VL)以及 WAM 架構(單系統、雙系統或三系統)。
  • OpenWAM-Study:一組受控研究,用於推導世界與動作學習耦合的原則。
  • OpenWAM-α:一個在超過 5.18 億幀的自我中心人類與機器人資料上預訓練的大規模基礎模型。

架構範圍從簡單的共享系統,到複雜的雙系統(包含獨立的動作與影片 DiT),再到整合凍結 VLM 以實現高階理解的三系統。

適用對象

專為從事世界模型與通用機器人策略的 AI 研究人員與機器人工程師設計,特別是那些希望預訓練與微調能同時預測視覺結果與機器人動作的模型的研究者。

主要亮點

  • 模組化設計:支援可交換的影片骨幹、視覺編碼器與 VLM 骨幹。
  • 廣泛的基準測試:整合支援在 RoboTwin、LIBERO、RoboCasa365、VLABench 等平台上的評估。
  • uma 基礎模型:包含 OpenWAM-α,一個在 6,400 小時資料上預訓練的模型。
  • 彈性架構:提供多種系統配置(單系統、雙系統、三系統),用以測試動作與世界知識的整合方式。

相關

  • 專案
  • 專案
  • 專案
  • 專案