OpenWAM-Official/OpenWAM

Official repository for "OpenWAM: An Open, Modular Exploration Towards Systematic World–Action Model Pretraining".

解决的问题

OpenWAM 提供了一个模块化的研究栈,用于开发世界-动作模型(WAMs),这些模型结合了世界知识(预测未来状态/视频)和动作学习(预测机器人动作)。它旨在摆脱紧密耦合的设计选择,使研究人员能够系统地实验不同的模型架构、表示方式和训练策略,以提升机器人获取世界知识的能力并实现跨领域扩展。

工作原理

OpenWAM 由三个主要组件构成:

  • OpenWAM-Infra:一个模块化基础设施,允许用户组合和比较不同的视频骨干网络(例如 Wan、Cosmos)、VLM 骨干网络(例如 Qwen3-VL)以及 WAM 架构(单系统、双系统或三系统)。
  • OpenWAM-Study:一系列受控研究,用于推导世界知识与动作学习耦合的原则。
  • OpenWAM-α:一个在超过 5.18 亿帧的自我中心人类和机器人数据上预训练的大规模基础模型。

架构范围从简单的共享系统到复杂的双系统(包含独立的动作和视频 DiT),再到包含冻结 VLM 以实现高层理解的三系统。

适用人群

专为从事世界模型和通用机器人策略的 AI 研究人员和机器人工程师设计,特别是那些希望预训练和微调能够同时预测视觉结果和机器人动作的模型的研究者。

主要亮点

  • 模块化设计:支持可互换的视频骨干网络、视觉编码器和 VLM 骨干网络。
  • 广泛的基准测试:集成支持在 RoboTwin、LIBERO、RoboCasa365、VLABench 等平台上的评估。
  • uma 基础模型:包含 OpenWAM-α,一个在 6,400 小时数据上预训练的模型。
  • 灵活的架构:提供多种系统配置(单系统、双系统、三系统),用于测试动作与世界知识的整合方式。

相关

  • 项目
  • 项目
  • 项目
  • 项目