dexmal/opendw

An Open-Source World Model for Action-Conditioned Embodied Intelligence.

解决的问题

DW05是一个为具身智能设计的多模态世界模型。它帮助机器人基于当前观察理解特定动作如何导致未来结果,通过预测未来视频序列、生成动作和估计状态价值来实现。

工作原理

DW05使用基于Wan骨干构建的专家混合(MoT)框架。它处理包括语言、图像/视频、机器人类型、状态和动作在内的输入。该骨干馈送到三个专门的专家头:一个用于视频预测,一个用于动作生成,一个用于状态价值估计。

适用对象

本项目面向从事机器人学习、具身AI和机器人决策世界模型的研究人员和开发者。

亮点

  • 统一框架:在单一模型中结合视频预测、动作生成和价值估计。
  • 多模态输入:支持语言、视觉观察和机器人状态/本体感觉。
  • 预训练权重:通过Hugging Face提供基础和微调(SFT-RBT)检查点。
  • 动作条件展开:能够基于机器人观察和动作预测未来视频。

相关

  • 项目
  • 项目
  • 项目
  • 项目