dexmal/opendw
An Open-Source World Model for Action-Conditioned Embodied Intelligence.
解决的问题
DW05是一个为具身智能设计的多模态世界模型。它帮助机器人基于当前观察理解特定动作如何导致未来结果,通过预测未来视频序列、生成动作和估计状态价值来实现。
工作原理
DW05使用基于Wan骨干构建的专家混合(MoT)框架。它处理包括语言、图像/视频、机器人类型、状态和动作在内的输入。该骨干馈送到三个专门的专家头:一个用于视频预测,一个用于动作生成,一个用于状态价值估计。
适用对象
本项目面向从事机器人学习、具身AI和机器人决策世界模型的研究人员和开发者。
亮点
- 统一框架:在单一模型中结合视频预测、动作生成和价值估计。
- 多模态输入:支持语言、视觉观察和机器人状态/本体感觉。
- 预训练权重:通过Hugging Face提供基础和微调(SFT-RBT)检查点。
- 动作条件展开:能够基于机器人观察和动作预测未来视频。
相关
- 项目
- 项目
- 项目
- 项目