dexmal/opendm
An Open-World Foundation Model for General-Purpose Embodied Intelligence.
解决的问题
OpenDM 提供了一个用于开放世界机器人控制的框架和预训练模型。它解决了让机器人能够遵循开放式指令、处理长时程任务、应对动态扰动,并在不同机器人本体(多本体控制)之间运行的挑战。
工作原理
该项目的核心是 DM0.5,一个视觉-语言-动作(VLA)模型。它处理视觉输入(例如来自头部摄像头和腕部摄像头的输入)和语言指令,以预测机器人动作。该系统支持监督微调(SFT)和 LoRA 训练,可将基础模型适配到特定机器人硬件和任务。此外,还包含一个使用 TensorRT、Triton 和 PyTorch FlexAttention 的“快速后端”,用于加速推理。
适用人群
需要训练、微调和部署 VLA 模型以用于真实或模拟机器人控制的具身人工智能和机器人领域的研究人员和开发者。
主要亮点
- 多本体支持:适用于多种机器人平台,包括 AgileX COBOT Magic 和 DOS-W1。
- VLA 架构:将视觉、语言和动作预测整合到一个模型中。
- 灵活的训练:支持完整的 SFT 和 LoRA 微调工作流。
- 高性能推理:提供专用的快速后端,以降低机器人控制中的延迟。
- 基准就绪:包含预训练检查点和评估工作流,适用于 LIBERO、RoboTwin2.0 和 VLA-Arena 等基准测试。
相关
- 项目
- 项目
- 项目
- 项目
- 项目