allenai/molmoact2

Official Repository for MolmoAct2

解决的问题

MolmoAct2 提供了一组专为机器人控制和现实世界部署设计的行动推理模型。它解决了将高层视觉-语言推理(VLM)与连续、闭环机器人操作连接的挑战,使机器人能够基于视觉观察和语言指令执行任务。

工作原理

该系统基于 Molmo2-ER 身体推理型视觉-语言骨干网络。通过将 VLM 与连续的流匹配动作专家连接,整合了机器人状态和动作建模。这种架构使模型能够对环境进行推理,然后将推理结果转化为精确的机器人动作。

适用对象

本项目适用于使用 SO-100/101、双臂 YAM 和 Franka DROID 等机器人实体的研究人员和开发者,也适用于希望针对特定操作任务对视觉-语言-动作(VLA)模型进行微调的用户。

主要亮点

  • 多样化的模型家族:包含用于持续训练的基础检查点、具备深度标记推理能力的「Think」版本,以及针对特定平台(DROID、YAM、SO-100/101、LIBERO)微调的策略。
  • 与 LeRobot 完全集成:已完全集成至 Hugging Face LeRobot 库,支持标准化的训练、评估和部署工作流。
  • 现实世界就绪:提供 FastAPI 推理服务器以实现低延迟部署,并验证支持 Intel XPU(GPU)。
  • 丰富的数据集:发布 MolmoAct2-BimanualYAM、通用机器人数据集以及 Molmo2-ER 身体推理数据集。

相关

  • 项目
  • 项目
  • Dispatch
  • 项目
  • Dispatch