allenai/molmoact2

Official Repository for MolmoAct2

解決的問題

MolmoAct2 提供一組專為機器人控制與現實世界部署設計的行動推理模型。它解決了將高階視覺-語言推理(VLM)與連續、閉迴路機器人操作連結的挑戰,使機器人能根據視覺觀察與語言指示執行任務。

工作原理

該系統基於 Molmo2-ER 身體推理型視覺-語言骨幹網路。透過將 VLM 與連續的流匹配動作專家連結,整合機器人狀態與動作建模。此架構使模型能對環境進行推理,並將推理結果轉化為精確的機器人動作。

適用對象

本專案適用於使用 SO-100/101、雙臂 YAM 和 Franka DROID 等機器人實體的研究人員與開發者,也適用於希望針對特定操作任務對視覺-語言-動作(VLA)模型進行微調的使用者。

主要亮點

  • 多樣化的模型家族:包含用於持續訓練的基礎檢查點、具備深度標記推理能力的「Think」版本,以及針對特定平台(DROID、YAM、SO-100/101、LIBERO)微調的策略。
  • 與 LeRobot 完全整合:已完全整合至 Hugging Face LeRobot 庫,支援標準化的訓練、評估與部署工作流程。
  • 現實世界就緒:提供 FastAPI 推理伺服器以實現低延遲部署,並驗證支援 Intel XPU(GPU)。
  • 豐富的資料集:釋出 MolmoAct2-BimanualYAM、通用機器人資料集以及 Molmo2-ER 身體推理資料集。

相關

  • 專案
  • 專案
  • Dispatch
  • 專案
  • Dispatch