allenai/molmoact2
Official Repository for MolmoAct2
解決的問題
MolmoAct2 提供一組專為機器人控制與現實世界部署設計的行動推理模型。它解決了將高階視覺-語言推理(VLM)與連續、閉迴路機器人操作連結的挑戰,使機器人能根據視覺觀察與語言指示執行任務。
工作原理
該系統基於 Molmo2-ER 身體推理型視覺-語言骨幹網路。透過將 VLM 與連續的流匹配動作專家連結,整合機器人狀態與動作建模。此架構使模型能對環境進行推理,並將推理結果轉化為精確的機器人動作。
適用對象
本專案適用於使用 SO-100/101、雙臂 YAM 和 Franka DROID 等機器人實體的研究人員與開發者,也適用於希望針對特定操作任務對視覺-語言-動作(VLA)模型進行微調的使用者。
主要亮點
- 多樣化的模型家族:包含用於持續訓練的基礎檢查點、具備深度標記推理能力的「Think」版本,以及針對特定平台(DROID、YAM、SO-100/101、LIBERO)微調的策略。
- 與 LeRobot 完全整合:已完全整合至 Hugging Face LeRobot 庫,支援標準化的訓練、評估與部署工作流程。
- 現實世界就緒:提供 FastAPI 推理伺服器以實現低延遲部署,並驗證支援 Intel XPU(GPU)。
- 豐富的資料集:釋出 MolmoAct2-BimanualYAM、通用機器人資料集以及 Molmo2-ER 身體推理資料集。
相關
- 專案
- 專案
- Dispatch
- 專案
- Dispatch