allenai/molmoact2
Official Repository for MolmoAct2
何を解決するか
MolmoAct2は、ロボット制御および現実世界への展開を目的としたアクション推論モデルのファミリーを提供します。高レベルの視覚言語推論(VLM)を連続的で閉ループのロボット操作に接続する課題に対処し、ロボットが視覚的観測と言語指示に基づいてタスクを実行できるようにします。
仕組み
このシステムは、Molmo2-ERの体現推論型視覚言語バックボーンを基盤としています。VLMに連続的なフローマッチングアクションエキスパートを接続することで、ロボットの状態とアクションモデリングを統合しています。このアーキテクチャにより、モデルは環境について推論し、その推論を正確なロボット動作に変換できます。
対象ユーザー
このプロジェクトは、SO-100/101、バイマンアールYAM、Franka DROIDなどのロボットエミボディに取り組んでいるロボット研究者および開発者、および特定の操作タスク向けに視覚言語アクション(VLA)モデルのファインチューニングを検討している人を対象としています。
主な特徴
- 多様なモデルファミリー:継続的な学習用のベースチェックポイント、深度トークン推論を備えた「Think」バージョン、および特定プラットフォーム(DROID、YAM、SO-100/101、LIBERO)向けにファインチューニングされたポリシーを含む。
- LeRobot統合:Hugging Face LeRobotライブラリに完全統合され、標準化されたトレーニング、評価、デプロイワークフローを提供。
- 現実世界対応:低遅延デプロイ用のFastAPI推論サーバーを提供し、Intel XPU(GPU)の検証済みサポートを実装。
- 豊富なデータセット:MolmoAct2-BimanualYAM、一般ロボットデータセット、Molmo2-ER体現推論データセットをリリース。
関連
- プロジェクト
- プロジェクト
- Dispatch
- プロジェクト
- Dispatch