allenai/molmoact2
Official Repository for MolmoAct2
해결하는 문제
MolmoAct2는 로봇 제어 및 실제 환경 적용을 위한 액션 추론 모델의 패밀리를 제공합니다. 고수준의 시각-언어 추론(VLM)을 연속적이고 폐루프 형태의 로봇 조작에 연결하는 도전 과제를 해결하며, 로봇이 시각적 관측과 언어 지시에 기반하여 작업을 수행할 수 있도록 합니다.
작동 방식
이 시스템은 Molmo2-ER의 몸체 인식 추론 시각-언어 백본을 기반으로 합니다. VLM에 연속적인 플로우 매칭 액션 전문가를 연결함으로써 로봇 상태 및 액션 모델링을 통합합니다. 이 아키텍처는 모델이 환경에 대해 추론한 후 이를 정밀한 로봇 동작으로 변환할 수 있도록 합니다.
대상 사용자
이 프로젝트는 SO-100/101, 바이맨루얼 YAM, Franka DROID 설정과 같은 로봇 에미보디를 다루는 로봇 연구자 및 개발자, 그리고 특정 조작 작업을 위한 시각-언어-액션(VLA) 모델의 파인튜닝을 고려하는 사람들에게 적합합니다.
주요 특징
- 다양한 모델 패밀리: 지속적인 학습을 위한 베이스 체크포인트, 깊이 토큰 추론을 갖춘 "Think" 버전, 그리고 특정 플랫폼(DROID, YAM, SO-100/101, LIBERO)용으로 파인튜닝된 정책 포함.
- LeRobot 통합: Hugging Face LeRobot 라이브러리에 완전 통합되어 표준화된 트레이닝, 평가, 배포 워크플로우를 제공.
- 현실 세계 대응 가능: 저지연 배포를 위한 FastAPI 추론 서버 제공 및 Intel XPU(GPU) 검증된 지원 제공.
- 풍부한 데이터셋: MolmoAct2-BimanualYAM, 일반 로봇 데이터셋, Molmo2-ER 몸체 인식 추론 데이터셋을 공개.
관련
- 프로젝트
- 프로젝트
- Dispatch
- 프로젝트
- Dispatch