dexmal/opendm

An Open-World Foundation Model for General-Purpose Embodied Intelligence.

해결하는 문제

OpenDM은 오픈월드 로봇 제어를 위한 프레임워크와 사전 학습 모델을 제공합니다. 로봇이 개방형 지시를 따르고, 장기적인 작업을 처리하며, 동적 외란을 관리하고, 다양한 로봇 구현체(다중 구현체 제어)에서 작동할 수 있도록 하는 도전 과제를 해결합니다.

작동 방식

이 프로젝트의 중심은 DM0.5라는 비전-언어-액션(VLA) 모델입니다. 시각 입력(예: 헤드 카메라 및 손목 카메라)과 언어 지시를 처리하여 로봇의 행동을 예측합니다. 시스템은 감독된 미세조정(SFT)과 LoRA 학습을 지원하여 기본 모델을 특정 로봇 하드웨어와 작업에 맞게 조정할 수 있습니다. 또한 TensorRT, Triton, PyTorch FlexAttention을 사용한 '빠른 백엔드'를 포함하여 추론 속도를 가속화합니다.

대상 사용자

실제 또는 시뮬레이션된 로봇 제어를 위한 VLA 모델의 학습, 미세조정, 배포가 필요한 몸체 인공지능 및 로봇 분야의 연구자 및 개발자입니다.

주요 특징

  • 다중 구현체 지원: AgileX COBOT Magic 및 DOS-W1 등 다양한 로봇 플랫폼을 지원합니다.
  • VLA 아키텍처: 비전, 언어, 행동 예측을 하나의 모델에 통합합니다.
  • 유연한 학습: 전체 SFT 및 LoRA 미세조정 워크플로우를 지원합니다.
  • 고성능 추론: 로봇 제어에서 지연 시간을 줄이기 위한 전용 빠른 백엔드를 제공합니다.
  • 벤치마크 준비: LIBERO, RoboTwin2.0, VLA-Arena와 같은 벤치마크용 사전 학습 체크포인트와 평가 워크플로우를 포함합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트