hzxie/DynamicVLA

The official implementation of "DynamicVLA: A Vision-Language-Action Model for Dynamic Object Manipulation". (arXiv 2601.22153)

해결하는 문제

DynamicVLA는 로봇 공학에서 동적 물체 조작의 과제를 해결하여, 정적인 타겟이 아니라 움직이거나 상태가 변화하는 물체와도 상호작용할 수 있도록 합니다.

작동 방식

시각 관측과 언어 지시를 처리하여 로봇 동작을 출력하는 시각-언어-행동(VLA) 모델입니다. 훈련 및 평가를 위한 완전한 파이프라인을 제공하며, 3D 장면과 물체를 포함하는 전용 데이터셋인 DOM(Dynamic Object Manipulation)을 포함합니다. Isaac Lab과 통합되어 고정밀 시뮬레이션 환경에서 합성 데이터 생성 및 벤치마킹을 지원하며, 상대 이동(델타 동작)과 연속 추론을 지원하여 부드러운 제어를 가능하게 합니다.

대상 사용자

신체적 지능에 초점을 맞춘 로봇 공학 연구자 및 개발자로, 특히 시각-언어-행동 모델과 동적 물체 조작에 관심이 있는 분들입니다.

주요 특징

  • DOM 데이터셋: 3D 장면과 물체를 포함한 동적 물체 조작 전용 데이터셋.
  • Isaac Lab 통합: 고정밀 시뮬레이션 환경에서 합성 데이터 생성 및 벤치마킹을 완전히 지원.
  • VLA 아키텍처: 시각과 언어를 결합하여 로봇 동작을 제어.
  • 유연한 행동 공간: 델타 동작과 다양한 회전 표현(예: 오일러 각도)을 지원.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트