nv-tlabs/kimodo

Official implementation of Kimodo, a kinematic motion diffusion model for high-quality human(oid) motion generation.

해결하는 문제

Kimodo는 고품질의 3D 인간 및 로봇 동작을 생성하도록 설계된 운동학적 모션 확산 모델입니다. 사용자가 자연어와 특정 운동학적 제약을 사용하여 생성 프로세스를 안내할 수 있도록 함으로써, 정밀하고 제어 가능한 3D 애니메이션을 제작하는 데 따르는 어려움을 해결합니다.

작동 원리

이 모델은 대규모 광학식 모션 캡처 데이터셋(최대 700시간)으로 학습되었습니다. 확산 기반 아키텍처를 사용하여 다음 두 가지 주요 입력에 따라 모션 시퀀스를 생성합니다:

  1. Text Prompts: 원하는 동작에 대한 자연어 설명.
  2. Kinematic Constraints: 전신 포즈 키프레임, 말단 장치(end-effector)의 위치/회전(손과 발), 루트 이동을 위한 2D 경로 또는 웨이포인트를 포함한 정밀한 제어.

SOMA, Unitree G1, SMPL-X를 포함한 다양한 스켈레톤 타입을 지원하며, 타임라인 기반 모션 저작을 위한 웹 기반 인터랙티브 데모를 제공합니다.

대상 사용자

  • 로봇 공학 연구자: 물리 기반 정책(예: ProtoMotions를 통해)을 훈련하기 위한 합성 모션 데이터가 필요한 연구자.
  • 3D 애니메이터: 텍스트와 키프레임을 사용하여 동작을 빠르게 제작하려는 사용자.
  • AI 연구자: 모션 생성 및 평가 벤치마크를 연구하는 개발자.

주요 특징

  • 멀티 스켈레톤 지원: SOMA, Unitree G1, SMPL-X 스켈레톤과 호환됩니다.
  • 광범위한 제어 가능성: 텍스트-투-모션과 말단 장치 제어와 같은 정밀한 운동학적 제약을 결합합니다.
  • 통합 벤치마크: 모션 품질과 텍스트 정렬을 측정하기 위한 표준화된 평가 파이프라인 및 테스트 스위트를 포함합니다.
  • 다운스트림 호환성: 시각화를 위한 MuJoCo 및 물리 기반 트래킹을 위한 ProtoMotions와 원활하게 통합됩니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트