FORTH-ModelBasedTracker/MocapNET

A real-time method that estimates the 3D human pose directly in the popular Bio Vision Hierarchy (BVH) format, given estimations of the 2D body joints originating from monocular color images. Our contributions include: (a) A novel and compact 2D pose NSRM representation. (b) A human body orientation classifier and an ensemble of orientation-tuned

What it solves

MocapNET은 단일 카메라 RGB 영상(모노큘러 RGB 이미지)에서 실시간으로 3D 인간 자세를 추정하는 문제를 해결하도록 설계되었습니다. 2D 관절 추정을 Bio Vision Hierarchy(BVH) 형식으로 변환하는데, 이는 3D 애니메이션의 표준 포맷이며, 고가의 모션 캡처 하드웨어 없이도 간단한 영상으로 3D 애니메이션을 만들 수 있게 해줍니다.

How it works

시스템은 2D‑to‑3D 포즈 추정기로 동작합니다. 먼저 MobileNet, OpenPose, Mediapipe 등 2D 관절 추정기를 사용해 비디오 프레임에서 신체 관절을 감지합니다. 이 2D 좌표는 방향에 맞게 튜닝된 신경망 앙상블에 전달되어 3D 포즈를 회귀합니다.

핵심 기술 구성 요소는 다음과 같습니다:

  • NSRM Representation: 컴팩트한 2D 포즈 표현.
  • Orientation Classifier: 신체 방향을 식별해 3D 회귀에 적합한 신경망을 선택하는 시스템.
  • Inverse Kinematics (IK) Solver: 특정 대상 인물의 사지 길이에 맞게 포즈를 정제하는 효율적인 솔버.
  • Blender Integration: 출력 BVH 파일을 Blender 3D 편집기에서 커스텀 스킨 인간과 함께 사용할 수 있게 하는 플러그인.

Who it’s for

이 프로젝트는 3D 애니메이터, 컴퓨터 비전 연구자, 모션 캡처, 자동차용 3D 바디 트래킹, 가상 아바타 애플리케이션을 개발하는 개발자를 위한 것입니다.

Highlights

  • Real-time Performance: 하드웨어와 설정에 따라 30‑70 FPS로 실행 가능.
  • Holistic Tracking: 버전 4.0에서는 몸, 손, 얼굴을 추적하며 3D 시선 및 BVH 얼굴 설정도 지원합니다.
  • BVH Output: 대부분의 3D 엔진과 호환되는 표준 포맷으로 모션 프레임을 직접 출력합니다.
  • Occlusion Robustness: 분해된 운동학 계층을 사용해 신체 일부가 가려져도 포즈를 복구합니다.