FORTH-ModelBasedTracker/MocapNET

A real-time method that estimates the 3D human pose directly in the popular Bio Vision Hierarchy (BVH) format, given estimations of the 2D body joints originating from monocular color images. Our contributions include: (a) A novel and compact 2D pose NSRM representation. (b) A human body orientation classifier and an ensemble of orientation-tuned

What it solves

MocapNETは、単眼RGB画像(単一カメラ映像)からリアルタイムで3Dヒューマンポーズを推定する問題を解決するために設計されました。2D関節推定をBio Vision Hierarchy(BVH)形式に変換し、これは3Dアニメーションの標準フォーマットです。これにより、高価なモーションキャプチャハードウェアを使用せずに、シンプルな映像から3Dアニメーションを作成できます。

How it works

システムは2D‑to‑3Dポーズ推定器として動作します。まず、MobileNet、OpenPose、Mediapipe などの2D関節推定器を用いてビデオフレーム内の体関節を検出します。この2D座標は、方向チューニングされたニューラルネットワークのアンサンブルに渡され、3Dポーズが回帰されます。

主な技術要素は以下の通りです:

  • NSRM Representation: コンパクトな2Dポーズ表現。
  • Orientation Classifier: 体の向きを識別し、3D回帰に適したニューラルネットワークを選択するシステム。
  • Inverse Kinematics (IK) Solver: 特定の対象人物の肢長に合わせてポーズを整合させる効率的なソルバー。
  • Blender Integration: 出力されたBVHファイルをBlender 3Dエディタ内のカスタムスキンヒューマンで使用できるプラグイン。

Who it’s for

このプロジェクトは、3Dアニメーター、コンピュータビジョン研究者、モーションキャプチャ、車載3Dボディトラッキング、バーチャルアバター向けアプリケーションを構築する開発者向けです。

Highlights

  • Real-time Performance: ハードウェアと設定に応じて30〜70 FPSで動作可能。
  • Holistic Tracking: バージョン4.0では、体・手・顔のトラッキングに加え、3D視線とBVH顔設定もサポート。
  • BVH Output: 標準フォーマットでモーションフレームを直接出力し、ほとんどの3Dエンジンと互換性あり。
  • Occlusion Robustness: 分解された運動学階層を使用し、身体の一部が遮蔽されてもポーズを復元可能。