FORTH-ModelBasedTracker/MocapNET

A real-time method that estimates the 3D human pose directly in the popular Bio Vision Hierarchy (BVH) format, given estimations of the 2D body joints originating from monocular color images. Our contributions include: (a) A novel and compact 2D pose NSRM representation. (b) A human body orientation classifier and an ensemble of orientation-tuned

What it solves

MocapNET 旨在解决从单目 RGB 图像(单摄像头视频)实时估计 3D 人体姿态的问题。它将 2D 关节估计转换为 Bio Vision Hierarchy(BVH)格式,这是一种 3D 动画的标准,使用户能够仅凭简单的视频流而无需昂贵的动作捕捉硬件就创建 3D 动画。

How it works

系统作为 2D‑to‑3D 姿态估计器运行。它首先使用 2D 关节估计器(如 MobileNet、OpenPose 或 Mediapipe)检测视频帧中的身体关节。这些 2D 坐标随后由一组方向调优的神经网络进行处理,以回归出 3D 姿态。

关键技术组件包括:

  • NSRM Representation:紧凑的 2D 姿态表示。
  • Orientation Classifier:识别身体朝向以选择适当的神经网络进行 3D 回归的系统。
  • Inverse Kinematics (IK) Solver:高效的求解器,细化 3D 输出以确保姿态与特定目标人物的肢体尺寸一致。
  • Blender Integration:插件,使输出的 BVH 文件可在 Blender 3D 编辑器中与自定义皮肤人物一起使用。

Who it’s for

本项目面向 3D 动画师、计算机视觉研究者以及构建动作捕捉、汽车 3D 身体追踪或虚拟化身应用的开发者。

Highlights

  • Real-time Performance:根据硬件和配置不同,可实现 30‑70 FPS 的实时运行。
  • Holistic Tracking:4.0 版支持身体、手部和面部的追踪,包含 3D 视线和 BVH 面部配置。
  • BVH Output:直接输出符合大多数 3D 引擎的标准格式运动帧。
  • Occlusion Robustness:使用分解的运动学层级,即使身体部位被遮挡也能恢复姿态。