nv-tlabs/kimodo

Official implementation of Kimodo, a kinematic motion diffusion model for high-quality human(oid) motion generation.

解决的问题

Kimodo 是一种运动学运动扩散模型,旨在生成高质量的 3D 人体和机器人动作。它通过允许用户使用自然语言和特定的运动学约束来引导生成过程,解决了创建精确、可控的 3D 动画的难题。

工作原理

该模型是在大规模光学动作捕捉数据集(长达 700 小时)上训练的。它使用基于扩散的架构,根据两个主要输入生成动作序列:

  1. Text Prompts: 对所需动作的自然语言描述。
  2. Kinematic Constraints: 精确控制,包括全身姿态关键帧、末端执行器位置/旋转(手和脚)以及根运动的 2D 路径或路标点。

它支持多种骨骼类型,包括 SOMA、Unitree G1 和 SMPL-X,并提供用于基于时间轴的动作创作的基于 Web 的交互式演示。

适用对象

  • 机器人研究人员: 需要为训练基于物理的策略(例如通过 ProtoMotions)生成合成动作数据的人员。
  • 3D 动画师: 寻求使用文本和关键帧快速创作动作的用户。
  • AI 研究人员: 从事动作生成和评估基准测试的开发人员。

亮点

  • 多骨骼支持: 兼容 SOMA、Unitree G1 和 SMPL-X 骨骼。
  • 广泛的可控性: 将文本生成动作与末端执行器控制等精确的运动学约束相结合。
  • 集成基准测试: 包括用于衡量动作质量和文本对齐度的标准化评估流水线和测试套件。
  • 下游兼容性: 与用于可视化的 MuJoCo 和用于基于物理的追踪的 ProtoMotions 无缝集成。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目