nv-tlabs/kimodo
Official implementation of Kimodo, a kinematic motion diffusion model for high-quality human(oid) motion generation.
What it solves
Kimodo 解决了解生成高质量、可控的 3D 人体与机器人动作的困难。它允许用户通过结合自然语言描述与运动学约束,来创建复杂的动画,从而弥合了高层级文本提示与低层级物理控制之间的差距。
How it works
Kimodo 是一种运动学扩散模型,是在 700 小时光学动作捕捉数据集上训练的。它根据文本提示和一组约束条件来生成各种骨架(SOMA, G1, SMPL-X)的 3D 动作。这些约束可以包括全身姿态关键帧、末端执行器位置(手/脚)、以及 2D 路经或地面平面上的路标点。
Who it’s for
该工具是为机器人学、计算机动画和物理 AI 领域的研究人员和开发者设计的,特别是那些需要生成合成运动数据以训练物理基准策略(physics-based policies)或创建高保真 3D 动画的人员。
Highlights
- Multi-Skeleton Support: 支持 SOMA, Unitree G1, 和 SMPL-X 骨架。
- Interactive Authoring: 包含一个带有时间轴编辑器的网页版 Demo,用于混合使用文本提示与运动学约束控制。
- Robotics Integration: 与 MuJoCo 兼容,用于可视化,并与 ProtoMotions 兼容,用于训练物理基准策略。
- Comprehensive Benchmark: 提供标准化的评估流程和测试套件,用于衡量运动质量与约束遵循度。
- Flexible Control: 支持多种约束,包括末端执行器控制和 2D 根部轨迹。