nv-tlabs/kimodo

Official implementation of Kimodo, a kinematic motion diffusion model for high-quality human(oid) motion generation.

What it solves

Kimodo は、高品質で制御可能な 3D 人間およびロボットの動きを生成することの難しさに取り組んでいます。自然言語による記述と精密な運動学的な制約を組み合わせることで、複雑なアニメーションを作成することができ、高レベルのテキストプロンプトと低レベルの物理的な制御のギャップを埋めることができます。

How it works

Kimodo は、700 時間の光学式モーションキャプチャデータセットで学習された運動学拡散モデルです。テキストプロンプトと一連の制約条件に基づいて、各種スケルトン(SOMA, G1, SMPL-X)の 03D 動きを生成します。これらの制約には、全身のポーズのキーフレーム、手足の末端執行器(end-effector)のポジション、および地面平面上の 2D パスまたはウェイポイントが含まれます。

Who it’s for

このツールは、ロボティクス、コンピュータアニメーション、および物理 AI の研究者や開発者向けに設計されています。特に、物理ベースのポリシーを学習するための合成的な動きのデータセットを生成したり、高精度な 3DD 動きのアニメーションを作成したりする必要がある人々を対象としています。

Highlights

  • Multi-Skeleton Support: SOMA, Unitree G1, および SMPL-X スケルトンに対応しています。

  • Interactive Authoring: テキストプロンプトと運動学的な制御を組み合わせるための、タイムラインエディタを備えたウェブベースのデモが用意されています。

  • Robotics Integration: 可視化のための MuJoCo と、物理ベースのポリシーの学習のための ProtoMotions との互換性があります。

  • Comprehensive Benchmark: 動きの品質と制約の遵守を測定するための、標準化された評価パイプラインとテストスイートを提供します。

  • Flexible Control: 末端執行器の制御や 2D ルート・トラジェクトリ(root trajectories)を含む、多様な組み合わせの制約をサポートします。