nv-tlabs/kimodo

Official implementation of Kimodo, a kinematic motion diffusion model for high-quality human(oid) motion generation.

解決する課題

Kimodoは、高品質な3Dの人間およびロボットの動作を生成するために設計された運動学的モーション拡散モデルです。自然言語と特定の運動学的制約を使用して生成プロセスを誘導できるようにすることで、精密で制御可能な3Dアニメーションを作成する際の困難さを解決します。

仕組み

このモデルは、大規模な光学式モーションキャプチャデータセット(最大700時間)でトレーニングされています。拡散ベースのアーキテクチャを使用して、主に以下の2つの入力に基づいてモーションシーケンスを生成します:

  1. Text Prompts: 望ましい動作の自然言語による説明。
  2. Kinematic Constraints: 全身のポーズのキーフレーム、エンドエフェクタの位置/回転(手足)、およびルート移動のための2Dパスまたはウェイポイントを含む精密な制御。

SOMA、Unitree G1、SMPL-Xを含む複数のスケルトンタイプをサポートしており、タイムラインベースのモーション作成のためのウェブベースのインタラクティブなデモを提供しています。

対象者

  • ロボット工学研究者: 物理ベースのポリシー(例:ProtoMotions経由)をトレーニングするための合成モーションデータを生成する必要がある方。
  • 3Dアニメーター: テキストとキーフレームを使用してモーションを素早く作成する方法を探しているユーザー。
  • AI研究者: モーション生成および評価ベンチマークに取り組んでいる開発者。

ハイライト

  • マルチスケルトン対応: SOMA、Unitree G1、SMPL-Xのスケルトンと互換性があります。
  • 高度な制御性: テキストからモーションへの生成と、エンドエフェクタ制御のような精密な運動学的制約を組み合わせています。
  • 統合されたベンチマーク: モーションの品質とテキストとの整合性を測定するための標準化された評価パイプラインとテストスイートが含まれています。
  • ダウンストリーム互換性: 可視化のためのMuJoCoや、物理ベースのトラッキングのためのProtoMotionsとシームレスに統合されます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト