nv-tlabs/kimodo

Official implementation of Kimodo, a kinematic motion diffusion model for high-quality human(oid) motion generation.

What it solves

Kimodo 解決了生成高品質、可控的 3D 人體與機器人動作的困難。它允許用戶通過結合自然語言描述與精確的運動學約束,來創建複雜的動畫,從而彌合了高層次文本提示與低層次物理控制之間的差距。

How it works

Kimodo 是一個在 700 小時光學動作捕捉數據集上訓練的運動學動力學擴散模型。它根據文本提示和一組約束條件來生成各種骨架(SOMA, G1, SMPL-X)的 3D 動作。這些約束可以包括全身姿態關鍵幀、末端執行器位置(手/腳)以及地面平面上的 2D 路徑或路標點。

Who it’s for

此工具是為機器人學、電腦動畫和物理 AI 領域的研究人員和開發人員設計的,特別是那些需要生成合成動作數據以訓練物理基於策略(physics-based policies)或創建高保真度 3D 動畫的人員。

Highlights

  • Multi-Skeleton Support: SOMA, Unitree G1, 和 SMPL-X 骨架支持。
  • Interactive Authoring: 包含一個帶有時間軸編輯器的網頁版 Demo,用於混合使用文本提示和運動學控制。
  • Robotics Integration: 與 MuJoCo 兼容,用於視覺化,並與 ProtoMotions 兼容,用於訓練物理基於策略。
  • Comprehensive Benchmark: 提供標準化的評估管道和測試套件,用於衡量動作品質和約束遵循度。
  • Flexible Control: 支持多種約束,包括末端執行器控制和 2D 根部軌跡。