nv-tlabs/kimodo

Official implementation of Kimodo, a kinematic motion diffusion model for high-quality human(oid) motion generation.

解決的問題

Kimodo 是一種運動學動作擴散模型,旨在生成高品質的 3D 人體與機器人動作。它透過允許使用者使用自然語言與特定的運動學約束來引導生成過程,解決了建立精確、可控的 3D 動畫之困難。

工作原理

該模型是在大規模光學動作捕捉數據集(長達 700 小時)上訓練的。它使用基於擴散的架構,根據兩個主要輸入生成動作序列:

  1. Text Prompts: 對所需動作的自然語言描述。
  2. Kinematic Constraints: 精確控制,包括全身姿勢關鍵影格、末端執行器位置/旋轉(手與腳)以及根運動的 2D 路徑或路標點。

它支援多種骨骼類型,包括 SOMA、Unitree G1 與 SMPL-X,並提供用於基於時間軸的動作創作的網頁版互動式演示。

適用對象

  • 機器人研究人員: 需要為訓練基於物理的策略(例如透過 ProtoMotions)生成合成動作數據的人員。
  • 3D 動畫師: 尋求使用文本與關鍵影格快速創作動作的使用者。
  • AI 研究人員: 從事動作生成與評估基準測試的開發人員。

亮點

  • 多骨骼支援: 相容於 SOMA、Unitree G1 與 SMPL-X 骨骼。
  • 廣泛的可控性: 將文本生成動作與末端執行器控制等精確的運動學約束相結合。
  • 整合基準測試: 包含用於衡量動作品質與文本對齊度的標準化評估流水線與測試套件。
  • 下游相容性: 與用於視覺化的 MuJoCo 以及用於基於物理的追蹤的 ProtoMotions 無縫整合。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案