NVIDIA/Isaac-GR00T

NVIDIA Isaac GR00T N1.7 - A Foundation Model for Generalist Robots.

解決的問題

NVIDIA Isaac GR00T N1.7 是一個開源的視覺-語言-動作 (VLA) 模型,旨在提供通用的類人機器人技能。它透過處理多模態輸入(如語言和圖像)並將其轉換為連續的機器人動作,使機器人能夠在各種環境中執行操作任務。

工作原理

該模型結合了視覺-語言基礎模型 (Cosmos-Reason2-2B / Qwen3-VL) 作為骨幹網路,以及用於去除連續動作雜訊的擴散 Transformer (DiT) 头部。N1.7 的一項關鍵創新是使用了相對末端執行器 (EEF) 動作空間,它將動作表示為相對於當前姿勢的增量,而非絕對目標。這使得模型能夠將從 20,000 小時人類影片數據 (EgoScale) 中學習到的操作先驗知識,遷移到不同機器人形態的機器人控制中。

適用對象

本專案面向希望在類人或半類人機器人上部署通用操作技能的機器人研究人員和開發人員,以及希望在自定義機器人數據上微調 VLA 模型的開發者。

亮點

  • 跨具身泛化:使用共享的相對動作空間,可在不同類型的機器人之間工作。
  • 人到機器人的遷移:在海量人類影片數據集上進行預訓練,以提高語言遵循能力和泛化能力。
  • 靈活部署:支援零樣本推理、使用自定義數據進行微調以及透過 TensorRT 進行加速。
  • 廣泛集成:相容 Hugging Face LeRobot,並支援 RoboCasa 和 SimplerEnv 等各種基準測試。

相關

  • 專案
  • 專案
  • Dispatch
  • 專案
  • 專案