NVIDIA/Isaac-GR00T

NVIDIA Isaac GR00T N1.7 - A Foundation Model for Generalist Robots.

解决的问题

NVIDIA Isaac GR00T N1.7 是一个开源的视觉-语言-动作 (VLA) 模型,旨在提供通用的类人机器人技能。它通过处理多模态输入(如语言和图像)并将其转换为连续的机器人动作,使机器人能够在各种环境中执行操作任务。

工作原理

该模型结合了视觉-语言基础模型 (Cosmos-Reason2-2B / Qwen3-VL) 作为骨干网络,以及用于去除连续动作噪声的扩散 Transformer (DiT) 头部。N1.7 的一项关键创新是使用了相对末端执行器 (EEF) 动作空间,它将动作表示为相对于当前姿态的增量,而非绝对目标。这使得模型能够将从 20,000 小时人类视频数据 (EgoScale) 中学习到的操作先验知识,迁移到不同机器人形态的机器人控制中。

适用对象

本项目面向希望在类人或半类人机器人上部署通用操作技能的机器人研究人员和开发人员,以及希望在自定义机器人数据上微调 VLA 模型的开发者。

亮点

  • 跨具身泛化:使用共享的相对动作空间,可在不同类型的机器人之间工作。
  • 人到机器人的迁移:在海量人类视频数据集上进行预训练,以提高语言遵循能力和泛化能力。
  • 灵活部署:支持零样本推理、使用自定义数据进行微调以及通过 TensorRT 进行加速。
  • 广泛集成:兼容 Hugging Face LeRobot,并支持 RoboCasa 和 SimplerEnv 等各种基准测试。

相关

  • 项目
  • 项目
  • Dispatch
  • 项目
  • 项目