NVIDIA/Isaac-GR00T

NVIDIA Isaac GR00T N1.7 - A Foundation Model for Generalist Robots.

解決する課題

NVIDIA Isaac GR00T N1.7は、汎用的なヒューマノイドロボットのスキルを提供するために設計されたオープンな視覚言語アクション(VLA)モデルです。言語や画像などのマルチモーダル入力を処理し、それらを連続的なロボットの動作に変換することで、ロボットが多様な環境で操作タスクを実行できるようにします。

仕組み

このモデルは、バックボーンとして視覚言語基盤モデル(Cosmos-Reason2-2B / Qwen3-VL)と、連続的な動作のノイズを除去する拡散トランスフォーマー(DiT)ヘッドを組み合わせて使用しています。N1.7の主要な革新は、相対的なエンドエフェクタ(EEF)アクションスペースの使用にあり、これは動作を絶対的なターゲットではなく、現在のポーズからのデルタ(差分)として表します。これにより、20,000時間の人間ビデオデータ(EgoScale)から学習した操作の事前知識を、異なるロボットの形態を越えてロボット制御に転送することが可能になります。

対象者

このプロジェクトは、ヒューマノイドまたはセミヒューマノイドロボットに汎用的な操作スキルをデプロイしたいロボット研究者や開発者、およびカスタムロボットデータでVLAモデルを微調整したい方を対象としています。

ハイライト

  • クロスエンボディメント汎用化: 共有された相対アクションスペースを使用して、異なるロボットタイプ間で動作します。
  • 人間からロボットへの転送: 大規模な人間ビデオデータセットで事前学習されており、言語指示への追従性と汎用性を向上させています。
  • 柔軟なデプロイ: ゼロショット推論、カスタムデータによる微調整、およびTensorRTによる加速をサポートしています。
  • 幅広い統合: Hugging Face LeRobotと互換性があり、RoboCasaやSimplerEnvなどの様々なベンチマークをサポートしています。

関連

  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト