NVIDIA GTC 2025 Physical AI リリース: Cosmos Transfer, Physical AI Dataset, および Isaac GR00T N1

NVIDIAは、GTC 2025で物理AIの開発を加速するために、3つの主要なオープンソースリリースを発表しました:Cosmos Transferワールドファンデーションモデル、包括的なPhysical AI Dataset、そしてIsaac GR00T N1ヒューマノイド推論モデルです。これらのツールは、開発者に高忠実度の合成環境を生成し、商用グレードのロボットデータにアクセスし、ヒューマノイドロボットのための一般的な推論を実装する能力を提供します。

Cosmos Transfer: 制御可能なワールドファンデーションモデル

Cosmos Transferは、レイアウト、オブジェクト配置、およびモーションの正確な制御を通じてフォトリアリスティックなビデオシーケンスを生成するように設計された70億パラメータのワールドファンデーションモデル(WFM)です。これにより、構造的入力から高忠実度の仮想ワールドシーンを作成でき、これはNVIDIA Omniverseプラットフォームを介して自動車およびロボットの合成データ生成をスケールアップする上で重要です。

技術的実装と制御メカニズム

Cosmos Transferは、各センサーモダリティごとに個別に訓練されたControlNetを使用するマルチコントロールアーキテクチャを利用しています。推論時に、開発者は以下の構造化された視覚的または幾何学的データタイプを使用して出力をガイドできます:

  • 空間および幾何学的入力: 3Dバウンディングボックスマップ、深度マップ、およびLiDARスキャン。
  • モーションおよびレイアウト入力: 軌道マップ、セグメンテーションマップ、エッジマップ、および人間のモーションキーポイント。
  • 環境データ: HDマップ。

これらのブランチからの制御信号は、適応的時空間制御マップで乗算され、ベースモデルのトランスフォーマーブロックに統合される前に合計されます。これにより、開発者は構造と外観を厳密に保存するか、構造を保ちながら外観を変えること(天候や環境の変更など)が可能になります。

Open Physical AI Dataset

NVIDIAは、Hugging Face上で商用グレードかつ事前に検証済みのPhysical AIデータセットをリリースし、Cosmos Predictなどのファンデーションモデルのポストトレーニングをサポートしています。

データセットには以下が含まれます:

  • ロボティクス軌道: 320,000以上の軌道を表す15テラバイトのデータ。
  • 3Dアセット: 最大1,000のUniversal Scene Description (OpenUSD)アセットを含み、専用のSimReadyコレクションも含まれます。

NVIDIA Isaac GR00T N1: 一般的なヒューマノイド推論

NVIDIA Isaac GR00T N1は、一般的なヒューマノイドロボットの推論とスキルのために設計された最初のオープンファンデーションモデルです。NVIDIA Isaac GR00T-N1-2Bモデルは、マルチモーダル入力(言語と画像)を処理して、多様な環境および異なるロボットハードウェア(例えば、1X NeoおよびFourier GR-1)での操作タスクを実行するクロスエンボディメントモデルです。

デュアルシステム認知アーキテクチャ

Isaac GR00T N1は、人間の認知にインスパイアされたデュアルシステムアーキテクチャを採用し、高レベルの推論と低レベルの実行を分離しています:

  • システム 2 (ビジョン言語モデル): NVIDIA-EagleおよびSmolLM-1.7Bに基づき、このシステムは体系的思考を担当します。環境を推論し、必要なアクションを計画するためにビジョンと言語の指示を解釈します。
  • システム 1 (ディフュージョントランスフォーマー): このアクションモデルは、システム2からの高レベルプランを正確で連続的なロボットの動作とアクションに変換します。

機能とトレーニング

GR00T N1は、片腕または両腕でのオブジェクトの把持と操作、腕間でのアイテムの転送、および持続的な文脈理解を必要とするマルチステップタスクの実行など、タスクにおいて堅牢な一般化を示します。これらの機能は、材料搬送、梱包、および検査のアプリケーションを対象としています。

このモデルは、実際にキャプチャされたデータ、インターネット規模のビデオデータ、およびNVIDIA Isaac GR00T Blueprintを介して生成された合成データで構成される多様なデータセットでトレーニングされました。

Sources