NVlabs/PointWorld
PointWorld: Scaling 3D World Models for In-The-Wild Robotic Manipulation
何を解決するか
PointWorldは、現実世界("in-the-wild")環境におけるロボット操作のための3Dワールドモデルのスケーラビリティの課題に対処します。部分的なRGB-Dデータとロボットの行動に基づいて、3Dシーン全体の進化(シーンフロー)を予測する方法を提供します。
動作方法
PointWorldは、環境とロボットの行動を両方とも3Dポイントフローとして表現する大規模な事前学習済み3Dワールドモデルです。部分的に観測可能なRGB-Dデータから、フルシーンの3Dポイントフローを予測します。アーキテクチャはDINOv3に基づくシーンエンコーダーベースと、Point Transformer V3 (PTv3) のアダプトされたコンポーネント(小、中、大サイズ)を組み合わせています。
対象ユーザー
このプロジェクトは、3Dワールドモデル、ロボット操作、エムブデッドAIに取り組む研究者や開発者向けに設計されており、3Dシーンフロー予測のためのパイプラインを必要とする方々を対象としています。
主な特徴
- マルチドメイン学習: DROID(現実世界)とBEHAVIOR(シミュレーション)のデータセット、または両方の組み合わせでの学習をサポートします。
- 3Dポイントフロー表現: 観測と行動の両方を3Dポイントフローとして扱い、フルシーンの進化を予測します。
- インタラクティブな可視化:
viserを基盤とするライブ3Dビューアーを備えており、時間的進化をステップ実行し、モデルの予測と真値を比較できます。 - 柔軟なアーキテクチャ: パフォーマンスとリソース使用量のバランスを考慮し、PTv3の複数のサイズバリアント(小、中、大)を提供します。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト