open-gigaai/giga-brain-0
GigaBrain-0: A World Model-Powered Vision-Language-Action Model
何を解決するか
一般化ロボットの訓練には通常、膨大な量の現実世界データが必要ですが、その収集は高コストで時間がかかります。GigaBrain-0は、世界モデルを活用して大規模な合成データを生成することで、現実世界のロボットデータへの依存を軽減し、異なるタスク、物体の配置、カメラの視点にわたる一般化能力を向上させます。
仕組み
GigaBrain-0は、視覚・言語・行動(VLA)の基礎モデルです。現実世界のロボットデータと、世界モデルによって生成された大規模な合成データを組み合わせます。耐障害性と推論能力を向上させるために、RGBD(カラーと深度)入力のモデリングと、体現型Chain-of-Thought(CoT)の監視を導入しており、タスク実行中に空間幾何や長時間スパンの依存関係について推論できるようにしています。
対象ユーザー
体現型AIおよびロボティクスに取り組む研究者や開発者。特に、現実世界データの収集に頼らずにVLAモデルをスケーリングしたい人向けです。
主な特徴
- 世界モデルデータエンジン:合成データ生成により、学習のスケーリングとタスク間一般化の向上を実現。
- 体現型CoT:空間幾何や物体状態に関するChain-of-Thought推論を実装。
- RGBD対応:深度情報をモデル化し、ポリシーの耐障害性を強化。
- 高い性能:GigaBrain-0.1バージョンでRoboChallengeリーダーボードで1位を獲得。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト