open-gigaai/giga-world-policy
GigaWorld-Policy: An Efficient Action-Centered World–Action Model
何を解決するか
ロボットポリシー学習は、将来の視覚シーンとロボットの行動の両方を予測する世界行動モデル(WAM)に依存することが多いです。しかし、リアルタイム動作中に将来の動画を生成すると、膨大な計算負荷が生じ、閉ループロボット制御にはあまりに遅すぎます。
仕組み
GigaWorld-Policy-0.5は、行動中心のアプローチを採用しています。訓練中は、物理的な根拠を理解するための密集した監視のために将来の視覚ダイナミクスを使用しますが、推論時には行動のみのデコードに切り替え、動画生成の必要性を排除します。さらに高速化するために、視覚ダイナミクスと行動生成を専門的なエキスパートに分離するMixture-of-Transformersアーキテクチャを採用し、行動予測に必要な計算を削減しています。プロジェクトはまた、エージェントベースのAutoResearchパイプラインを活用して、訓練設定とハイパーパラメータを自動的に最適化しています。
対象ユーザー
世界モデルの物理的根拠を必要とするリアルタイム制御ポリシーを構築するロボティクス研究者および開発者。
特徴
- 低遅延: ローカルのRTX 4090で85msの推論遅延を達成。
- 効率的なアーキテクチャ: 視覚と行動のタスクを分離するMixture-of-Transformersを採用。
- 行動中心の推論: 実行時における将来の動画生成の必要性を排除。
- C++ランタイム: GGUFおよびggmlバックエンドを使用したリアルタイムデプロイ用に専用のC++/CUDAランタイム(wam.cpp)を提供。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト