open-gigaai/giga-world-1
A Roadmap to Build World Models for Robot Policy Evaluation
何を解決するか
GigaWorld-1 は、ロボットポリシー評価に特化した世界モデルの構築と訓練を可能にするフレームワークを提供します。ロボットタスクの制御可能で高精細なビデオシミュレーションを構築する課題に対処し、研究者が実世界に展開する前に仮想環境でロボットポリシーをテストできるようにします。
動作方法
このプロジェクトは WAN アーキテクチャに基づくマルチステージ訓練パイプラインを実装しています:
- ステージ1(制御可能な事前学習): Nano(1.3B)および Pro(5B)モデルを、制御可能なビデオシーケンスを生成するように訓練します。
- ステージ2(加速蒸留): DMD2 を使用してノイズ除去プロセスを蒸留し、推論ステップ数を 20 から 4~6 に削減することで、ビデオ生成を大幅に高速化します。
- データパイプライン: Qwen3-VL を用いてキャプション作成、Depth Anything V2 を用いて深度推定を行い、ロボットデータ(LeRobotスタイル)を GigaWorld 形式に変換します。
- 推論: 画像から動画(i2v)およびテキストから動画(t2v)の生成をサポートし、10 FPS で 33 秒のロールアウトを生成可能です。
対象ユーザー
ロボットポリシーの評価に高品質な世界モデルが必要なロボット研究者や AI エンジニア、およびカスタムロボットドメイン上で世界モデルを訓練したい方を対象としています。
主な特徴
- 二種類のモデルサイズ: パフォーマンスとリソース制約のバランスを考慮し、Nano(1.3B)および Pro(5B)の両方のバージョンを提供します。
- 効率的な推論: ステージ2の蒸留により、生成ステップ数を 4~6 に削減し、ロールアウトを高速化します。
- 包括的なツールキット: 訓練、推論、データ処理、LoRA マージのためのオープンソースワークフローを備えています。
- ドメインの適応性: GigaWorld 形式でデータを提供するだけで、コード変更なしに新しいロボットドメインに適応可能です。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト