open-gigaai/giga-world-1

A Roadmap to Build World Models for Robot Policy Evaluation

解決的問題

GigaWorld-1 提供了一個用於建構與訓練專為機器人策略評估設計之世界模型的框架。它解決了建立可控制、高保真機器人任務影片模擬的挑戰,讓研究人員能在真實世界部署前,於虛擬環境中測試機器人策略。

工作原理

本專案實作基於 WAN 架構的多階段訓練流程:

  • 階段一(可控制預訓練): 訓練 Nano(1.3B)與 Pro(5B)模型,以產生可控制的影片序列。
  • 階段二(加速蒸餾): 使用 DMD2 對去噪過程進行蒸餾,將所需的推論步驟從 20 減少至 4–6,大幅加快影片生成速度。
  • 資料流程: 使用 Qwen3-VL 進行標註生成,使用 Depth Anything V2 進行深度估計,將機器人資料(LeRobot 風格)轉換為 GigaWorld 格式。
  • 推論: 支援圖像到影片(i2v)與文字到影片(t2v)生成,可產出 33 秒、10 FPS 的 rollout。

適用對象

專為需要高品質世界模型來評估機器人策略的機器人研究人員與 AI 工程師設計,也適用於希望在自訂機器人領域訓練世界模型的使用者。

主要亮點

  • 雙模型尺寸: 提供 Nano(1.3B)與 Pro(5B)兩種版本,以平衡效能與資源限制。
  • 高效推論: 階段二蒸餾將生成步驟減少至 4–6,實現更快的 rollout。
  • 完整工具鏈: 包含訓練、推論、資料處理與 LoRA 合併的開源工作流程。
  • 領域可適應性: 僅需提供符合 GigaWorld 格式的資料,即可輕鬆適應新機器人領域,無需修改程式碼。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案