open-gigaai/giga-world-policy
GigaWorld-Policy: An Efficient Action-Centered World–Action Model
解決的問題
機器人策略學習通常依賴於世界行動模型(WAM),這些模型會預測未來的視覺場景與機器人動作。然而,在即時操作中產生未來影片會造成巨大的計算負載,使其過於緩慢,無法用於閉迴路機器人控制。
工作原理
GigaWorld-Policy-0.5 採用以行動為中心的方法。訓練期間使用未來視覺動態進行密集監督,以幫助模型理解物理基礎,但在推論時切換為僅行動解碼,從而消除影片生成的需求。為進一步提升速度,它採用 Mixture-of-Transformers 架構,將視覺動態與行動生成分離為專用專家,減少行動預測所需的計算量。專案亦利用基於代理的 AutoResearch 流程,自動優化訓練設定與超參數。
適用對象
需要世界模型物理基礎,但又避免影片生成延遲的即時控制策略之機器人研究人員與開發者。
亮點
- 低延遲:在本地 RTX 4090 上實現 85ms 推論延遲。
- 高效架構:使用 Mixture-of-Transformers 分離視覺與行動任務。
- 以行動為中心的推論:執行時無需生成未來影片。
- C++ 執行時:提供專用的 C++/CUDA 執行時(wam.cpp),支援使用 GGUF 與 ggml 後端進行即時部署。
相關
- 專案
- 專案
- 專案
- 專案
- 專案