open-gigaai/giga-world-policy

GigaWorld-Policy: An Efficient Action-Centered World–Action Model

解決的問題

機器人策略學習通常依賴於世界行動模型(WAM),這些模型會預測未來的視覺場景與機器人動作。然而,在即時操作中產生未來影片會造成巨大的計算負載,使其過於緩慢,無法用於閉迴路機器人控制。

工作原理

GigaWorld-Policy-0.5 採用以行動為中心的方法。訓練期間使用未來視覺動態進行密集監督,以幫助模型理解物理基礎,但在推論時切換為僅行動解碼,從而消除影片生成的需求。為進一步提升速度,它採用 Mixture-of-Transformers 架構,將視覺動態與行動生成分離為專用專家,減少行動預測所需的計算量。專案亦利用基於代理的 AutoResearch 流程,自動優化訓練設定與超參數。

適用對象

需要世界模型物理基礎,但又避免影片生成延遲的即時控制策略之機器人研究人員與開發者。

亮點

  • 低延遲:在本地 RTX 4090 上實現 85ms 推論延遲。
  • 高效架構:使用 Mixture-of-Transformers 分離視覺與行動任務。
  • 以行動為中心的推論:執行時無需生成未來影片。
  • C++ 執行時:提供專用的 C++/CUDA 執行時(wam.cpp),支援使用 GGUF 與 ggml 後端進行即時部署。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案