open-gigaai/giga-world-policy

GigaWorld-Policy: An Efficient Action-Centered World–Action Model

解决的问题

机器人策略学习通常依赖于世界行动模型(WAM),这些模型会预测未来的视觉场景和机器人动作。然而,在实时操作中生成未来视频会产生巨大的计算开销,导致其无法满足闭环机器人控制的实时性要求。

工作原理

GigaWorld-Policy-0.5 采用以行动为中心的方法。在训练期间,使用未来视觉动态进行密集监督,以帮助模型理解物理基础,但在推理阶段切换为仅行动解码,从而消除视频生成的需求。为进一步提升速度,它采用 Mixture-of-Transformers 架构,将视觉动态和动作生成分离为专用专家,减少动作预测所需的计算量。该项目还利用基于代理的 AutoResearch 流水线,自动优化训练配置和超参数。

适用人群

需要世界模型的物理基础但又避免视频生成延迟的实时控制策略的机器人研究人员和开发者。

亮点

  • 低延迟:在本地 RTX 4090 上实现 85ms 推理延迟。
  • 高效架构:使用 Mixture-of-Transformers 分离视觉与动作任务。
  • 以行动为中心的推理:运行时无需生成未来视频。
  • C++ 运行时:提供专用的 C++/CUDA 运行时(wam.cpp),支持使用 GGUF 和 ggml 后端进行实时部署。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目