open-gigaai/giga-world-1

A Roadmap to Build World Models for Robot Policy Evaluation

解决的问题

GigaWorld-1 提供了一个用于构建和训练专为机器人策略评估设计的世界模型的框架。它解决了创建可控制、高保真机器人任务视频模拟的挑战,使研究人员能够在真实世界部署前,在虚拟环境中测试机器人策略。

工作原理

该项目基于 WAN 架构实现了一个多阶段训练流水线:

  • 阶段1(可控预训练): 训练 Nano(1.3B)和 Pro(5B)模型以生成可控的视频序列。
  • 阶段2(加速蒸馏): 使用 DMD2 对去噪过程进行蒸馏,将所需的推理步骤从 20 步减少到 4–6 步,显著加快视频生成速度。
  • 数据流水线: 使用 Qwen3-VL 进行图像描述生成,使用 Depth Anything V2 进行深度估计,将机器人数据(LeRobot 风格)转换为 GigaWorld 格式。
  • 推理: 支持图像到视频(i2v)和文本到视频(t2v)生成,能够以 10 FPS 生成长达 33 秒的 rollout。

适用人群

专为需要高质量世界模型来评估机器人策略的机器人研究人员和 AI 工程师设计,也适用于希望在自定义机器人领域训练世界模型的用户。

主要亮点

  • 双模型尺寸: 提供 Nano(1.3B)和 Pro(5B)两种版本,以平衡性能与资源限制。
  • 高效推理: 阶段2蒸馏将生成步骤减少至 4–6 步,实现更快的 rollout。
  • 全面工具链: 包含用于训练、推理、数据处理和 LoRA 合并的开源工作流。
  • 领域可适应性: 仅需提供符合 GigaWorld 格式的数据,即可轻松适应新机器人领域,无需修改代码。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目