yuantianyuan01/FastWAM

Official codebase for Fast-WAM: Do World Action Models Need Test-time Future Imagination?

解决的问题

FastWAM 解决了机器人领域中世界动作模型(WAMs)相关的计算开销和延迟问题。具体而言,它探讨了在高性能下是否必须进行「测试时未来想象」(在预测动作前先预测未来视频帧),并提供了一种直接从当前观测预测动作的方法,从而实现显著更快的推理速度。

工作原理

FastWAM 采用基于去噪核心(ActionDiT)和 VAE 编码的模型架构。它提供两种主要运行模式:

  • 首帧模式(Fast-WAM): 跳过未来视频想象步骤,直接从当前观测预测动作,以降低延迟。
  • IDM 模式: 遵循传统方法,先想象未来视频帧,再基于这些想象预测动作。

为优化性能,该项目实现了编译后的去噪核心、批量 VAE 编码以及轻量级 CUDA Graph 后端,三者共同减少了推理时间和训练时长。

适用人群

本项目专为从事具身智能研究的机器人研究人员和开发者设计,特别是关注动作预测、世界模型以及提升机器人控制策略实时性能的群体。

主要亮点

  • 加速推理: 相比之前版本,实现了约 2 倍的端到端推理速度提升。
  • 双模式能力: 「可选 IDM」变体允许单个模型在不重新训练的情况下,自由切换未来想象(IDM)与直接动作预测(首帧)模式。
  • 数据集支持: 原生支持 LeRobot 2.1 和 3.0 数据集,提升了大规模数据的可扩展性。
  • 高成功率: 在 LIBERO 基准测试中,于空间、目标、物体及长时序任务上均表现出色。
  • 优化的流水线: 包含预计算的 T5 文本嵌入和编译后的训练路径,显著提升吞吐量。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • Dispatch