robbyant-research/Zero-WAM

In‑Context World‑Action Modeling from Human Videos for Open‑Ended Task Generalization

解决的问题

Zero-WAM 解决了零样本跨任务机器人操作的挑战。它使机器人能够执行从未训练过的任务,通过使用部署时的上下文(如人类示范视频或语言指令),而无需为每个新任务重新收集机器人专用的训练数据或更新参数。

工作原理

该项目将人类示范视频视为视觉任务规范。它使用因果视频-动作策略,基于提供的上下文预测未来的机器人观测结果和可执行动作。为训练该模型,研究人员开发了「HumanGen」流水线,利用视觉语言模型(VLM)、图像编辑工具和视频生成模型,将现有的机器人轨迹转换为语义匹配的人类操作视频,构建了一个大规模的人类-机器人上下文学习(ICL)配对数据集。

适用对象

该技术专为从事开放性任务泛化和具身人工智能的机器人研究人员和工程师设计,特别适合那些希望减少对每项新操作任务都依赖海量机器人采集数据的研究者。

主要亮点

  • 上下文世界-动作建模:单一策略同时支持语言和人类视频作为任务指令。
  • HumanGen 流水线:一个可扩展的系统,在 8.6K 个任务中生成了 74.2K 个人类-机器人 ICL 配对。
  • 未来片段预测:一种旨在减少捷径学习、增强模型对人类视频提示依赖性的目标函数。
  • 零样本性能:在 RoboTwin 2.0 和真实世界未见过的配置中成功运行,无需更新模型参数。

相关

  • 项目
  • 项目
  • 项目
  • 项目