robbyant-research/Zero-WAM
In‑Context World‑Action Modeling from Human Videos for Open‑Ended Task Generalization
解決的問題
Zero-WAM 解決了零樣本跨任務機器人操作的挑戰。它讓機器人能夠執行從未訓練過的任務,透過使用部署時的上下文(例如人類示範影片或語言指示),而不需為每個新任務重新收集機器人專用的訓練資料或更新參數。
工作原理
本專案將人類示範影片視為視覺任務規格。它使用因果影片-動作策略,根據提供的上下文預測未來的機器人觀測結果與可執行動作。為訓練此模型,研究團隊開發了「HumanGen」流程,利用視覺語言模型(VLM)、影像編輯工具與影片生成模型,將現有的機器人軌跡轉換為語意匹配的人類操作影片,建構出一個大型的人類-機器人上下文學習(ICL)配對資料集。
適用對象
此技術專為從事開放式任務泛化與具身人工智慧的機器人研究人員與工程師設計,特別適合希望減少對每項新操作任務都依賴大量機器人蒐集資料的研究者。
主要亮點
- 上下文世界-動作建模:單一策略同時支援語言與人類影片作為任務指示。
- HumanGen 流程:一個可擴展的系統,在 8.6K 個任務中生成了 74.2K 個人類-機器人 ICL 配對。
- 未來片段預測:一種旨在減少捷徑學習、強化模型對人類影片提示依賴性的目標函數。
- 零樣本效能:在 RoboTwin 2.0 與真實世界未見過的配置中成功運作,無需更新模型參數。
相關
- 專案
- 專案
- 專案
- 專案