amazon-far/abc
ABC: Scalable Behavior Cloning with Open Data, Training, and Evaluation
解決的問題
提供一個可擴展的機器人行為克隆框架,讓模型能從大規模的真實與模擬機器人軌跡開放資料集中學習複雜的物理任務(例如整理箱子中的瓶子)。
工作原理
本專案實作以 ABC-DiT 為核心的訓練流程。ABC-DiT 使用視覺主幹(DINOv3)與文字編碼器(CLIP)處理視覺與語言輸入。採用流匹配(flow-matching)進行動作預測,並支援在模擬與真實世界資料的混合資料上進行訓練。系統包含工具,可將原始 MCAP 資料轉換為專用格式(二進位狀態-動作檔案與高效能 MP4 影像堆疊),以優化訓練過程中的資料載入效率。
適用對象
希望使用大規模行為克隆訓練視覺-語言-動作(VLA)模型,並在模擬與真實環境中進行評估的機器人研究人員與工程師。
主要亮點
- 可擴展訓練:支援多 GPU 訓練(例如 8x H100/H200),具備優化的吞吐量。
- 混合資料支援:能同時在模擬與真實世界資料上訓練,提升泛化能力。
- 高效資料流水線:提供轉換腳本,將原始機器人資料轉換為高效能格式,加速訓練過程。
- 整合評估功能:提供基於 Viser 可視化的模擬評估套件,並支援系統性成功率日誌記錄。
相關
- 專案
- 專案
- 專案
- 專案
- 專案