Robbyant/lingbot-vla
A Pragmatic VLA Foundation Model
解決的問題
LingBot-VLA 是一種 Vision-Language-Action (VLA) 基礎模型,旨在為機器人控制提供一種實用且高性能的方法。它解決了建立能夠在不同機器人配置之間泛化,並在模擬與真實世界環境中均能以高成功率執行任務的模型之挑戰。
工作原理
該模型基於來自九種不同雙臂機器人配置的 20,000 小時真實世界數據的海量數據集進行預訓練。它提供兩個版本:標準版本以及結合了深度資訊以提升性能的深度蒸餾 (depth-distilled) 版本。程式碼庫針對訓練效率進行了優化,比現有的 VLA 程式碼庫提速 1.5 倍至 2.8 倍,並降低了 GPU 記憶體佔用。
適用對象
本專案面向希望在實體機器人或模擬環境(如 RoboTwin 2.0)中部署 VLA 模型的機器人研究人員與開發人員,以及正在尋找用於自定義機器人數據的高效訓練後流水線的人士。
亮點
- 大規模預訓練:在跨 9 種機器人配置的 20,000 小時數據上進行訓練。
- 高效率:顯著提升訓練速度並降低 GPU 記憶體消耗。
- 深度感知選項:提供無深度與深度蒸餾的模型檢查點。
- 強大的基準測試:在 GM-100 與 RoboTwin 2.0 基準測試中達到最先進水平。
- LeRobot 整合:與 LeRobot v3.0 完全相容,用於數據處理與部署。
相關
- 專案
- 專案
- 專案
- 專案
- 專案