OpenGalaxea/GalaxeaVLA
Galaxea's open-source VLA repository
解決的問題
GalaxeaVLA 提供了一個通用的機器人控制系統,透過結合視覺感知、自然語言指令與精確的馬達動作,使機器人能夠執行複雜的操作任務。它解決了在單一模型中彌合高階推理(理解該做什麼)與低階執行(如何移動機器人臂)之間差距的挑戰。
工作原理
其核心是 G0.5,一個自回歸視覺-語言-動作(VLA)模型。與傳統系統使用 VLM 作為獨立編碼器不同,G0.5 使用單一的 Transformer 解碼器,以連續流的方式生成推理令牌和動作令牌。
關鍵技術組件包括:
- 統一流:模型處理多角度 RGB 圖像、機器人狀態和文字指令,輸出一個序列,首先包含具身推理(如子任務和物件定位),然後是結構化動作令牌。
- 跨體感 ActionCodec:一個學習得到的分詞器,將多種機器人動作映射到共享的 27 維動作空間,使模型能在不同機器人硬體之間泛化。
- 原生思維鏈:推理直接整合在令牌序列中,意味著模型在發出實際移動命令之前會「思考」任務(例如,識別物件的邊界框)。
- 視覺記憶:模型使用因子化時空注意力,融入數秒的視覺歷史,提升穩定性與上下文感知能力。
適用對象
本專案專為從事具身人工智慧的機器人研究人員與開發者設計,特別適用於將模型部署到真實機器人(如 R1 Lite、R1 Pro、SO-100/101 和 Franka)或在 LIBERO 和 RoboTwin 等模擬器中進行測試的場景。
亮點
- 單流架構:將推理與動作整合到一個下一個令牌預測目標中。
- 廣泛硬體支援:包含多個真實機器人形態的部署入口點。
- 高性能量表現:在 DROID(82.5%)和 LIBERO(98.9%)等基準測試中展現出強大的零樣本成功率。
- 開放世界資料集:提供超過 500 小時的真实世界移動操作資料,格式為 RLDS 和 LeRobot。
相關
- 專案
- Dispatch
- 專案
- 專案
- 專案