dexmal/dexbotic
Dexbotic: Open-Source Vision-Language-Action Toolbox
解決的問題
Dexbotic 解決了為具身智能開發視覺-語言-行動(VLA)模型的複雜性。它提供一個統一的工具箱,簡化 VLA 開發的整個生命週期——包括預訓練、微調、推論與評估——減少在處理不同機器人策略時對碎片化設定的需求。
工作原理
基於 PyTorch 建構,該工具箱採用基於分層設定、工廠註冊與入口分發的模組化架構。這使得研究人員無需重寫核心邏輯,即可透過實驗腳本更換模型、修改任務設定或新增功能。它支援多種機器人的統一訓練資料格式,並為主流演算法提供優化的預訓練基礎模型。該系統設計用於在本地消費級 GPU 與雲端平台之間運作,特別支援 Blackwell GPU 等高階硬體。
適用對象
專為從事具身智能領域的研究人員與開發者設計,適用於建構或評估用於機器人操作與導航的 VLA 模型。
主要亮點
- 廣泛模型支援:整合主流 VLA 策略,包括 π0、CogACT、OFT、MemVLA 和 DM0。
- 機器人相容性:為 UR5、Franka 和 ALOHA 等機器人提供統一的資料格式與部署腳本。
- 彈性訓練:支援本地與雲端訓練,包含 FSDP2 分散式訓練與 GRPO 強化學習。
- 優化推論:包含統一的 v1 推論 API 與基於 Triton 的即時後端,實現顯著加速。
- 全面基準測試:提供 Libero、CALVIN、SimplerEnv、ManiSkill2 與 RoboTwin2.0 等環境的即用型評估流程。
相關
- 專案
- 專案
- 專案
- 專案
- Dispatch