dexmal/dexbotic
Dexbotic: Open-Source Vision-Language-Action Toolbox
解决的问题
Dexbotic 解决了为具身智能开发视觉-语言-动作(VLA)模型的复杂性。它提供了一个统一的工具箱,简化了 VLA 开发的整个生命周期——包括预训练、微调、推理和评估——减少了在处理不同机器人策略时对碎片化设置的需求。
工作原理
基于 PyTorch 构建,该工具箱采用基于分层配置、工厂注册和入口分发的模块化架构。这使得研究人员无需重写核心逻辑,即可通过实验脚本更换模型、修改任务配置或添加新功能。它支持多种机器人的统一训练数据格式,并为主流算法提供优化的预训练基础模型。该系统设计用于在本地消费级 GPU 和云平台之间运行,特别支持 Blackwell GPU 等高性能硬件。
适用人群
专为从事具身智能领域的研究人员和开发者设计,适用于构建或评估用于机器人操作和导航的 VLA 模型。
主要亮点
- 广泛模型支持:集成主流 VLA 策略,包括 π0、CogACT、OFT、MemVLA 和 DM0。
- 机器人兼容性:为 UR5、Franka 和 ALOHA 等机器人提供统一的数据格式和部署脚本。
- 灵活训练:支持本地和云训练,包括 FSDP2 分布式训练和 GRPO 强化学习。
- 优化推理:包含统一的 v1 推理 API 和基于 Triton 的实时后端,实现显著加速。
- 全面基准测试:提供 Libero、CALVIN、SimplerEnv、ManiSkill2 和 RoboTwin2.0 等环境的即用型评估流水线。
相关
- 项目
- 项目
- 项目
- 项目
- Dispatch