starVLA/starVLA
StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing
解决的问题
StarVLA 是一个模块化研究平台,旨在简化通用机器人视觉-语言-动作(VLA)模型的开发。它通过提供一个‘乐高式’的代码库,解决了构建这些系统时的复杂性,使模型骨干、动作头和训练方案等组件可以自由替换和集成,而无需重写整个流水线。
工作原理
该平台采用解耦、可组合的架构,将训练基础设施与特定模型架构分离。用户可以插入不同的基础模型骨干(如 Qwen 系列或 Florence-2)和可互换的动作头(例如自回归离散标记、并行连续解码或流匹配专家)。系统保持标准化的模型前向接口和模型无关的数据加载器,确保无论选择哪种框架变体,数据流都保持一致。
适用对象
主要面向正在构建通用机器人策略,并尝试不同 VLA 架构、训练范式和基准测试的机器人研究人员和开发者。
主要亮点
- 模块化架构:支持快速原型设计,允许独立调试和“烟雾测试”子模块。
- 多样化的动作头:包含 StarVLA-FAST、StarVLA-OFT、StarVLA-PI 和 StarVLA-GR00T 的实现。
- 广泛的基准支持:与 SimplerEnv、LIBERO、Robocasa、RoboTwin 2.0 和 RoboDojo 等多个基准集成。
- 灵活的训练方式:支持监督微调(SFT)、多模态协同训练,以及通过 RLinf 实现的强化学习后训练。
- 硬件兼容性:支持在 Ascend NPU 和单个 A100 GPU 上训练较小的 VLM。
相关
- Dispatch
- 项目
- 项目
- Dispatch
- 项目