OpenGalaxea/GalaxeaVLA

Galaxea's open-source VLA repository

解决的问题

GalaxeaVLA 提供了一个通用的机器人控制系统,通过结合视觉感知、自然语言指令和精确的电机动作,使机器人能够执行复杂的操作任务。它解决了在单一模型中弥合高层推理(理解该做什么)与低层执行(如何移动机器人臂)之间差距的挑战。

工作原理

其核心是 G0.5,一个自回归视觉-语言-动作(VLA)模型。与传统系统使用 VLM 作为独立编码器不同,G0.5 使用单一的 Transformer 解码器,以连续流的方式生成推理令牌和动作令牌。

关键技术组件包括:

  • 统一流:模型处理多视角 RGB 图像、机器人状态和文本指令,输出一个序列,首先包含具身推理(如子任务和对象定位),然后是结构化动作令牌。
  • 跨体感 ActionCodec:一个学习得到的分词器,将多种机器人动作映射到共享的 27 维动作空间,使模型能够在不同机器人硬件之间泛化。
  • 原生思维链:推理直接集成在令牌序列中,意味着模型在发出实际移动命令之前会“思考”任务(例如,识别对象的边界框)。
  • 视觉记忆:模型使用因子化时空注意力,融入数秒的视觉历史,提升稳定性和上下文感知能力。

适用人群

本项目专为从事具身人工智能的机器人研究人员和开发者设计,特别适用于将模型部署到真实机器人(如 R1 Lite、R1 Pro、SO-100/101 和 Franka)或在 LIBERO 和 RoboTwin 等模拟器中进行测试的场景。

亮点

  • 单流架构:将推理与动作整合到一个下一个令牌预测目标中。
  • 广泛硬件支持:包含多个真实机器人形态的部署入口点。
  • 高性能表现:在 DROID(82.5%)和 LIBERO(98.9%)等基准测试中展现出强大的零样本成功率。
  • 开放世界数据集:提供超过 500 小时的真实世界移动操作数据,格式为 RLDS 和 LeRobot。

相关

  • 项目
  • Dispatch
  • 项目
  • 项目
  • 项目