Open-X-Humanoid/HEX

HEX is a whole-body vision-language-action framework for full-sized humanoid robots.

解决的问题

HEX 解决了不同硬件平台上的全尺寸人形机器人全身操作的挑战。它通过从异构数据源学习并跨不同的机器人具身(embodiments)迁移策略,使机器人能够执行长程操作任务。

工作原理

HEX 是一个视觉-语言-动作 (VLA) 框架,使用 Qwen-VL 作为视觉和语言理解的骨干网络。它采用统一本体感受预测器 (UPP) 将不同的机器人状态对齐到共享的身体部位插槽,从而允许模型从多样化的数据集中学习预测性的身体动力学。流匹配动作头(flow-matching action head)预测手臂、手部和腰部的连续未来动作。为了保证稳定性,HEX 向处理腿部动作的低层基于 RL 的全身控制器提供高层指令。

适用对象

本项目面向从事人形机器人控制、跨具身学习以及视觉-语言-动作模型研究的机器人研究人员和开发人员。

亮点

  • 跨具身能力:对齐异构的人形机器人状态,实现跨不同平台(例如 Unitree G1, H1, Leju Kuavo)的策略迁移。
  • 全身协同:将上半身和腰部的高层 VLA 预测与用于腿部稳定性的低层 RL 控制器相结合。
  • 全面的数据支持:包含针对各种人形机器人平台数据集的预训练和微调代码。
  • 仿真支持:可以在 LIBERO 等仿真环境中进行评估和训练。

相关

  • 项目
  • 项目
  • Dispatch
  • 项目
  • 项目