hzxie/DynamicVLA

The official implementation of "DynamicVLA: A Vision-Language-Action Model for Dynamic Object Manipulation". (arXiv 2601.22153)

解决的问题

DynamicVLA 解决了机器人领域中动态物体操作的挑战,使机器人能够与移动或状态变化的物体交互,而不仅仅是静态目标。

工作原理

它是一个视觉-语言-动作(VLA)模型,能够处理视觉观测和语言指令,并输出机器人动作。该项目提供完整的训练与评估流水线,包含一个名为 DOM(Dynamic Object Manipulation)的专用数据集,其中包含 3D 场景和物体。它与 Isaac Lab 集成,支持基于仿真的数据生成和基准测试,支持相对动作(delta 动作)和连续推理,实现更平滑的控制。

适用对象

专注于具身智能的机器人研究人员和开发者,特别是那些致力于视觉-语言-动作模型以及动态物体操作的人员。

主要亮点

  • DOM 数据集:专为动态物体操作设计的数据集,包含 3D 场景和物体。
  • Isaac Lab 集成:在高保真仿真环境中,完全支持合成数据生成和基准测试。
  • VLA 架构:结合视觉与语言,驱动机器人动作。
  • 灵活的动作空间:支持 delta 动作和多种旋转表示(例如欧拉角)。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目