hzxie/DynamicVLA
The official implementation of "DynamicVLA: A Vision-Language-Action Model for Dynamic Object Manipulation". (arXiv 2601.22153)
解决的问题
DynamicVLA 解决了机器人领域中动态物体操作的挑战,使机器人能够与移动或状态变化的物体交互,而不仅仅是静态目标。
工作原理
它是一个视觉-语言-动作(VLA)模型,能够处理视觉观测和语言指令,并输出机器人动作。该项目提供完整的训练与评估流水线,包含一个名为 DOM(Dynamic Object Manipulation)的专用数据集,其中包含 3D 场景和物体。它与 Isaac Lab 集成,支持基于仿真的数据生成和基准测试,支持相对动作(delta 动作)和连续推理,实现更平滑的控制。
适用对象
专注于具身智能的机器人研究人员和开发者,特别是那些致力于视觉-语言-动作模型以及动态物体操作的人员。
主要亮点
- DOM 数据集:专为动态物体操作设计的数据集,包含 3D 场景和物体。
- Isaac Lab 集成:在高保真仿真环境中,完全支持合成数据生成和基准测试。
- VLA 架构:结合视觉与语言,驱动机器人动作。
- 灵活的动作空间:支持 delta 动作和多种旋转表示(例如欧拉角)。
相关
- 项目
- 项目
- 项目
- 项目
- 项目