hzxie/DynamicVLA

The official implementation of "DynamicVLA: A Vision-Language-Action Model for Dynamic Object Manipulation". (arXiv 2601.22153)

解決的問題

DynamicVLA 解決了機器人領域中動態物體操作的挑戰,使機器人能夠與移動或狀態變化的物體互動,而不僅僅是靜態目標。

工作原理

它是一個視覺-語言-動作(VLA)模型,能夠處理視覺觀測和語言指令,並輸出機器人動作。專案提供完整的訓練與評估流程,包含一個名為 DOM(Dynamic Object Manipulation)的專用資料集,其中包含 3D 場景和物體。它與 Isaac Lab 集成,支援基於模擬的資料生成與基準測試,支援相對動作(delta 動作)與連續推論,實現更平滑的控制。

適用對象

專注於具身智能的機器人研究人員與開發者,特別是那些致力於視覺-語言-動作模型以及動態物體操作的人員。

主要亮點

  • DOM 資料集:專為動態物體操作設計的資料集,包含 3D 場景和物體。
  • Isaac Lab 集成:在高保真模擬環境中,完全支援合成資料生成與基準測試。
  • VLA 架構:結合視覺與語言,驅動機器人動作。
  • 靈活的動作空間:支援 delta 動作與多種旋轉表示(例如歐拉角)。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案