dexmal/opendm

An Open-World Foundation Model for General-Purpose Embodied Intelligence.

解決的問題

OpenDM 提供一個用於開放世界機器人控制的框架與預訓練模型。它解決了讓機器人能遵循開放式指令、處理長時程任務、應對動態干擾,並在不同機器人本體(多本體控制)之間運作的挑戰。

工作原理

此專案的核心是 DM0.5,一個視覺-語言-動作(VLA)模型。它處理視覺輸入(例如來自頭部鏡頭與手腕鏡頭的輸入)與語言指令,以預測機器人動作。系統支援監督微調(SFT)與 LoRA 訓練,可將基礎模型適配至特定機器人硬體與任務。此外,還包含使用 TensorRT、Triton 與 PyTorch FlexAttention 的「快速後端」,以加速推論。

適用對象

需要訓練、微調與部署 VLA 模型以用於真實或模擬機器人控制的具身人工智慧與機器人領域的研究人員與開發者。

主要亮點

  • 多本體支援:適用於多種機器人平台,包括 AgileX COBOT Magic 與 DOS-W1。
  • VLA 架構:將視覺、語言與動作預測整合至單一模型中。
  • 靈活的訓練:支援完整的 SFT 與 LoRA 微調工作流程。
  • 高效率推論:提供專用快速後端,以降低機器人控制中的延遲。
  • 基準就緒:包含預訓練檢查點與評估工作流程,適用於 LIBERO、RoboTwin2.0 與 VLA-Arena 等基準測試。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案