dexmal/opendw

An Open-Source World Model for Action-Conditioned Embodied Intelligence.

解決的問題

DW05是一個為具身智能設計的多模態世界模型。它幫助機器人基於當前觀察理解特定動作如何導致未來結果,透過預測未來影片序列、生成動作和估計狀態價值來實現。

工作原理

DW05使用基於Wan骨幹構建的專家混合(MoT)框架。它處理包括語言、影像/影片、機器人類型、狀態和動作在內的輸入。該骨幹饋送到三個專門的專家頭:一個用於影片預測,一個用於動作生成,一個用於狀態價值估計。

適用對象

本專案面向從事機器人學習、具身AI和機器人決策世界模型的研究人員和開發者。

亮點

  • 統一框架:在單一模型中結合影片預測、動作生成和價值估計。
  • 多模態輸入:支援語言、視覺觀察和機器人狀態/本體感覺。
  • 預訓練權重:透過Hugging Face提供基礎和微調(SFT-RBT)檢查點。
  • 動作條件展開:能夠基於機器人觀察和動作預測未來影片。

相關

  • 專案
  • 專案
  • 專案
  • 專案