dexmal/opendw
An Open-Source World Model for Action-Conditioned Embodied Intelligence.
解決的問題
DW05是一個為具身智能設計的多模態世界模型。它幫助機器人基於當前觀察理解特定動作如何導致未來結果,透過預測未來影片序列、生成動作和估計狀態價值來實現。
工作原理
DW05使用基於Wan骨幹構建的專家混合(MoT)框架。它處理包括語言、影像/影片、機器人類型、狀態和動作在內的輸入。該骨幹饋送到三個專門的專家頭:一個用於影片預測,一個用於動作生成,一個用於狀態價值估計。
適用對象
本專案面向從事機器人學習、具身AI和機器人決策世界模型的研究人員和開發者。
亮點
- 統一框架:在單一模型中結合影片預測、動作生成和價值估計。
- 多模態輸入:支援語言、視覺觀察和機器人狀態/本體感覺。
- 預訓練權重:透過Hugging Face提供基礎和微調(SFT-RBT)檢查點。
- 動作條件展開:能夠基於機器人觀察和動作預測未來影片。
相關
- 專案
- 專案
- 專案
- 專案