dexmal/opendw

An Open-Source World Model for Action-Conditioned Embodied Intelligence.

解決する課題

DW05は、具現化知能向けに設計されたマルチモーダル世界モデルです。ロボットが現在の観測に基づいて、特定のアクションが将来の結果にどのようにつながるかを理解するのを助けます。将来のビデオシーケンスを予測し、アクションを生成し、状態価値を推定します。

仕組み

DW05は、Wanバックボーン上に構築されたMixture-of-Experts(MoT)フレームワークを使用します。言語、画像/ビデオ、ロボットタイプ、状態、アクションなどの入力を処理します。このバックボーンは、ビデオ予測用、アクション生成用、状態価値推定用の3つの専門エキスパートヘッドに供給されます。

対象者

このプロジェクトは、ロボット学習、具現化AI、ロボットの意思決定のための世界モデルに取り組む研究者や開発者を対象としています。

ハイライト

  • 統合フレームワーク: ビデオ予測、アクション生成、価値推定を単一のモデルに統合。
  • マルチモーダル入力: 言語、視覚的観測、ロボットの状態/固有受容感覚をサポート。
  • 事前学習済みウェイト: Hugging Faceを介してベースおよびファインチューニング済み(SFT-RBT)チェックポイントを提供。
  • アクション条件付きロールアウト: ロボットの観測とアクションに基づいて将来のビデオを予測可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト