yaoyao-jpg/PhiZero

Official implementation of PhiZero: A World Model Built Around Physical Language. Code and checkpoints coming soon.

何を解決するか

PhiZero は将来の物理的ダイナミクスについて推論するためのワールドモデルです。実世界における物体の動きや相互作用を予測する課題に対処するために、まず離散的な「物理言語(Physical Language)」で推論した後、その結果を動画としてレンダリングします。

動作方法

このシステムは、主に2つの段階で動作します:推論とレンダリング。物理言語推論器(Qwen3-VL をベース)は、最初のフレームとテキストキャプションに基づいて、256個の離散的な運動トークン(物理言語)のシーケンスを予測します。その後、拡散デコーダーがこれらのトークンと最初のフレームを入力として受け取り、予測された運動を動画にレンダリングします。モデルは、複数ステップのワークフローを通じて学習できます:物理言語を作成するためのトークナイザーの学習、動画から真のトークンを抽出、それらのトークンを予測するための推論器の学習、およびロボット工学など特定の分野向けにデコーダーをオプションで適応させるプロセス。

対象ユーザー

このプロジェクトは、ワールドモデル、物理AI、動画生成に取り組んでいる研究者や開発者を対象としています。特に、モーション転送(例:人間からロボット、シミュレーションから現実)や物理的推論に興味がある方々に適しています。

特徴

  • 物理言語:運動の離散的なトークン表現を用いて、推論とレンダリングを分離します。
  • モーション転送:ソース動画の運動を、異なるターゲットオブジェクトや環境(例:エゴからデキストラスロボット)に転送できます。
  • 推論してからレンダリング:運動の物理的予測と最終的なピクセル生成を分離します。
  • ドメイン適応:再構成学習を通じて、特定の物理的ドメインにモデルを適応させるためのツールを備えています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト