yaoyao-jpg/PhiZero

Official implementation of PhiZero: A World Model Built Around Physical Language. Code and checkpoints coming soon.

它解決的問題

PhiZero 是一種用於推理未來物理動態的世界模型。它透過先在離散的「物理語言」中進行推理,再將結果渲染為影片,來解決預測現實世界中物體移動與互動的挑戰。

如何運作

該系統分為兩個主要階段:推理與渲染。一個 物理語言推理器(基於 Qwen3-VL)根據第一幀和文字說明,預測一組 256 個離散的運動標記(物理語言)。接著,一個 擴散解碼器 會將這些標記與第一幀結合,將預測的運動渲染成影片。該模型可透過多步驟工作流程進行訓練:訓練分詞器以建立物理語言、從影片中提取真實標記、訓練推理器以預測這些標記,並可選地針對特定領域(如機器人)適配解碼器。

適用對象

本專案針對致力於世界模型、物理人工智慧與影片生成的研究人員與開發者,特別是對運動轉移(例如人體到機器人或模擬到現實)與物理推理感興趣者。

特色

  • 物理語言:使用離散的運動標記表示法,將推理與渲染分離。
  • 運動轉移:支援將來源影片的運動轉移到不同目標物體或環境(例如自我視角到靈巧機器人)。
  • 先推理後渲染:將物理運動預測與最終像素生成分離。
  • 領域適應:提供工具,透過重建訓練將模型適應至特定物理領域。

相關

  • 專案
  • 專案
  • 專案
  • 專案