yaoyao-jpg/PhiZero

Official implementation of PhiZero: A World Model Built Around Physical Language. Code and checkpoints coming soon.

What it solves

PhiZero 是一款旨在对未来物理动力学进行推理的世界模型。它通过首先在离散的“Physical Language”中进行推理,然后将结果渲染为视频,从而解决了预测现实世界中物体如何移动和交互的挑战。

How it works

该系统在两个主要阶段运行:推理和渲染。一个 Physical Language Reasoner(基于 Qwen3-VL)根据第一帧和文本说明预测一系列 256 个离散运动令牌(Physical Language)。随后,一个 Diffusion Decoder 获取这些令牌和第一帧,将预测的运动渲染成视频。该模型可以通过多步工作流进行训练:训练一个 tokenizer 来创建 Physical Language,从视频中提取 ground truth 令牌,训练 reasoner 来预测这些令牌,并可选择性地为机器人技术等特定领域调整 decoder。

Who it’s for

该项目面向从事世界模型、物理 AI 和视频生成的研究人员和开发人员,特别是那些对运动迁移(例如,人到机器人或 sim-to-real)和物理推理感兴趣的人员。

Highlights

  • Physical Language: 使用运动的离散令牌化表示,将推理与渲染分离。
  • Motion Transfer: 支持将运动从源视频迁移到不同的目标对象或环境(例如,ego-to-dexterous robot)。
  • Reason-then-Render: 将运动的物理预测与最终的像素生成解耦。
  • Domain Adaptation: 包括通过重构训练将模型适配到特定物理领域的工具。

相关

  • 项目
  • 项目
  • 项目
  • 项目