OpenAI Sora:视频生成模型作为世界模拟器
OpenAI 推出了 Sora,这是一种能够生成长达一分钟的高保真视频的扩散 Transformer 模型。此项进展表明,扩展视频生成模型规模是构建通用物理世界模拟器的有前景的路径。
通过时空补丁实现统一视觉表示
Sora 使用一种称为“补丁”的统一视觉数据表示,使模型能够在时长、分辨率和宽高比各不相同的视频和图像上进行训练。这一方法受到大型语言模型(LLM)中使用的标记化的启发,用以统一多样的文本模态。
视频压缩网络
为了实现大规模训练,OpenAI 使用一个网络来降低原始视频的维度,输出在空间和时间上均被压缩的潜在表示。随后使用相应的解码器模型将这些生成的潜在表示映射回像素空间。
时空潜在补丁
压缩后,视频被分解为一系列时空补丁,作为 Transformer 的标记。由于图像被视为仅有单帧的视频,同样的基于补丁的方案同样适用于两者。在推理时,通过将随机初始化的补丁排列成所需大小的网格来控制生成视频的尺寸。
为视频扩展扩散 Transformer 的规模
Sora 是一种扩散 Transformer。它在条件于文本提示等信息的情况下,学习从输入的噪声补丁预测原始的“干净”补丁。OpenAI 发现,扩散 Transformer 在视频生成方面能够有效扩展,随着训练算力的提升,样本质量显著提升。
原生宽高比训练
不同于之前将数据裁剪或调整到标准尺寸(例如 256×256)的模型,Sora 在原始尺寸的数据上进行训练。这带来了两个主要好处:
- 采样灵活性: Sora 能原生生成宽屏(1920×1080p)、竖屏(1080×1920)以及中间宽高比的视频。
- 构图提升: 在原生宽高比上训练可降低主体被部分裁剪出画面的可能性,从而实现更好的整体取景和构图。
语言理解与提示
为提升文本保真度和视频质量,OpenAI 采用了 DALL·E 3 的重新标注技术。训练了一个高度描述性的标注模型,为训练集生成详细的文本说明。此外,GPT 被用于将简短的用户提示扩展为视频模型所需的更长、更详细的说明。
多模态提示
除了文本到视频,Sora 还支持多种其他输入模态:
- 图像到视频: Sora 可以使用图像和文本提示为静态图像(包括来自 DALL·E 2 和 3 的图像)生成动画。
- 视频扩展: 该模型能够在时间上向前或向后延伸已有视频,实现无缝的无限循环。
- 视频到视频编辑: 通过类似 SDEdit 的技术,Sora 能在零样本的情况下改变输入视频的风格和环境。
- 视频插值: Sora 可以通过在两个不同输入视频之间逐渐插值,创建无缝的过渡。
- 图像生成: 通过将补丁排列在空间网格中且时间跨度为单帧,Sora 能生成最高达 2048×2048 分辨率的图像。
新出现的模拟能力
模型规模的扩大催生了能够让 Sora 在没有显式 3D 或对象归纳偏置的情况下模拟物理和数字世界各方面的能力。
- 3D 一致性: 即使在动态摄像机运动时,Sora 仍能保持人物和场景元素在三维空间中的一致运动。
- 长程连贯性: 模型能够在对象、动物或人物被遮挡或离开画面后仍保持其存在,并且在单个样本的多个镜头中保持角色外观的一致性。
- 物理交互: Sora 能模拟简单的状态变化,例如画家在画布上留下持久的笔触,或人物在汉堡上留下咬痕。
- 数字世界模拟: 在提示下,Sora 能高保真地模拟人工过程,例如渲染《Minecraft》的世界及其动态。
当前局限性
尽管出现了这些新能力,Sora 仍未成为完美的模拟器。它在处理复杂交互的物理现象(如玻璃碎裂)时表现不足,且在进食时并不总能正确改变对象状态。此外,部分长时长样本会出现不连贯或对象自发出现的情况。