OpenAI Sora:視訊生成模型作為世界模擬器

OpenAI 推出了 Sora,一種能夠生成長達一分鐘高保真視訊的 diffusion transformer 模型。此項發展表明,擴大視訊生成模型的規模是構建通用物理世界模擬器的有前景的路徑。

透過時空補丁的統一視覺表示

Sora 使用稱為「patches」的統一視覺資料表示,讓模型能夠在不同長度、解析度與長寬比的影片與圖像上進行訓練。此方法受到大型語言模型(LLM)中 token 化的啟發,用以統一多樣的文字模態。

影片壓縮網路

為了實現大規模訓練,OpenAI 使用一個網路將原始影片的維度降低,輸出在空間與時間上皆被壓縮的潛在表示。隨後使用相應的解碼器模型將這些生成的潛在向量映射回像素空間。

時空潛在補丁

壓縮後,影片被分解為一系列作為 transformer token 的時空補丁。由於圖像被視為單幀影片,同樣的基於補丁的方案同時適用於兩者。推論時,透過將隨機初始化的補丁排列成所需大小的格子,即可控制生成影片的尺寸。

為影片擴展 Diffusion Transformer

Sora 是一個 diffusion transformer。它在條件資訊(如文字提示)下,學習從輸入的噪聲補丁預測原始的「乾淨」補丁。OpenAI 發現 diffusion transformer 在影片生成上具備良好的擴展性,隨著訓練算力的提升,樣本品質顯著改善。

原生長寬比訓練

與先前將資料裁切或調整至標準尺寸(例如 256x256)的模型不同,Sora 以原生尺寸的資料進行訓練。這帶來兩大主要好處:

  • 抽樣彈性: Sora 能原生生成寬螢幕(1920x1080p)、直向(1080x1920)以及中間比例的影片。
  • 構圖提升: 以原生長寬比訓練可降低主體被部分裁切的機率,從而提升整體取景與構圖品質。

語言理解與提示

為提升文字忠實度與影片品質,OpenAI 採用了 DALL·E 3 的重新標註技術。訓練了一個高度描述性的 captioner 模型,以產生訓練集的詳細文字說明。此外,GPT 被用來將簡短的使用者提示擴展為影片模型所需的更長、更詳盡的說明。

多模態提示

除了文字轉影片外,Sora 還支援多種其他輸入模態:

  • 圖像轉影片: Sora 可使用圖像與文字提示為靜態圖像(包括來自 DALL·E 2 與 3 的圖像)製作動畫。
  • 影片延伸: 該模型能在時間上向前或向後延伸現有影片,實現無縫的無限循環。
  • 影片對影片編輯: 透過類似 SDEdit 的技術,Sora 能以零樣本的方式改變輸入影片的風格與環境。
  • 影片插值: Sora 可透過逐漸在兩段不同輸入影片之間插值,創造無縫過渡。
  • 圖像生成: 透過將補丁排列成空間格子且時間延伸為單幀,Sora 能生成最高 2048x2048 解析度的圖像。

新興的模擬能力

模型的擴展催生了讓 Sora 能在未具備明確 3D 或物件歸納偏差的情況下,模擬物理與數位世界各方面的能力。

  • 3D 一致性: Sora 能在動態相機運動下,保持人物與場景元素在三維空間中的一致移動。
  • 長距離連貫性: 該模型即使在物體、動物或人物被遮擋或離開畫面時,也能持續存在,且能在單一樣本的多個鏡頭中保持角色外觀的一致性。
  • 物理交互: Sora 能模擬簡單的狀態變化,例如畫家在畫布上留下持續的筆觸,或人物在漢堡上留下咬痕。
  • 數位世界模擬: Sora 能在提示下以高保真度模擬人工過程,例如渲染 Minecraft 的世界與動態。

目前的限制

儘管具備這些新興能力,Sora 仍未成為完美的模擬器。它在處理複雜交互的物理現象(如玻璃碎裂)時仍有困難,且在吃東西時並不總是正確改變物體狀態。此外,部分長時間樣本會出現不連貫或物體自發出現的情況。

Sources