OpenAI Sora: ビデオ生成モデルを世界シミュレータとして

OpenAIは、最大1分間の高忠実度ビデオを生成できる拡散トランスフォーマーモデルであるSoraを発表しました。この開発は、ビデオ生成モデルのスケーリングが、物理的な世界の汎用シミュレータを構築する有望な道であることを示唆しています。

時空パッチによる統一ビジュアル表現

Soraは「パッチ」と呼ばれる統一されたビジュアルデータ表現を利用し、異なる長さ、解像度、アスペクト比のビデオや画像でモデルを訓練できるようにします。この手法は、さまざまなテキストモダリティを統一するために大規模言語モデル(LLM)で使用されるトークン化にヒントを得ています。

ビデオ圧縮ネットワーク

大規模な訓練を可能にするため、OpenAIは生ビデオの次元を削減し、空間的および時間的に圧縮された潜在表現を出力するネットワークを使用します。その後、対応するデコーダーモデルを用いて、生成された潜在表現をピクセル空間にマッピングします。

時空潜在パッチ

圧縮されたビデオは、トランスフォーマーのトークンとして機能する時空パッチのシーケンスに分解されます。画像は単一フレームのビデオとして扱われるため、同じパッチベースの方式が画像にも適用されます。推論時には、ランダムに初期化されたパッチを希望のサイズのグリッドに配置することで、生成ビデオのサイズが制御されます。

ビデオ向け拡散トランスフォーマーのスケーリング

Soraは拡散トランスフォーマーです。テキストプロンプトなどの情報を条件に、入力されたノイズパッチから元の「クリーン」パッチを予測するように訓練されます。OpenAIは、拡散トランスフォーマーがビデオ生成において効果的にスケールし、訓練計算量が増加するにつれてサンプル品質が顕著に向上することを確認しました。

ネイティブアスペクト比での訓練

従来のモデルがデータを標準サイズ(例:256x256)にトリミングまたはリサイズしていたのとは異なり、Soraはデータのネイティブサイズで訓練されます。これにより主に2つの利点があります:

  • サンプリングの柔軟性: Soraはワイドスクリーン(1920x1080p)、縦長(1080x1920)、および中間のアスペクト比をネイティブに生成できます。
  • 構図の向上: ネイティブアスペクト比で訓練することで、被写体がフレームから部分的に切り取られる可能性が減少し、全体的なフレーミングと構図が改善されます。

言語理解とプロンプト

テキストの忠実度とビデオ品質を向上させるため、OpenAIはDALL·E 3の再キャプション手法を適用しました。高度に記述的なキャプショナーモデルを訓練し、訓練セットに対して詳細なテキストキャプションを生成させました。さらに、GPTを用いて短いユーザープロンプトをビデオモデルが必要とする長く詳細なキャプションに展開します。

マルチモーダルプロンプト

テキストからビデオへの変換に加えて、Soraは他のいくつかの入力モダリティをサポートします:

  • Image-to-Video: Soraは静止画像(DALL·E 2や3のものも含む)とテキストプロンプトを使用してアニメーション化できます。
  • Video Extension: このモデルは既存のビデオを時間的に前方・後方に拡張でき、シームレスな無限ループの作成が可能です。
  • Video-to-Video Editing: SDEditのような手法を用いて、Soraは入力ビデオのスタイルや環境をゼロショットで変換できます。
  • Video Interpolation: Soraは2つの異なる入力ビデオ間を徐々に補間することで、シームレスな遷移を作り出せます。
  • Image Generation: パッチを時間的に1フレームの空間グリッドに配置することで、Soraは最大2048x2048の解像度の画像を生成できます。

出現するシミュレーション能力

モデルのスケーリングにより、Soraが3Dやオブジェクトに対する明示的な帰納バイアスなしで、物理的・デジタル的世界の側面をシミュレートできる能力が出現しました。

  • 3D Consistency: Soraは、動的なカメラモーション中でも、人やシーン要素の3D空間での一貫した動きを維持します。
  • Long-range Coherence: モデルは、オブジェクトや動物、人が遮蔽されたりフレームから外れたりしてもそれらを持続させ、単一サンプル内の複数ショットにわたってキャラクターの外観を維持できます。
  • Physical Interaction: Soraは、画家がキャンバスに永続的な筆跡を残す、あるいは人がバーガーに噛み跡を残すといった単純な状態変化をシミュレートできます。
  • Digital World Simulation: Soraは、プロンプトに応じてMinecraftの世界とダイナミクスを高忠実度でレンダリングするなど、人工的なプロセスをシミュレートできます。

現在の制限事項

これらの出現した能力にもかかわらず、Soraはまだ完璧なシミュレータではありません。ガラスの破砕といった複雑な相互作用の物理を扱うのが苦手で、食べ物を食べる際にオブジェクトの状態変化が正しく反映されないことがあります。また、長時間のサンプルの中には一貫性が欠けたり、オブジェクトが自発的に出現したりするものがあります。

Sources