OpenAI Sora 2 リリース

OpenAI は、より正確な世界シミュレータとして機能することを目的としたフラッグシップの動画・音声生成モデル Sora 2 を発表しました。Sora 2 は、物理的リアリズムの向上、制御性の強化、そして同期した対話と効果音の統合により、前バージョンを上回ります。

高度な世界シミュレーションと物理的精度

Sora 2 は、物理法則をより忠実に守るよう設計されており、プロンプトを満たすためにオブジェクトが変形したりテレポートしたりする「過度な楽観主義」を以前の動画モデルで見られた問題を減らします。モデルは、パドルボードでのバックフリップ中の浮力や剛性、あるいはミスショット後のバスケットボールがバックボードから跳ね返る様子など、複雑なダイナミクスを正確にシミュレートできるようになりました。

OpenAI はこの進歩を「動画における GPT‑3.5 の瞬間」と表現し、元の Sora モデルの基本的なオブジェクト永続性から、失敗や現実的な物理的相互作用をモデル化できるシステムへと進化したと述べています。この能力は、物理世界を深く理解する AI システムを構築する上で重要なステップと見なされています。

マルチモーダル機能と制御性

Sora 2 は、以下の複数の次元で生成能力を拡張しています:

  • 統合オーディオ: 高いリアリズムで背景音景、音声、効果音を生成します。
  • 制御性の向上: 複数ショットにわたる複雑な指示に従いながら、一貫した世界状態を維持できます。
  • スタイルの多様性: シネマティック、リアリスティック、アニメといったスタイルに優れています。
  • 実世界の注入: 参照動画を提供することで、実在の人物、動物、物体を生成環境に挿入でき、外観や声を正確に再現します。

Sora ソーシャルアプリと「キャラクター」

Sora 2 を展開するために、OpenAI は iOS 向けのソーシャルアプリ "Sora" をリリースします。このアプリの中心機能は「キャラクター」で、ユーザーは一度の動画と音声の録画で自分や友人のデジタル似顔絵を作成できます。作成したキャラクターは、任意の Sora 生成シーンに高忠実度で配置可能です。

アプリは消費より創作を優先する設計で、自然言語で指示できるレコメンダーアルゴリズムによるカスタマイズ可能なフィードを備えています。ユーザーは LLM ベースの指示や定期的なウェルビーイング投票でフィードを制御できます。

安全性と責任のフレームワーク

OpenAI は、生成動画とソーシャルメディアに伴うリスクに対処するため、以下の保護策を実装しています:

  • 肖像権コントロール: ユーザーは自分のキャラクターに対してエンドツーエンドの管理権を保持し、アクセスの取り消しや自分の肖像が含まれる動画の削除が可能です。
  • ティーン保護: アプリはフィード内でティーンが閲覧できる生成数にデフォルトで上限を設け、キャラクター権限を厳格化し、ChatGPT を通じた保護者コントロールを提供します。
  • コンテンツモデレーション: 自動安全スタックに加えて、いじめや有害コンテンツをレビューするために人間モデレーションチームを拡大しています。
  • 収益化: OpenAI は、計算リソース需要が高い時期に追加動画生成の有料オプションを提供することに限定し、フィード滞在時間を最適化するようなモデルの導入は明示的に回避しています。

利用可能性とアクセス

Sora 2 は、米国とカナダを対象に招待制で展開されます。アクセスは Sora iOS アプリと sora.com を通じて提供されます。

  • 無料ティア: 初期は計算リソースの制約内で寛大な上限を設けて無料で利用可能です。
  • Sora 2 Pro: ChatGPT Pro ユーザー向けに、sora.com および将来的にはアプリ内で利用できる実験的で高品質なモデルです。
  • API アクセス: 将来的に Sora 2 を API で提供する計画があります。既存ユーザー向けには Sora 1 Turbo が引き続き利用可能です。

Sources