OpenAI Sora 2 安全フレームワーク

OpenAI は、Sora 2 と Sora アプリに対して、高忠実度の動画および音声生成に伴うリスクを管理する包括的な安全フレームワークを実装しました。このフレームワークは、出所シグナル、同意ベースの類似性コントロール、層状のコンテンツフィルタリングの組み合わせに依存し、悪用を防止しユーザーの身元を保護します。

AI コンテンツの出所と識別

Sora 2 は、AI 生成コンテンツが可視および不可視のシグナルの両方で識別できることを保証します。生成されたすべての動画には、業界標準の署名である C2PA メタデータと不可視の出所シグナルが含まれます。OpenAI は、内部の逆画像検索および音声検索ツールを維持し、動画を高精度で Sora プラットフォームに遡って追跡します。

さらに、多くの出力には、作成者の名前を含む動的に動くウォーターマークが付与され、コンテンツの出所を可視的に示します。

類似性と同意管理

OpenAI は、生成動画における実在人物の類似性を取り扱うための特定のメカニズムを導入しており、作成方法別に分類されています。

実在人物を用いた画像から動画への変換

ユーザーは家族や友人の写真をアップロードして動画を作成できますが、必要な同意と権利を有していることを宣言する必要があります。これらの生成は、Sora Characters に適用されるものよりもさらに厳しい安全ガードレールの対象となります。子供や若く見える人物を含むコンテンツも同様の保護が適用され、さらに厳格なモデレーションが行われます。

Characters を通じた同意ベースの類似性

"Characters" 機能により、ユーザーは自分の外観と声の類似性を管理できます。主な保護は以下の通りです:

  • アクセス制御: ユーザー自身が自分のキャラクターを誰が使用できるかを決定し、いつでもアクセスを取り消すことができます。
  • 公人制限: 公人の描写は、対象が Characters 機能を使用している場合を除きブロックされます。
  • 可視性: ユーザーは自分のキャラクターが登場するすべての動画(他者が作成したドラフトを含む)を見ることができ、レビューや削除が可能です。
  • カスタマイズ可能なガードレール: ユーザーは外観の大幅な変更を防ぎ、恥ずかしい状況を回避し、アイデンティティの一貫性を保つための厳格なガードレールを有効にできます。

ティーンユーザー向け保護策

Sora には、若年ユーザー向けに年齢に適した体験を保証するための専門的な安全策が組み込まれています:

  • コンテンツフィルタリング: 大人向けの出力は制限され、ティーンアカウント向けに有害または年齢に不適切な素材がフィードから除去されます。
  • ソーシャル制限: ティーンのプロフィールは大人に推奨されず、大人がティーンにメッセージを開始することは禁止されています。
  • ペアレンタルコントロール: ChatGPT を通じて、保護者はダイレクトメッセージを管理し、子供向けにパーソナライズされていないフィードを選択できます。
  • 使用制限: デフォルトで、ティーンは Sora アプリ内での連続スクロールに制限があります。

コンテンツフィルタリングと危害防止

Sora は、プロンプト段階と出力段階の両方で安全でないコンテンツをブロックするために層状の防御を採用しています。ガードレールは、性的素材、テロリスト宣伝、自己傷害の助長を対象に、動画フレームと音声文字起こしをスキャンします。

生成フェーズを超えて、全フィードコンテンツは OpenAI の Global Usage Policies に照らして自動システムでスキャンされ、重大な影響を及ぼす危害については人間によるレビューが補完されます。OpenAI は、Sora 2 における動きと音声のリアリズムが向上したことから、画像生成に比してポリシーが強化されたと述べています。

音声と音楽の保護策

音声生成に伴うリスクに対処するため、Sora は以下の保護を実装しています:

  • 音声スキャン: 生成された音声の文字起こしは自動的にポリシー違反がないかスキャンされます。
  • 音楽保護: システムは在籍アーティストや既存作品を模倣する音楽生成の試みをブロックします。
  • 削除要請: OpenAI は、Sora の出力が自分の作品を侵害していると考えるクリエイターからの削除要請に応じます。

ユーザーコントロールと救済手段

ユーザーはアプリ内でのコンテンツとソーシャルインタラクションを管理できます:

  • 共有コントロール: ユーザーが明示的に選択した場合にのみ、動画がフィードに共有されます。
  • 通報とブロック: すべての動画、プロフィール、ダイレクトメッセージ、コメント、キャラクターは、悪用について通報できます。
  • ブロック: ユーザーはアカウントをブロックし、他者が自分のプロフィールを見ること、キャラクターにアクセスすること、ダイレクトメッセージを送ることを防げます。

Sources