OpenAI GPT-4o 画像生成リリース

OpenAI は GPT-4o に直接ネイティブな画像生成機能を導入しました。この統合により、画像生成は装飾的なツールから、正確なテキスト描画、複雑な指示の実行、会話コンテキスト内でのシームレスなマルチターンリファインメントが可能な実用的ユーティリティへと変わります。

ネイティブなマルチモーダリティとユーティリティ

GPT-4o の画像生成は、オンライン画像とテキストの共同分布でトレーニングされた、ネイティブにマルチモーダルなモデルとして構築されています。このアプローチにより、モデルは画像が言語とどのように関係するかだけでなく、画像同士がどのように関係するかも理解でき、視覚的流暢さとコンテキスト認識が向上します。

従来のシステムが超現実的または息を呑むようなシーンに焦点を当てていたのに対し、GPT-4o は「作業用画像」— ロゴ、図、インフォグラフィックなど、共有された言語とシンボルを通じて正確な意味を伝える実用的なビジュアル— を対象に設計されています。

主な技術的機能

正確なテキストレンダリング

GPT-4o は正確なシンボルとテキストを画像と組み合わせることができ、視覚的コミュニケーションに利用できます。モデルは、複数の規則やパラフレーズされた警告を含む複雑な道路標識など、具体的で詳細なテキストをフォトリアリスティックなスタイルで描画できます。

マルチターン生成と一貫性

画像生成がモデルにネイティブに組み込まれているため、ユーザーは自然な会話を通じて画像をリファインできます。GPT-4o は複数のイテレーションにわたって一貫性を保ち、ユーザーが数ターンにわたって詳細を追加・実験することで、対象(例:キャラクターの外見)の統合的な進化を可能にします。

高度な指示遵守

GPT-4o は単一のプロンプトで扱えるオブジェクト数が大幅に増加しています。他のシステムが 5〜8 個で苦戦するのに対し、GPT-4o は 10〜20 個の異なるオブジェクトを、属性と関係性をより緊密に結びつけて管理できます。

コンテキスト内学習と世界知識

  • In-Context Learning: モデルはユーザーがアップロードした画像を分析し、特定のディテールを新しい生成に統合できます。例えば、スケッチを技術図の参照として使用することができます。
  • World Knowledge: モデルは内部のテキストベースの知識と視覚能力を結びつけ、Three.js コードのような複雑な入力を解釈し、対応するビジュアル表現を生成できます。

フォトリアリズムとスタイルの多様性

GPT-4o は、フラッシュグレアのあるパパラッチ風写真からヴィンテージ Polaroid の美学、シャープでモダンなデジタル写真まで、幅広いスタイルを生成できます。複雑な照明、反射、遠近法の表現も扱え、例えば馬が海面を駆け抜ける様子を正確な水しぶきと波紋で描写できます。

安全性と出所情報

OpenAI は GPT-4o の画像生成に対して複数の安全層と透明性を実装しています。

  • C2PA Metadata: 生成されたすべての画像には、GPT-4o の出力であることを示す C2PA メタデータが含まれます。
  • Internal Search Tool: OpenAI は、技術的属性を使用してコンテンツが自社モデルによって生成されたかどうかを検証するツールを開発しました。
  • Reasoning-Based Moderation: 人間が作成した安全仕様で訓練された推論 LLM が、入力テキストと出力画像の両方をモデレートするために使用されます。
  • Content Blocking: モデルは、性的ディープフェイクや児童性的虐待素材を含むコンテンツポリシー違反のリクエストを引き続きブロックし、実在人物に関わるヌードや過激な暴力に対してはさらに厳しい制限を設けています。

制限事項と利用可能性

OpenAI は、現在のいくつかの制限事項を認めています。たとえば「クロッピング幻覚」(ポスターのような長い画像が下部で過度に切り取られる)や高いバインディング問題、正確なグラフ描画の課題、多言語テキストレンダリングの困難などです。

アクセス詳細:

  • ChatGPT: Plus、Pro、Team、Free ユーザー向けのデフォルト画像生成器として利用可能です。Enterprise と Edu ユーザー向けのアクセスは近日中に提供予定です。
  • Sora: Sora に統合されています。
  • DALL·E: 専用の DALL·E GPT を通じて引き続き利用可能です。
  • API: 開発者向けアクセスは、2025年3月25日の発表後数週間で順次展開されます。
  • Performance: 詳細度が増したため、画像の生成に最大で1分かかることがあります。

Sources