ChatGPT Images 2.0 リリース

OpenAIはChatGPT Images 2.0を導入しました。これは画像生成システムの大幅なアップデートで、精度の向上、洗練されたスタイル制御、そして多数のグローバル言語にわたる複雑なテキストのレンダリング能力を提供します。このリリースにより、ツールは単なる画像ジェネレーターから、研究・推論から洗練された最終ビジュアルまで、エンドツーエンドの資産作成が可能なビジュアル思考パートナーへと変貌します。

精度向上と技術的制御

ChatGPT Images 2.0は、複雑なプロンプトに従い構造的制御を維持する精度が大幅に向上しました。モデルは現在、複雑なレイアウトや、余白・トリム・安全余白線を含むプロフェッショナルな印刷制作ガイドなど、特定の技術要件にも対応できます。

主な技術的改善点は次のとおりです:

  • 柔軟なアスペクト比:システムは、広大なパノラマ都市シーンから縦長のモバイル画面、標準的な正方形画像まで、幅広いフォーマットをサポートします。
  • マルチシーンの連続性:モデルは、複数のパネルにわたってキャラクターと物語の一貫性を保つ能力を示し、統合されたコミックページやストーリーテリングシーケンスの生成で確認できます。
  • 複雑なレイアウト:見出し、注釈、地図、統計情報を含む雑誌スタイルのインフォグラフィックスプレッドなど、構造化された編集コンテンツを生成できます。

多言語テキストレンダリングとグローバルスクリプト

バージョン2.0の最も顕著な進歩の一つは、数多くのグローバル言語とスクリプトで読みやすく正確なテキストをレンダリングできるようになったことです。これにより、非ラテン文字に関する従来の制限が取り除かれ、さまざまな地域向けの市場対応資産を作成できるようになります。

サポートされているスクリプトと例示された言語は次のとおりです:

  • 東アジアのスクリプト:日本語、中国語、韓国語(ホスピタリティ向けパンフレット用の高忠実度韓国語タイポグラフィを含む)。
  • 南アジアのスクリプト:ヒンディー語とベンガル語。
  • その他のグローバルスクリプト:アラビア語、デーヴァナーガリー文字、キリル文字、ギリシャ文字。

スタイルの洗練とリアリズム

ChatGPT Images 2.0は、視覚語彙を拡張し、より広範なスタイルスペクトルを高忠実度でカバーします。モデルはハイパーリアリスティックな写真と高度にスタイライズされたアートの間を構造的整合性を失うことなくシフトできます。

注目すべきスタイル的能力は次のとおりです:

  • 写真的リアリズム:モデルはシネマティックなスナップポートレート、夜間フラッシュ撮影(フィルムカメラのスナップショットをシミュレート)およびドキュメンタリースタイルの35mm白黒写真を生成できます。
  • イラストスタイル:様々な漫画スタイル(少年漫画・青年漫画を含む)、インディーコミック、子供向け絵本イラストに高い熟練度を持ちます。
  • グラフィックデザイン:大胆なタイポグラフィと幾何学的形状を用いたバウハウス風ポスター、アールデコデザイン、モダニスト編集レイアウトを作成できます。

ビジュアル推論とインテリジェンス

美的改善に加えて、ChatGPT Images 2.0は「思考モード」を統合し、ビジュアル思考パートナーとして機能します。これにより、モデルはリクエストを論理的に検討し、ソース素材を洗練されたビジュアルへと変換できます。

この統合されたインテリジェンスの例は次のとおりです:

  • 教育的可視化:複雑な数学的証明(例:カントールの対角線証明)や抽象的情報を明確なビジュアル説明に変換する教育的レイアウトを生成します。
  • 研究翻訳:密度の高い研究論文(例:元のGPT-1論文)を、アクセスしやすいカンファレンススタイルのインフォグラフィックに変換します。
  • 文脈的正確性:最新の知識と検索機能を活用し、現在の実世界情報に基づいた正確な製品モックアップを生成します。

Sources