ChatGPT Images と GPT Image 1.5 リリース

OpenAI は、新しいフラッグシップ画像生成モデルを搭載した ChatGPT Images の新バージョンをリリースしました。このアップデートにより、生成速度、精密な編集、および指示従従性が大幅に向上し、ユーザーはイテレーション間で一貫した詳細を保ちながら画像を作成および変更できるようになります。

精密な画像編集と保持

GPT Image 1.5 は、アップロードされた画像に対してより信頼性の高い編集を可能にし、リクエストされた場所のみに変更が行われ、照明、構成、人物の外観などの重要な要素が保持されるようにします。この機能により、より信頼性の高い衣装やヘアスタイルの試着、実用的な写真編集、および元の画像の本質を保持した概念的な変換が可能になります。

編集機能

このモデルは、画像内の要素の追加、削除、組み合わせ、ブレンド、転置において優れています。たとえば、ユーザーは異なる画像から複数の被写体を1つのシーンに組み合わせたり、特定の要素のスタイルを変更したり(例:人物をレトロアニメスタイルに変更)することができ、画像の他の部分をそのまま保持します。

創造的な変換

このモデルは、被写体の似姿を保ちながら、特定のテキストとレイアウトの変更を施した映画ポスターに写真を変換するなどの複雑な変換を実行できます。これらの変換は、テキストプロンプトまたは新しい Images 機能のプリセットスタイルを通じてトリガーできます。

指示従従性とテキストレンダリング

初期バージョンと比較して指示従従性が向上し、より複雑なオリジナル構成と要素間の関係の保持が向上しました。さらに、このモデルは濃密かつ小さなテキストのレンダリングにおいて進歩を遂げ、正確なフォーマットと数字を持つ現実的な新聞記事やインフォグラフィックを作成できるようになりました。

新しい専用クリエーションスペース

OpenAI は、ChatGPT サイドバー内に専用の Images エクスペリエンスを導入しました(モバイルアプリと chatgpt.com で利用可能)。このスペースは、以下を通じてクリエイティブな探索を合理化するように設計されています:

  • プリセットフィルターとプロンプト: 定期的に更新される数十のフィルターとトレンドのプロンプトで、インスピレーションをすぐに得られます。
  • 類似アップロード: ユーザーの外観を一度アップロードすれば、毎回新しい写真をアップロードすることなく、今後のクリエーションで再利用できます。
  • 並列生成: 他の画像がまだ生成中でも、ユーザーは新しい画像の生成を続けることができ、待ち時間を短縮できます。

パフォーマンスと API 可用性

画像は以前のバージョンと比較して最大 4 倍高速にレンダリングされます。OpenAI は結果がまだ完璧ではないことを指摘し、多言語サポートや複数の顔などの分野での改善の余地があると述べていますが、このモデルは鮮やかなグラフィックと早すぎるトリミングの回避において明確な進歩を示しています。

API での GPT Image 1.5

開発者は API を通じて GPT Image 1.5 として新しいモデルにアクセスできます。このバージョンは GPT Image 1 よりも強力な画像保持と編集を提供し、ブランド作業、ロゴ作成、および e コマース製品カタログに特に役立ちます。

主な API アップデートは次のとおりです:

  • コスト削減: 画像の入力と出力は、GPT Image 1 と比較して現在 20% 安くなっています。
  • 業界での採用: Wix、Canva、Figma、Shutterstock などの企業はすでにこのモデルを利用しています。

可用性

新しい ChatGPT Images モデルは、すべての ChatGPT ユーザーと API に対して世界中で段階的に提供されています。以前のバージョンの ChatGPT Images は、カスタム GPT として引き続き利用可能です。

Sources