GPT-4o 圖像生成系統卡片附錄

OpenAI 已將一項新的圖像生成功能原生整合進入 GPT-4o 全模態架構,使其能夠產生照片級真實感的輸出並進行進階的圖像到圖像轉換。此整合使模型能夠發揮其完整的內部知識庫,生成比先前 DALL·E 3 系列所創建的圖像更具表現力且更實用的圖像。

增強的圖像生成能力

GPT-4o 圖像生成相較於 DALL·E 3 系列提供了數項重要的技術進步,著重於寫實性、靈活性和精確度:

  • Photorealism: 模型能夠生成具有高度照片級真實感品質的圖像。
  • Image-to-Image Transformation: 與之前的版本不同,系統可以將現有圖像作為輸入,根據使用者指令進行轉換。
  • Text Integration: 模型能可靠地將特定文字併入生成的圖像中,遵循關於字體排版和放置的詳細指示。
  • Native Omnimodal Integration: 由於生成功能深度嵌入 GPT-4o 架構中,模型能夠運用其更廣泛的推理和知識來進行圖像創作,從而產生更細膩且富有表現力的輸出。

安全與風險緩解

OpenAI 利用現有的安全基礎設施以及從 DALL·E 和 Sora 部署中獲得的見解來保護新的圖像生成功能。儘管該系統受益於既定的安全協議,但能力的提升也帶來了新的邊際風險。

OpenAI 管理這些風險的方法包括:

  • Applying Lessons from Previous Models: 利用來自 DALL·E 和 Sora 的部署數據與安全經驗。
  • Targeted Risk Assessment: 識別並解決與在全模態模型中原生整合圖像生成功能相關的特定邊際風險。

Sources