OpenAI GPT-4o 影像生成發布

OpenAI 已直接在 GPT-4o 中引入原生影像生成功能。此整合將影像生成從裝飾性工具轉變為實用工具,能夠進行精確的文字渲染、複雜指令的遵循,以及在對話情境中無縫的多輪細化。

原生多模態與實用性

GPT-4o 的影像生成是以原生多模態模型構建的,意味著它在線上影像與文字的聯合分佈上進行訓練。此方法使模型不僅能理解影像與語言之間的關係,亦能理解影像彼此之間的關聯,從而提升視覺流暢度與情境感知。

與先前專注於超現實或驚艷場景的系統不同,GPT-4o 的設計目標是「實用影像」——如標誌、圖表與資訊圖形等實務視覺,透過共享的語言與符號傳遞精確意涵。

主要技術能力

精確文字渲染

GPT-4o 能將精確的符號與文字與影像融合,使其可用於視覺傳達。模型能渲染特定且詳細的文字——例如包含多項規則與改寫警示的複雜路標——同時保持寫實風格。

多輪生成與一致性

由於影像生成是模型的原生功能,使用者可透過自然對話來細化影像。GPT-4o 在多次迭代中保持一致性,讓主題(例如角色外觀)能在使用者於多輪中實驗並加入細節時,呈現連貫的演變。

進階指令遵循

GPT-4o 在單一提示中可處理的物件數量顯著提升。其他系統通常在 5-8 個物件上掙扎,而 GPT-4o 能管理 10-20 個不同物件,且能更緊密地綁定特徵與關係。

情境內學習與世界知識

  • 情境內學習: 模型能分析使用者上傳的影像,並將這些特定細節整合至新生成的影像,例如使用草圖作為技術圖表的參考。
  • 世界知識: 模型將內部的文字知識與視覺能力結合,使其能解讀複雜的輸入(如 Three.js 程式碼),並產生相應的視覺呈現。

寫實主義與風格多樣性

GPT-4o 能產生多種風格,從帶有閃光眩光的抓拍、狗仔風格攝影,到復古 Polaroid 美感與銳利的現代數位攝影皆可。它能處理複雜的光線、反射與大氣透視,例如描繪一匹馬在海面上奔跑,呈現精確的水花與波紋。

安全性與來源追蹤

OpenAI 為 GPT-4o 影像生成實施了多層安全與透明機制:

  • C2PA 元資料: 所有生成的影像皆包含 C2PA 元資料,以辨識其為 GPT-4o 輸出。
  • 內部搜尋工具: OpenAI 開發了一個利用技術屬性驗證內容是否由其模型生成的工具。
  • 推理式審核: 一個以人類撰寫的安全規範訓練的推理大型語言模型,用於審核輸入文字與輸出影像。
  • 內容封鎖: 模型持續阻止違反內容政策的請求,包括性深偽影像與兒童性虐待資料,並對涉及真人的裸露與血腥暴力施加更嚴格限制。

限制與可用性

OpenAI 承認目前仍有多項限制,包括「裁切幻覺」(長圖如海報在底部被過度裁切)、高綁定問題、精確圖表繪製問題,以及多語言文字渲染的困難。

存取細節:

  • ChatGPT: 作為 Plus、Pro、Team 與 Free 用戶的預設影像生成器提供。企業與教育用戶的存取即將推出。
  • Sora: 已整合至 Sora。
  • DALL·E: 仍可透過專屬的 DALL·E GPT 存取。
  • API: 開發者存取將於 2025 年 3 月 25 日公告後的數週內逐步推出。
  • 效能: 由於細節增多,影像渲染可能需要最多一分鐘。

Sources