ChatGPT Images 2.5 發佈說明

OpenAI 推出了 ChatGPT Images 2.5,這是一款尖端的圖像生成模型,旨在提供更清晰的細節、更快的生成速度以及更精確的編輯功能。此次更新重點在於提高參考照片的保真度、與 Images 2.0 相比降低高達 50% 的延遲,並引入新的使用者介面工具,讓創作者對最終輸出結果擁有更多控制權。

增強的圖像保真度與參考引導工作流

Images 2.5 提升了將參考照片中的主體轉換到不同場景、視覺風格和構圖的能力,同時保留主體可辨識的特徵。這確保了光影和紋理感覺更加自然,且獨特的特徵能更可靠地傳遞。

對於使用 API 的開發者而言,這種提高的保真度使參考引導的工作流變得更加可靠,允許圖像的變體能始終錨定在原始素材上。

精準度與多輪編輯

Images 2.5 專為更具針對性的編輯而設計,允許使用者修改特定元素——例如背景或單一產品——而不改變圖像的其他部分。這種精準度對於在專業工作流中維持品牌風格和構圖至關重要。

在多輪對話中的一致性也得到了改進。該模型現在在多次迭代中能更可靠地遵循編輯指令,確保先前的更改得以保留,且圖像品質不會隨著對話的進行而下降。

新的創意工具:Sketch 與模板

OpenAI 推出了幾項產品功能,以增強 ChatGPT 中的創意過程:

  • Sketch: 使用者可以直接在 ChatGPT 中繪製粗略的佈局或塗鴉(透過 @Sketch 指令)作為視覺指南,供模型生成最終圖像。
  • Templates: 針對熱門創意需求預定義的格式,例如「Poster」或「Merch」,讓使用者可以從結構化的提示詞開始,而非從空白畫布開始。
  • Prompt Sharing: 使用者現在可以分享用於生成圖像的特定提示詞,以便他人使用自己的照片和細節來複製該想法。
  • Direct Image Commenting: 使用者可以直接在圖像上放置評論,以進行更具針對性的編輯請求。

API 提供項目:Flare 與 Sunburst

對於開發者,OpenAI 在 API 中發佈了兩個不同的模型:

  • GPT-Image-2.5 Flare: 大多數應用程式的預設選擇,提供與 ChatGPT 版本相同的品質和速度提升,且延遲比 GPT-Image-2 低 50%。
  • GPT-Image-2.5 Sunburst: 專為需要極高精準度和對編輯進行更嚴格控制的高端視覺工作流而設計,儘管其生成時間較長。

社群觀察與技術觀察

雖然 OpenAI 強調了這些工具的實用性,但社群已注意到幾項技術和實際應用上的觀察:

效能增益

開發者報告了顯著的延遲降低。一位使用者指出,使用 GPT-Image-2 時平均延遲約為 104 秒,而使用 2.5 版本時降至 35 到 40 秒之間。

保真度與偽影

儘價於有所改進,但部分使用者指出,在複雜的合成照片中,微小的細節——例如牙齒結構或手指數量——仍會出現 AI 偽影。

實際效用

社群對於使用案例的看法存在顯著分歧。雖然有些使用者覺得該工具對室內設計和 UI 構思很有效,但其他人則認為展示的範例(例如排列花卉或設計紋身)過於瑣碎或僅具「願景性」,而非解決專業生產問題,如建立 sprite sheets 或圖表資訊圖。

社會影響

Hacker News 上的討論突顯了對商業招牌中「AI slop」氾濫的擔憂,以及在 Facebook Marketplace 等平台上可能產生的誤導性,因為 AI 增強的圖像可能會誤導使用者對二手物品實際狀況的判斷。

"The Facebook Marketplace experience for used items has depreciated considerably with the widespread adoption of LLMs... it's becoming a trickier landscape to navigate to find what you're looking for."

安全性與可用性

OpenAI 持續使用 C2PA 元數據和不可見浮水印來識別 AI 生成的內容。該模型目前已向所有層級的桌面、行動裝置和網頁版的 ChatGPT、ChatGPT Work 與 Codex 使用者開放。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch