ChatGPT Images 2.0 版本發布
OpenAI 推出了 ChatGPT Images 2.0,這是其影像生成系統的重大更新,提供更高的精確度、精緻的風格控制,以及在多種全球語言中渲染複雜文字的能力。此版本將工具從單純的影像生成器轉變為視覺思考夥伴,能夠完成從研究與推理到精緻最終視覺的端到端資產創作。
加強的精確度與技術控制
ChatGPT Images 2.0 在遵循複雜提示與維持結構控制方面提供了顯著更高的準確度。模型現在能處理錯綜複雜的版面配置與特定技術需求,例如包含出血、裁切與安全邊距線的專業印刷製作指南。
- 彈性長寬比:系統支援多種格式,從寬闊的全景城市景觀到垂直的行動螢幕以及標準方形影像。
- 多場景連續性:模型展現了在多個畫格中保持角色與敘事一致性的能力,可見於生成連貫的漫畫頁面與敘事序列。
- 複雜版面:它能產生結構化的編輯內容,包括具標題、說明框、地圖與統計資料的雜誌風格資訊圖版面。
多語言文字渲染與全球文字系統
版本 2.0 最顯著的進步之一是能在眾多全球語言與文字系統中渲染可讀且精確的文字。這消除了先前對非拉丁字元的限制,並允許為多元地區製作可直接投入市場的資產。
- 東亞文字系:日文、中文與韓文(包括用於接待手冊的高保真韓文字體)。
- 南亞文字系:印地語與孟加拉語。
- 其他全球文字系:阿拉伯文、天城文、斯拉夫文(西里爾字母)與希臘文。
風格精緻與寫實
ChatGPT Images 2.0 擴展了視覺詞彙,涵蓋更廣泛的風格光譜且提升了真實度。模型能在超寫實攝影與高度風格化藝術之間切換,且不會失去結構完整性。
- 攝影寫實:模型能產生電影感的抓拍肖像、夜間閃光攝影(模擬膠卷相機快照)以及紀實風格的 35mm 黑白攝影。
- 插畫風格:在各種漫畫風格(包括少年與青年漫畫)、獨立漫畫與兒童書籍插畫方面具備高度熟練度。
- 平面設計:能以大膽的排版與幾何形態創作受包浩斯啟發的海報、裝飾藝術風格設計以及現代主義的編輯版面。
視覺推理與智慧
除了美學提升外,ChatGPT Images 2.0 整合了「思考模式」以充當視覺思考夥伴。這使模型能針對請求進行推理,並將來源素材轉化為精緻的視覺成果。
- 教育視覺化:生成複雜的數學證明(例如 Cantor 的對角線證明)與教學版面,將抽象資訊轉化為清晰的視覺說明。
- 研究翻譯:將密集的研究論文(如原始 GPT-1 論文)轉換為易於理解的會議風格資訊圖。
- 情境精確度:利用最新知識與搜尋功能,根據當前真實世界資訊生成精確的產品模型圖。
SUMMARY: OpenAI 已發布 ChatGPT Images 2.0,這是一項顯著的影像生成能力更新,具備提升的精確度、多語言文字渲染以及加強的風格寫實性。
TITLE: ChatGPT Images 2.0 版本發布
Sources
- OriginalIntroducing ChatGPT Images 2.0