OpenAI GPT-4o 图像生成发布

OpenAI 已在 GPT-4o 中直接引入原生图像生成能力。这一整合将图像生成从装饰性工具转变为实用工具,能够实现精确的文本渲染、复杂指令的遵循,以及在对话上下文中无缝的多轮细化。

原生多模态与实用性

GPT-4o 的图像生成是作为原生多模态模型构建的,这意味着它在在线图像和文本的联合分布上进行训练。这种方法使模型不仅能够理解图像与语言之间的关系,还能理解图像之间的关联,从而实现更高的视觉流畅度和上下文感知。

不同于以往侧重于超现实或惊艳场景的系统,GPT-4o 旨在提供“主力图像”——如标志、图表和信息图等实用视觉内容,通过共享的语言和符号传达精确含义。

关键技术能力

精确文本渲染

GPT-4o 能将精确的符号和文本与图像融合,使其可用于视觉传达。模型能够渲染特定的、详细的文本——例如包含多条规则和改写警示的复杂路标——同时保持写实风格。

多轮生成与一致性

由于图像生成是模型的原生功能,用户可以通过自然对话对图像进行细化。GPT-4o 在多次迭代中保持一致性,使得主题(例如角色外观)能够在用户多轮实验并添加细节的过程中连贯演进。

高级指令遵循

GPT-4o 在单个提示中能够处理的对象数量显著提升。其他系统通常在 5‑8 个对象时就会出现困难,而 GPT-4o 能够管理 10‑20 个不同对象,并更紧密地绑定特征和关系。

上下文学习与世界知识

  • In-Context Learning: 模型可以分析用户上传的图像,并将这些特定细节整合到新的生成中,例如使用草图作为技术图的参考。
  • World Knowledge: 模型将内部基于文本的知识与视觉能力相结合,使其能够解释复杂输入(如 Three.js 代码)并生成相应的视觉表现。

写实度与风格多样性

GPT-4o 能够生成多种风格,从带有闪光眩光的抓拍、狗仔风格摄影,到复古宝丽来美学以及锐利的现代数码摄影。它能够处理复杂的光照、反射和大气透视,例如描绘一匹马在海面上奔跑,呈现精准的水花和波纹。

安全性与来源追溯

OpenAI 为 GPT-4o 图像生成实施了多层安全性和透明度:

  • C2PA Metadata: 所有生成的图像均包含 C2PA 元数据,以标识其为 GPT-4o 输出。
  • Internal Search Tool: OpenAI 开发了一款工具,利用技术属性验证内容是否由其模型生成。
  • Reasoning-Based Moderation: 一个基于推理的 LLM,经过人类编写的安全规范训练,用于审查输入文本和输出图像。
  • Content Blocking: 模型继续阻止违反内容政策的请求,包括性深度伪造和儿童性虐待材料,并对涉及真实人物的裸体和血腥暴力实施更严格的限制。

限制与可用性

OpenAI 承认目前存在若干限制,包括“裁剪幻觉”(即对海报等较长图像在底部裁剪过紧)、高绑定问题、精确绘图问题以及多语言文本渲染的困难。

访问详情:

  • ChatGPT: 作为 Plus、Pro、Team 和免费用户的默认图像生成器提供。企业版和教育版用户的访问即将推出。
  • Sora: 已集成至 Sora。
  • DALL·E: 仍可通过专用的 DALL·E GPT 访问。
  • API: 开发者访问将在 2025 年 3 月 25 日公告后的数周内逐步推出。
  • Performance: 由于细节增多,图像渲染可能需要最长约一分钟。

Sources