ChatGPT Images 2.5 发布说明

OpenAI 推出了 ChatGPT Images 2.5,这是一款最先进的图像生成模型,旨在提供更清晰的细节、更快的生成速度以及更精确的编辑能力。此次更新重点在于提高参考照片的保真度,与 Images 2.0 相比将延迟降低了高达 50%,并引入了新的用户界面工具,让创作者能够更好地控制最终输出。

增强的图像保真度和参考引导工作流

Images 2.5 提高了将参考照片中的主体在不同设置、视觉风格和构图之间进行转换的能力,同时保留主体的可识别特征。这确保了光照和纹理感觉更加自然,并且独特的特征能够更可靠地延续下来。

对于使用 API 的开发者而言,这种提高的保真度使参考引导的工作流更加可靠,允许图像的变体能够锚定在原始素材上。

精确与多轮编辑

Images 2.5 专为更集中的编辑而设计,允许用户修改特定元素——例如背景或单个产品——而不改变图像的其他部分。这种精确度对于在专业工作流中保持品牌处理和构图至关重要。

在多轮对话中的一致性也得到了改进。该模型现在可以在多次迭代中更可靠地遵循编辑指令,确保早期的更改被保留,并且图像质量不会随着对话的进行而下降。

新的创意工具:Sketch 和模板

OpenAI 在 ChatGPT 中引入了几项产品功能,以增强创意过程:

  • Sketch: 用户可以直接在 ChatGPT 中绘制粗略的布局或涂鸦(通过 @Sketch 命令)以作为模型的视觉引导,从而生成最终图像。
  • Templates: 针对热门创意需求预定义的格式,例如“Poster”或“Merch”,允许用户从结构化的提示词开始,而不是从空白画布开始。
  • Prompt Sharing: 用户现在可以分享用于生成图像的特定提示词,从而使他人能够使用自己的照片和细节来复制该想法。
  • Direct Image Commenting: 用户可以直接在图像上放置评论,以进行更集中的编辑请求。

API 提供方案:Flare 和 Sunburst

对于开发者,OpenAI 在 API 中发布了两个不同的模型:

  • GPT-Image-2.5 Flare: 大多数应用的首选选择,提供与 ChatGPT 版本相同的质量和速度改进,且延迟比 GPT-Image-2 低 50%。
  • GPT-Image-2.5 Sunburst: 专为需要极端精确度和在编辑过程中进行更紧密控制的高级视觉工作流而设计,尽管其生成时间较长。

社区反馈与技术观察

虽然 OpenAI 强调了这些工具的实用性,但社区也注意到了一些技术和实际方面的的观察:

性能提升

开发者报告了显著的延迟降低。一位用户指出,使用 GPT-Image-2 的平均延迟从大约 104 秒降至使用 2.5 版本时的 35 到 40 秒之间。

保真度与伪影

尽管有所改进,但一些用户指出,在复杂的合成照片中,微小的细节——例如牙齿结构或手指数量——仍然表现出 AI 伪影。

实际效用

社区对于使用场景的看法存在显著分歧。一些用户发现该工具对于室内设计和 UI 构思非常有用,而另一些人则认为展示的示例(例如安排鲜花或设计纹纹身)是琐碎的或“向往型”的,而不是解决专业生产问题,如创建 sprite sheets 或 infographics。

社会影响

Hacker News 上的讨论突出了对商业标牌中“AI slop”泛滥的担忧,以及在 Facebook Marketplace 等平台上可能出现的误导性情况,例如 AI 增强的图像可能会误导用户对二手物品实际状况的判断。

"The Facebook Marketplace experience for used items has depreciated considerably with the widespread adoption of LLMs... it's becoming a trickier landscape to navigate to find what you're looking for."

安全与可用性

OpenAI 继续使用 C2PA 元数据和不可见水印来识别 AI 生成的内容。该模型面向所有 ChatGPT、ChatGPT Work 和 Codex 用户,涵盖桌面、移动端和 Web 端的所有层级。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch