OpenAI gpt-image-1 API 发布

OpenAI 已发布 gpt-image-1,这是一款原生多模态图像生成模型,现已通过 API 提供。此发布使开发者和企业能够将高质量、专业级的图像生成、文本渲染和视觉编辑功能直接集成到自己的应用中。

模型能力与多样性

gpt-image-1 与在 ChatGPT 中驱动图像生成的模型相同。它被设计为在多种审美风格下具备通用性,并且能够在利用世界知识的同时忠实遵循自定义指南。关键技术能力包括:

  • 精准文本渲染: 模型能够在生成的图像中准确渲染文本。
  • 视觉编辑: 模型支持高保真视觉编辑,并能够将粗略草图转化为精致的图形元素。
  • 多样化风格: 它提供灵活性,可尝试不同的审美风格,以满足各种专业和消费者需求。

企业集成与使用案例

多家领先公司已经将 gpt-image-1 集成到其创意和商业工具中:

  • Adobe: 将图像生成能力集成到 Firefly 和 Express 应用中,为创作者提供更多审美风格选项。
  • Canva: 探索在 Canva AI 和 Magic Studio 中使用 gpt-image-1 进行设计生成和编辑,特别是将草图转化为图形元素。
  • GoDaddy: 通过 GoDaddy Airo® 试验可编辑徽标、背景移除以及为品牌内容和社交媒体资产生成专业排版的功能。
  • HubSpot: 探索为社交媒体、电子邮件营销和登陆页面创建营销和销售资料的可能性。
  • Instacart: 测试为食谱和购物清单生成图像。
  • invideo: 在 AI 视频制作中利用该模型实现更好的文本生成、细粒度编辑控制以及高级风格指导。

安全性与内容审核

gpt-image-1 采用与 GPT-4o 中图像生成功能相同的安全防护措施,包括对生成有害图像的限制。所有生成的图像均包含用于溯源的 C2PA 元数据。

使用 API 的开发者可以通过 moderation 参数控制内容审核的敏感度:

  • auto(默认): 标准过滤。
  • low: 较宽松的过滤。

OpenAI 表示,默认情况下客户的 API 数据不会用于训练,所有输入和输出仍受 API 使用政策的约束。

定价结构

gpt-image-1 按令牌计费,对文本令牌和图像令牌有不同的费率:

令牌类型 每 100 万令牌价格
文本输入令牌(提示文本) $5
图像输入令牌(输入图像) $10
图像输出令牌(生成的图像) $40

实际而言,这相当于每张生成的方形图像约 $0.02、$0.07 和 $0.19,分别对应低、中、高质量。

Sources