OpenAI gpt-image-1 API 发布
OpenAI 已发布 gpt-image-1,这是一款原生多模态图像生成模型,现已通过 API 提供。此发布使开发者和企业能够将高质量、专业级的图像生成、文本渲染和视觉编辑功能直接集成到自己的应用中。
模型能力与多样性
gpt-image-1 与在 ChatGPT 中驱动图像生成的模型相同。它被设计为在多种审美风格下具备通用性,并且能够在利用世界知识的同时忠实遵循自定义指南。关键技术能力包括:
- 精准文本渲染: 模型能够在生成的图像中准确渲染文本。
- 视觉编辑: 模型支持高保真视觉编辑,并能够将粗略草图转化为精致的图形元素。
- 多样化风格: 它提供灵活性,可尝试不同的审美风格,以满足各种专业和消费者需求。
企业集成与使用案例
多家领先公司已经将 gpt-image-1 集成到其创意和商业工具中:
- Adobe: 将图像生成能力集成到 Firefly 和 Express 应用中,为创作者提供更多审美风格选项。
- Canva: 探索在 Canva AI 和 Magic Studio 中使用
gpt-image-1进行设计生成和编辑,特别是将草图转化为图形元素。 - GoDaddy: 通过 GoDaddy Airo® 试验可编辑徽标、背景移除以及为品牌内容和社交媒体资产生成专业排版的功能。
- HubSpot: 探索为社交媒体、电子邮件营销和登陆页面创建营销和销售资料的可能性。
- Instacart: 测试为食谱和购物清单生成图像。
- invideo: 在 AI 视频制作中利用该模型实现更好的文本生成、细粒度编辑控制以及高级风格指导。
安全性与内容审核
gpt-image-1 采用与 GPT-4o 中图像生成功能相同的安全防护措施,包括对生成有害图像的限制。所有生成的图像均包含用于溯源的 C2PA 元数据。
使用 API 的开发者可以通过 moderation 参数控制内容审核的敏感度:
- auto(默认): 标准过滤。
- low: 较宽松的过滤。
OpenAI 表示,默认情况下客户的 API 数据不会用于训练,所有输入和输出仍受 API 使用政策的约束。
定价结构
gpt-image-1 按令牌计费,对文本令牌和图像令牌有不同的费率:
| 令牌类型 | 每 100 万令牌价格 |
|---|---|
| 文本输入令牌(提示文本) | $5 |
| 图像输入令牌(输入图像) | $10 |
| 图像输出令牌(生成的图像) | $40 |
实际而言,这相当于每张生成的方形图像约 $0.02、$0.07 和 $0.19,分别对应低、中、高质量。