DALL·E 3 在 ChatGPT Plus 和 Enterprise 中的集成

OpenAI 已发布 DALL·E 3,现已向 ChatGPT Plus 和 Enterprise 用户提供。该模型在图像生成方面代表了重大进步,提供了更高的视觉质量、更细致的细节以及相比其前身更强的能力来遵循复杂、详细的提示。

提示遵循的技术进步

DALL·E 3 通过使用最先进的图像描述生成器为训练数据生成高质量的文本描述,从而实现了卓越的提示遵循。通过在这些改进的描述上进行训练,模型对用户提供的描述变得更加关注,使其能够可靠地渲染诸如文本、手部和面部等复杂细节。

视觉能力和格式

DALL·E 3 生成的图像在视觉冲击力和细节清晰度方面均优于之前的版本。该模型支持多种宽高比,包括横向和纵向两种方向,使用户能够创建满足灵活格式需求的图像。

安全系统和内容审核

OpenAI 采用多层次的安全系统来防止生成有害图像,包括成人、暴力或仇恨内容。该系统通过在将结果交付给用户之前,对初始用户提示和生成的图像都进行安全检查来运行。

为了进一步完善这些系统,OpenAI 与专业红队成员和早期用户合作,以识别并仅解决覆盖中的空白。此过程专门针对图形内容的边缘情况,例如性暗示图像,并测试了模型生成误导性图像的能力。

艺术家和公众人物保护

作为部署准备的一部分,OpenAI 实施了措施以限制模型生成在世艺术家风格内容或公众人物图像的可能性。公司还专注于提高生成图像中的人口统计代表性。

AI 来源和检测

OpenAI 正在评估一个内部来源分类器,旨在识别图像是否由 DALL·E 3 生成。内部评估显示以下准确率:

  • 未修改的图像: 在识别 DALL·E 生成的图像时准确率超过 99%。
  • 修改过的图像: 当图像经历常见修改时(如 JPEG 压缩、调整大小、裁剪或叠加真实图像剪切片),准确率超过 95%。

尽管这些结果很强,但 OpenAI 指出该分类器目前仅提供生成的可能性,而不是明确的结论。此工具是更广泛努力的一部分,旨在跨 AI 价值链进行协作,以帮助用户区分 AI 生成的视觉内容和真实图像。

Sources