GPT-4o 图像生成系统卡片附录
OpenAI 已将一种新的图像生成功能原生集成到 GPT-4o 全模态架构中,实现了照片级真实感输出和高级图像到图像转换。此集成使模型能够充分利用其完整的内部知识库,生成比之前 DALL·E 3 系列所创建的图像更具表现力和实用性的图像。
增强的图像生成功能
GPT-4o 图像生成相较于 DALL·E 3 系列提供了几项重要的技术进步,侧重于真实感、灵活性和精度:
- 照片级真实感: 模型能够生成具有高度照片级真实感质量的图像。
- 图像到图像转换: 与之前的版本不同,系统可以将现有图像作为输入,并根据用户指令进行转换。
- 文本集成: 模型能够可靠地将特定文本融入生成的图像中,遵循关于排版和位置的详细指令。
- 原生全模态集成: 由于生成功能深度嵌入 GPT-4o 架构中,模型将其更广泛的推理和知识应用于图像创建,从而产生更细腻且富有表现力的输出。
安全与风险缓解
OpenAI 利用现有的安全基础设施以及从 DALL·E 和 Sora 部署中获得的见解来保护新的图像生成功能。虽然该系统受益于已建立的安全协议,但增强的能力也带来了新的边际风险。
OpenAI 管理这些风险的方法包括:
- 应用之前模型的经验: 利用 DALL·E 和 Sora 的部署数据和安全经验。
- 有针对性的风险评估: 识别并解决与在全模态模型中原生集成图像生成功能相关的特定边际风险。