OpenAI 内容来源与真实性倡议
OpenAI 正在实施多层次的内容来源方法,以对抗欺骗性的 AI 生成媒体
OpenAI 已加入 C2PA 指导委员会,并正在开发内部检测工具,以提供有关视听内容来源的透明度。这些工作将开放行业标准与专有技术解决方案相结合,帮助用户验证数字内容是否由 OpenAI 工具创建或编辑。
采用 C2PA 开放标准
OpenAI 已加入内容来源与真实性联盟(C2PA)的指导委员会,这是一个广泛使用的数字内容认证标准。该标准允许创作者和平台证明数字内容的来源,无论是原始相机输出还是 AI 生成的图像。
在 DALL·E 3 和 Sora 中的实现
OpenAI 已将 C2PA 元数据集成到通过 ChatGPT 和 OpenAI API 使用 DALL·E 3 创建或编辑的所有图像中。该元数据记录图像的历史,包括使用的工具(例如 OpenAI 的 DALL·E)和所采取的操作(例如格式转换或编辑)。OpenAI 还承诺在 Sora 视频生成模型广泛发布时为其集成 C2PA 元数据。
社会韧性基金
为促进来源标准的采用和理解,OpenAI 与 Microsoft 启动了 200 万美元的社会韧性基金。该基金通过诸如 Partnership on AI、International IDEA 以及 AARP 的 Older Adults Technology Services 等组织支持 AI 教育。
专有检测与水印工具
OpenAI 正在开发内部来源方法,旨在比标准元数据更难被移除。
DALL·E 3 图像检测分类器
OpenAI 已启动研究者访问计划,允许研究实验室和新闻非营利组织测试图像检测分类器。该工具预测图像由 DALL·E 3 生成的可能性。内部测试显示以下性能指标:
- Accuracy: 正确识别约 98% 的 DALL·E 3 图像。
- False Positives: 少于约 0.5% 的非 AI 生成图像被错误标记为 DALL·E 3 图像。
- Robustness: 在常见修改(如裁剪、压缩和饱和度变化)下保持性能。
- Limitations: 在区分 DALL·E 3 图像与其他 AI 模型生成的图像时性能较低,约 5-10% 的其他模型图像被标记为 DALL·E 3 图像。
音频水印
OpenAI 已将防篡改音频水印集成到 Voice Engine 中,这是其自定义语音模型,目前处于有限的研究预览阶段。这涉及在音频中嵌入难以移除的不可见信号。
文本来源研究
OpenAI 因感知风险更高而优先考虑视听内容,但正在积极研究文本来源解决方案。目前的发现包括:
文本水印
OpenAI 已开发出一种文本水印方法,对局部篡改(如改写)有效,但对全局篡改脆弱。使用翻译系统、使用其他生成模型重新措辞,或插入删除特殊字符等方法都可以规避水印。
此外,研究表明文本水印可能对非英语母语者产生不成比例的影响,使使用 AI 作为写作工具受到污名化。
文本元数据
OpenAI 正在探索对文本使用加密签名元数据。由于元数据已签名,它消除了误报,OpenAI 预计随着 AI 生成文本量的增加,这将变得至关重要。