AI 水印 101:工具与技术

AI 水印是一种关键机制,用于标记合成内容以传达真实性和来源,作为防止深度伪造和错误信息蔓延的主要防御手段。虽然并非万无一失,但这些技术能够在多种模态下通过算法或人工识别 AI 生成的数据。

水印基础与实现

水印涉及将模式嵌入数字内容中,可被人类(可见水印)或算法(不可见水印)识别。主要有两种实现时机:

  • During Generation: 水印在模型生成过程自动嵌入。这需要访问模型,但通常能产生更稳健的水印。
  • Post-Generation: 水印在内容生成后添加。此方法适用于闭源或专有模型,但可能不适用于所有数据类型,例如文本。

数据投毒与签名技术

除了标准水印外,其他技术可保护内容免受 AI 操作:

  • Image Cloaking/Poisoning:GlazePhotoguardNightshadeFawkes 之类的工具会对图像进行肉眼不可见的修改。有些工具阻止 AI 算法正确处理图像,从而阻止新版本的生成;另一些则“投毒”训练数据,破坏 AI 训练算法的假设,使系统更难生成人物的伪造图像。
  • Content Signing:Truepic 使用的技术会嵌入符合 C2PA standard 的元数据。这将内容与来源元数据关联,可通过认证进行验证,以防止简单的元数据编辑。

开放与闭源水印系统

开放与闭源水印系统之间存在战略权衡。开放代码能激发创新,但也让恶意行为者轻易移除水印步骤或编辑内容,直至检测器置信度降低。混合方案尝试平衡此问题;例如,Truepic 使用闭源水印代码,但提供公共的 JavaScript 库用于验证,而 IMATAG 将实际的水印器和检测器保持私有,同时将调用生成的代码开放。

针对不同模态的水印技术

图像水印

图像水印关注保护训练数据和标记输出两方面。

  • Training Data Protection: Nightshade 通过不可见的改动影响在投毒数据上训练的模型质量,Fawkes 针对人物图像以阻止面部识别。
  • Output Watermarking: IMATAG 利用修改后的模型(如 Stable Diffusion XL Turbo)在生成过程中嵌入水印。Truepic 在生成后添加不可见的内容凭证和 C2PA 元数据。

文本水印

文本水印通过在 LLM 生成过程中操控 token 概率实现。候选 token 根据前文被划分为“红色”和“绿色”两组;对“绿色”组进行提升(软水印)或对“红色”组进行限制(硬水印)。

  • Implementation: Watermark for LLMs Space 在 OPT 和 Flan-T5 等模型上演示了此方法。实际生产中,Text Generation Inference (TGI) 工具包实现了该算法。
  • Challenges: 随着文本长度缩短,检测可靠性下降,并可能出现高误报率。通用文本水印(在未知具体模型的情况下检测 AI 文本)目前被认为不可能,实现这一点的尝试已因不准确而被 OpenAI 在 2023 年撤下其内部检测工具。

音频水印

音频水印对于保护用于安全认证的生物特征声纹至关重要。大多数技术将元数据注入人耳不可感知的频率(通常低于 20 Hz 或高于 20 000 Hz)。

  • AudioSeal: 一种用于语音局部水印的最先进方法。它联合训练生成器以嵌入水印,并训练检测器在更长的音频文件中寻找水印片段,即使经过编辑后仍能检测。AudioSeal 在 SeamlessExpressiveSeamlessStreaming 演示中用于确保安全。

Sources