Claude 文本水印实现

TL;DR

Anthropic 正在为未来的 Claude 模型引入文本水印技术,以符合 EU AI Act 的要求。该系统通过改变 token 选择过程中使用的随机性来源,从而实现对 AI 生成内容的检测,且不会影响生成文本的质量、成本或可读性。

技术机制:随机性与 Token 选择

Claude 的水印系统通过修改模型从候选词列表中选择下一个词(token)的方式来运作。在标准生成过程中,当多个词在逻辑上同样合理时(例如,在描述天气时选择 "overcast" 或 "grey"),模型通常会使用一个任意的随机数生成器来进行最终选择。

水印技术将这种任意的随机性替换为基于加密密钥和前序词汇的确定性模式。虽然生成的文本对人类读者而言仍然是随机的,但词汇序列与模型使用该特定密钥时所做的选择保持一致。这使得任何持有密钥的人都能为“该文本是由 Claude 生成的”这一结论分配一个概率值。

关键技术约束包括:

  • 无隐藏字符: 文本中不会添加额外的 token 或隐藏字符。
  • 无偏见词汇: 模型不会被强制使用生僻的同义词,也不会在不考虑上下文的情况下偏向特定词汇。
  • 确定性随机性: 该过程模拟了随机选择,但受密钥控制,类似于使用圆周率 $\pi$ 的位数而不是掷骰子来决定游戏中的步骤。

对输出质量和性能的影响

Anthropic 表示,水印技术对 Claude 输出内容的质量、创意或可读性没有实际影响。

性能与成本

  • 延迟: 对模型速度的影响微乎其微。
  • 定价: 由于没有生成额外的 token,用户的成本不会增加。

验证

Anthropic 参考了 Google DeepMind 开发的 SynthID-Text 方法。在内部测试和引用的 SynthID-Text 论文中的外部研究中,人类评分员和用户反馈(通过点赞/点踩评分)显示,带水印和不带水印的文本在质量上没有统计学上的显著差异。

检测局限性与边缘情况

水印技术并非作者身份的二元证明,而是一种基于可能性的概率度量。其有效性取决于内容的性质:

  • 样本量: 随着文本段落长度的增加,置信度会随之提高;在小样本上检测的可靠性较低。
  • 事实性内容: 在事实性段落中(例如,“Isaac Newton's most famous work was called Principia Mathematica"),水印分布较为稀疏,因为在不损害准确性的前提下,可替换的词汇选择较少。
  • 代码: 代码通常水印较少,因为程序运行通常需要精确的语法。然而,水印可以应用于任意选择,例如代码注释中的内容。
  • 人工编辑: 如果 Claude 被用于对人类编写的文本进行轻度校对或语法编辑,水印可能过于稀疏而无法检测。对文本进行彻底重写会移除水印。

合规规制与隐私

Anthropic 正在实施这些变更以符合 EU AI Act 以及 2026 年 7 月签署的 EU Code of Practice on Transparency of AI-Generated Content。由于目前还没有持久的方法可以按地区限定该功能,水印技术将在全球范围内应用。

隐私保护

  • 匿名性: 水印识别的是模型(Claude),而非用户。它不包含任何关于个人、组织或特定聊天会话的识别信息。
  • 法律地位: 根据 Anthropic 的条款,水印不会改变用户的所有权、作者身份或法律权利。

对非文本文件的支持

对于支持的文件类型(如 .png, .jpg, .svg),Claude 使用 C2PA (Coalition for Content Provenance and Authenticity) 这一开放行业标准。Claude 不使用水印,而是通过在文件的元数据中附加一个经加密签名的说明,指出该文件是由 Claude 创建或处理的。这种元数据不会改变文件的视觉内容。

与 AI 检测软件的对比

Anthropic 将其水印技术与第三方 AI 检测工具(例如 Pangram)区分开来。第三方检测器寻找的是语言学上的“特征”或常见的 AI 用语模式,而水印技术则依赖于一个秘密密钥来验证 token 选择中特定的数学模式。

Sources

相关