Claude 文字浮水印實作
TL;DR
Anthropic 正針對未來的 Claude 模型引入文字浮水印,以符合 EU AI Act 的規範。此系統透過改變 token 選擇過程中的隨機性來源,來達成 AI 生成內容的檢測,且不會影響生成文本的品質、成本或可讀性。
技術機制:隨機性與 Token 選擇
Claude 的浮水印系統運作方式是修改模型從候選詞彙列表中選擇下一個單字(token)的方式。在標準生成過程中,當多個單字同樣合理時(例如:在描述天氣時選擇 "overcast" 或 "grey"),模型通常會使用任意的隨機數產生器來做出最終選擇。
浮水印技術將這種任意的隨機性替換為基於加密金鑰與前文單字的決定性模式。雖然生成的文本對人類讀者而言仍具隨機性,但單字序列會與模型使用該特定金鑰所做的選擇保持一致。這使得任何持有金鑰的人都能為該文本是否由 Claude 生成分配一個機率值。
關鍵技術限制包括:
- No Hidden Characters: 沒有額外的 token 或隱藏字元被加入文本中。
- No Biased Vocabulary: 模型不會被強迫使用生僻的同義詞,也不會無視上下文而偏向特定單字。
- Deterministic Randomness: 此過程模擬隨機選擇,但受金鑰控制,類似於使用圓周率的數字而非擲骰子來決定遊戲中的移動。
對輸出品質與效能的影響
Anthropic 表示,浮水印技術對 Claude 輸出的品質、創意或可讀性沒有實際影響。
效能與成本
- Latency: 對模型速度的影響微乎其微。
- Pricing: 因為沒有產生額外的 token,所以使用者不會增加成本。
驗證
Anthropic 參考了 Google DeepMind 開發的 SynthID-Text 方法。在內部測試與引用自 SynthID-Text 論文的外部研究中,人類評分者與使用者回饋(透過點讚/倒讚評分)顯示,在浮水印文本與無浮水印文本之間,品質上並無統計學上的顯著差異。
檢測限制與邊緣案例
浮水印並非作者身份的二元證明,而是一種機率性的可能性衡量。其有效性取決於內容的性質:
- Sample Size: 隨著段落長度增加,信心度會隨之提高;在樣本較小時,檢測可靠性較低。
- Factual Content: 在事實性段落中(例如:「Isaac Newton's most famous work was called Principia Mathematica"),浮水印會較為稀疏,因為在不損害準確性的前提下,可供替換的單字選擇較少。
- Code: 程式碼通常具有較少的浮水印,因為程式運作通常需要精確的語法。然而,浮水印可以應用於任意的選擇,例如程式碼註解中的內容。
- Human Editing: 如果 Claude 被用於對人類撰寫的文本進行輕度校對或語法編輯,浮水印可能會因為過於稀疏而難以檢測。對文本進行完全重寫會移除浮水印。
合規規章與隱私保護
Anthropic 正在實施這些變更以符合 EU AI Act 以及於 2026 年 7 月簽署的 EU Code of Practice on Transparency of AI-Generated Content。由於目前尚無穩定的方式可以按區域劃分功能範圍,因此浮水印將在全球範圍內實施。
隱私保護
- Anonymity: 浮水印識別的是模型(Claude),而非使用者。它不包含任何關於個人、組織或特定對話會話的識別資訊。
- Legal Standing: 浮水印不會根據 Anthropic 的條款改變所有權、作者身份或使用者的法律權利。
對非文字檔案的支援
對於受支援的檔案類型(如 .png, .jpg, .svg),Claude 使用 C2PA (Coalition for Content Provenance and Authenticity) 開放產業標準。Claude 不使用浮水印,而是將一個經加密簽署的註記附加在檔案的元數據(metadata)中,標示該檔案是由 Claude 製作或處理的。此元數據不會改變檔案的視覺內容。
與 AI 檢測軟體的比較
Anthropic 將其浮水印技術與第三方 AI 檢測工具(例如 Pangram)區分開來。第三方檢測器尋找的是語言學上的「徵兆」或常見的 AI 用詞模式,而浮水印技術則是依賴秘密金鑰來驗證 token 選擇中特定的數學模式。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch