AI 水印 101:工具與技術
AI 水印是一種關鍵機制,用於標記合成內容以傳達真實性與來源,作為對抗深偽與錯資訊蔓延的主要防禦。雖非萬無一失,這些技術允許透過演算法或人工辨識多種形態的 AI 生成資料。
水印基礎與實作
水印涉及將圖案嵌入數位內容中,讓人類(可見水印)或演算法(隱形水印)能辨識。主要有兩種實作時機:
- During Generation: 水印會在模型生成過程中自動嵌入。此方式需要存取模型,但通常能產生更具韌性的水印。
- Post-Generation: 水印在內容產出後再加入。此方法適用於閉源或專有模型,但可能不適用於所有資料類型,例如文字。
資料投毒與簽名技術
除了標準水印外,其他技術可保護內容免受 AI 操控:
- Image Cloaking/Poisoning: 像 Glaze、Photoguard、Nightshade、Fawkes 等工具會以肉眼不可察覺的方式改變圖像。有些工具阻止 AI 演算法正確處理圖像,以防止產生新版本;另一些則「投毒」訓練資料,破壞 AI 訓練演算法的假設,使系統更難生成人物的偽造圖像。
- Content Signing: 如 Truepic 所使用的技術會嵌入符合 C2PA standard 的中繼資料。此方式將內容與來源中繼資料連結,可透過認證驗證,以防止簡易的中繼資料編輯。
開放與封閉水印系統
開放與封閉水印系統之間存在策略性的取捨。開放程式碼能促進創新,卻也讓惡意者輕易移除水印步驟或編輯內容,使偵測器的信心下降。混合式方法試圖取得平衡;例如,Truepic 使用封閉的水印程式碼,但提供公開的 JavaScript 函式庫供驗證;而 IMATAG 則將實際的水印器與偵測器保持私密,同時將呼叫生成的程式碼開放。
各類型別水印技術
圖像水印
圖像水印同時關注保護訓練資料與標記輸出。
- Training Data Protection: Nightshade 透過肉眼不可見的變更影響在投毒資料上訓練的模型品質,Fawkes 則針對人物圖像以阻止臉部辨識。
- Output Watermarking: IMATAG 利用如 Stable Diffusion XL Turbo 的修改版模型在生成過程中加入水印。Truepic 在生成後加入隱形內容憑證與 C2PA 中繼資料。
文字水印
文字水印透過在 LLM 生成過程中操控 token 機率來實現。候選 token 會依據先前文字分為「紅」與「綠」兩組;「綠」組被提升(軟水印),或「紅」組被限制(硬水印)。
- Implementation: Watermark for LLMs Space 在 OPT 與 Flan-T5 等模型上示範此方法。實務上,Text Generation Inference (TGI) 工具包實作此演算法。
- Challenges: 隨著文字篇幅縮短,偵測可靠度下降,且可能出現高誤報率。通用文字水印(在不知曉使用的特定模型情況下偵測 AI 文字)目前被認為不可能,正如 OpenAI 因不準確而於 2023 年移除其內部偵測工具所示。
音訊水印
音訊水印對於保護用於安全驗證的生物特徵聲紋至關重要。大多數技術會將中繼資料注入人耳無法感知的頻率(通常低於 20 Hz 或高於 20 000 Hz)。
- AudioSeal: 一種最先進的語音局部化水印方法。它同時訓練生成器以嵌入水印,並訓練偵測器在較長的音訊檔案中找出水印片段,即使經過編輯後仍能偵測。AudioSeal 於 SeamlessExpressive 與 SeamlessStreaming 示範中使用,以確保安全。