Claude Text Watermarking Implementation
TL;DR
Anthropicは、EU AI Actを遵守するため、将来のClaudeモデルにテキスト・ウォーターマーキング(電子透かし)を導入します。このシステムは、生成されたテキストの品質、コスト、または可読性に影響を与えることなく、トークン選択時に使用される乱数のソースを変更することで、AI生成コンテンツの検出を可能にします。
Technical Mechanism: Randomness and Token Selection
Claudeのウォーターマーキング・システムは、モデルが候補リストから次の単語(トークン)を選択する方法を修正することで機能します。標準的な生成では、複数の単語が同等に妥当な場合(例:天候を説明するために「overcast」か「grey」のどちらかを選択する場合)、モデルは通常、最終的な選択を行うために任意の乱数生成器を使用します。
ウォーターマーキングは、この任意の乱数を、暗号鍵に基づいた決定論的なパターンに置き換えます。結果として得られるテキストは人間の読者にはランダムに見えますが、単語のシーケンスは、その特定の鍵を使用した場合にモデルが行う選択と一致するようになります。これにより、鍵を持つ人は誰でも、そのテキストがClaudeによって生成されたかどうかの確率を割り当てることができます。
主な技術的制約は以下の通りです:
- No Hidden Characters: テキストに余分なトークンや隠し文字は追加されません。
- No Biased Vocabulary: 文脈に関わらず、モデルが難解な類義語の使用を強制されたり、特定の単語に偏ったりすることはありません。
- Deterministic Randomness: このプロセスはランダムな選択を模倣しますが、鍵によって制御されます。これは、ゲームの動きを決定するためにサイコロを振る代わりに、円周率の数字を使用することに似ています。
Impact on Output Quality and Performance
Anthropicは、ウォーターマーキングがClaudeの出力の品質、創造性、または可読性に実質的な影響を与えないと述べています。
Performance and Cost
- Latency: モデルの速度への影響は無視できる程度です。
- Pricing: 追加のトークンが生成されないため、ユーザーのコストが増加することはありません。
Validation
Anthropicは、Google DeepMindが開発したSynthID-Textのアプローチを参照しています。内部テストおよびSynthID-Textの論文から引用された外部研究において、人間の評価者およびユーザーフィードバック(thumbs-up/downによる評価)は、ウォーターマーキングされたテキストとされていないテキストの間で、品質に統計的に有意な差がないことを示しました。
Detection Limitations and Edge Cases
ウォーターマーキングは、著作権の二進法的証明ではなく、起こりうる確率的な尺度です。その効果はコンテンツの性質によって異なります:
- Sample Size: 文章の長さが増すにつれて信頼性が向上します。短いサンプルでは検出が困難になります。
- Factual Content: 事実に基づいた文章(例:「Isaac Newton's most famous work was called Principia Mathematica」)では、ウォーターマーキングはより希薄になります。なぜなら、正確性を損なわずに選択できる入れ替え可能な単語の選択肢が少ないためです。
- Code: プログラムが機能するために正確な構文が必要とされることが多いため、コードには一般的にウォーターマーキングが少なくなります。しかし、コードコメントに見られるような任意の選択肢には、ウォーターマーキングを適用することが可能です。
- Human Editing: Claudeが、人間が書いたテキストの校正や文法修正のために使用される場合、ウォーターマーキングは検出できないほど希薄になる可能性があります。テキストの完全な書き換えは、ウォーターマークを削除します。
Compliance and Privacy
Anthropicは、EU AI Actおよび2026年7月に署名されたEU Code of Practice on Transparency of AI-Generated Contentを遵守するために、これらの変更を実装しています。現在、地域ごとに機能を制限する永続的な方法がないため、ウォーターマーキングはグローバルに適用されます。
Privacy Protections
- Anonymity: ウォーターマークはモデル(Claude)を特定するものであり、ユーザーを特定するものではありません。個人、組織、または特定のチャットセッションに関する識別情報は含まれていません。
- Legal Standing: ウォーターマークは、Anthropicの利用規約に基づき、ユーザーの所有権、著作権、または法的権利をあらわせるものではありません。
Support for Non-Text Files
.png, .jpg, .svg などのサポートされているファイル形式の場合、ClaudeはC2PA (Coalition for Content Provenance and Authenticity) のオープン業界標準を使用します。ウォーターマークの代わりに、Claudeはファイル内のメタデータに、そのファイルがClaudeによって作成または処理されたことを示す暗号的に署名されたノートを付加します。このメタデータは、ファイルの視覚的な内容を変更しません。
Comparison with AI Detection Software
Anthropicは、そのウォーターマーキングを、サードパーティのAI検出ツール(例:Pangram)とは区別しています。サードパーティの検出器は言語的な「特徴」や一般的なAIの言い回しのパターンを探しますが、ウォーターマーキングは、トークン選択における特定の数学的パターンを検証するために、秘密鍵を使用します。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch