Anthropic Constitutional Classifiers: Defending against universal jailbreaks

TL;DR

Anthropicは、Constitutional Classifiersを導入しました。これは、Claude 3.5 Sonnetにおけるユニバーサル・ジェイルブレイク(普遍的な脱獄)の試みを95%以上ブロックし、過剰拒否率の増加はわずか0.38%、計算コストの増加は約24%に抑えられています。


What are Constitutional Classifiers?

Constitutional Classifiersは、入力用と出力用の2つの独立したニューラル分類器です。これらは、許可されるコンテンツと禁止されるコンテンツのカテゴリを列挙したconstitution(憲法)から生成された大規模な合成データセットを用いて学習されています(例:マスタードのレシピは許可されますが、マスタードガスのレシピは許可されません)。分類器は、言語モデルがコンテンツを生成または返却する前に、憲法に違反するプロンプトやレスポンスを検知してブロックします。

"Both techniques use a constitution: a list of principles to which the model should adhere. In the case of Constitutional Classifiers, the principles define the classes of content that are allowed and disallowed."

Training Pipeline

  1. Constitution creation – 人間が作成した、無害なコンテンツと有害なコンテンツのカテゴリのリスト。当初は化学、生物、放射性、および核(CBRN)の脅威に焦点を当てています。
  2. Synthetic data generation – Claudeが各カテゴリについて数百万のプロンプトと完了(completion)のペアを生成し、その後、言語翻訳、スタイル変異(既知のジェイルブレイク・スタイルを含む)、およびエンコーディングのトリックを用いて拡張します。
  3. Balanced dataset – 過剰拒否を低く抑えるため、請負業者による固定の無害なクエリのセットが追加されます。
  4. Classifier training – 入力および出力分類器は、プロンプトやレスポンスが禁止されたクラスに属するかどうかを予測するために学習されます。
  5. Deployment – 推論時、分類器がモデルをゲート(制御)します。拒否されたプロンプトはClaudeに到達せず、拒否された完了(completion)はユーザーに送信される前に破棄されます。

Human Red-Team Evaluation (Prototype)

  • Setup: 独立したジェイルブレイカーがバグ・バウンティ・プログラムに参加し、プロトタイプ分類器によって保護されたClaude 3.5 Sonnet (June 2024) が、事前に選択された10個の「禁止」クエリに回答するように強制することを試みました。
  • Effort: 183名の参加者が2ヶ月間で3,000時間以上を費やし、ユニバーサル・ジェイルブレイクの達成には15,000ドルの報酬が設定されました。
  • Result: 参加者の誰も、単一のジェイルブレイクによって10個のクエリすべてに詳細な回答を得ることはできませんでした。したがって、ユニバーサル・ジェイルブレイクは発見されませんでした。
  • Limitations: プロトタイプは無害なクエリに対して高い過剰拒否を示し、多大な計算コストが発生したため、第2世代の反復(iteration)が行われました。

Automated Synthetic Evaluation (Updated System)

  • Dataset: 既知の最も効果的な攻撃や、新しい分類器回避技術を用いて、合成的に生成された10,000個のジェイルブレイク・プロンプト。
  • Baseline: 分類器なしの場合、Claude 3.5 Sonnet (Oct 2024) はこれらのプロンプトの86%を許可していました。
  • With Constitutional Classifiers: 成功率が**4.4%**に低下し、ジェイルブレイクの試みは95%以上がブロックされました。
  • Over-refusal impact: 無害なクエリの拒否は**0.38%**上昇しましたが、これは5,000件の会話サンプルのうち、統計的に有意な変化ではありません。
  • Compute overhead: 推論コストは**23.7%**増加しましたが、これは「中程度」と説明されています。

Automated evaluation results: jailbreak success, over-refusal, and compute overhead

Live Demo (Feb 3-10 2025) and Real-World Red-Team Findings

  • Participation: 339名のジェイルブレイカーが300,000件以上のチャット・インタラクション(約3,700時間)を生成しました。
  • Successes: 4名の参加者が8つのチャレンジ・レベルをすべてクリアし、1名がuniversal(普遍的)なジェイルブレイクを達成し、もう1名が境界線上の普遍的ジェイルブレイクを達成しました。
  • Common strategies:
    • Cipher and encoding tricks to bypass the output classifier.
    • Keyword substitution (e$$
[
  {
    "body": "# Anthropic Constitutional Classifiers: Defending against universal jailbreaks\n\n## TL;DR\nAnthropicは、**Constitutional Classifiers**を導入しました。これは、Claude 3.5 Sonnetにおけるユニバーサル・ジェイルブレイク(普遍的な脱獄)の試みを95%以上ブロックし、過剰拒否率の増加はわずか0.38%、計算コストの増加は約24%に抑えられています。\n\n---\n\n## What are Constitutional Classifiers?\nConstitutional Classifiersは、入力用と出力用の2つの独立したニューラル分類器です。これらは、許可されるコンテンツと禁止されるコンテンツのカテゴリを列挙した**constitution**(憲法)から生成された大規模な合成データセットを用いて学習されています(例:マスタードのレシピは許可されますが、マスタードガスのレシピは許可されません)。分類器は、言語モデルがコンテンツを生成または返却する前に、プロンプトやレスポンスが憲法に違反するかどうかをフラグ立てしてブロックします。\n\n> "Both techniques use a constitution: a list of principles to which the model should adhere. In the case of Constitutional Classifiers, the principles define the classes of content that are allowed and disallowed.\"\n\n## Training Pipeline\n1. **Constitution creation** – 人間が作成した、無害なコンテンツと有害なコンテンツのカテゴリのリスト。当初は化学、生物、放射性、および核(CBRN)の脅威に焦点を当てています。\n2. **Synthetic data generation** – Claudeが各カテゴリについて数百万のプロンプトと完了(completion)のペアを生成し、その後、言語翻訳、スタイル変異(既知のジェイルブレイク・スタイルを含む)、およびエンコーディングのトリックを用いて拡張します。\n3. **Balanced dataset** – 過剰拒否を低く抑えるため、請負業者による固定の無害なクエリのセットが追加されます。\n4. **Classifier training** – 入力および出力分類器は、プロンプトやレスポンスが禁止されたクラスに属するかどうかを予測するために学習されます。\n5. **Deployment** – 推論時、分類器がモデルをゲート(制御)します。拒否されたプロンプトはClaudeに到達せず、拒否された完了(completion)はユーザーに送信される前に破棄されます。\n\n## Human Red-Team Evaluation (Prototype)\n- **Setup**: 独立したジェイルブレイカーがバグ・バウンティ・プログラムに参加し、プロトタイプ分類器によって保護されたClaude 3.5 Sonnet (June 2024) が、事前に選択された10個の「禁止」クエリに回答するように強制することを試みました。\n- **Effort**: 183名の参加者が2ヶ月間で3,000時間以上を費やし、ユニバーサル・ジェイルブレイクの達成には15,000ドルの報酬が設定されました。\n- **Result**: 参加者の誰も、単一のジェイルブレイクによって10個のクエリ*すべて*に詳細な回答を得ることはできませんでした。したがって、ユニバーサル・ジェイルブレイクは発見されませんでした。\n- **Limitations**: プロトタイプは無害なクエリに対して高い過剰拒否を示し、多大な計算コストが発生したため、第2世代の反復(iteration)が求められました。\n\n## Automated Synthetic Evaluation (Updated System)\n- **Dataset**: 既知の最も効果的な攻撃や、新しい分類器回避技術を用いて、合成的に生成された10,000個のジェイルブレイク・プロンプト。\n- **Baseline**: 分類器なしの場合、Claude 3.5 Sonnet (Oct 2024) はこれらのプロンプトの86%を許可していました。\n- **With Constitutional Classifiers**: 成功率が**4.4%**に低下し、ジェイルブレイクの試みは95%以上がブロックされました。\n- **Over-refusal impact**: 無害なクエリの拒否は**0.38%**上昇しましたが、これは5,000件の会話サンプルのうち、統計的に有意な変化ではありません。\n- **Compute overhead**: 推論コストは**23.7%**増加しましたが、これは「中程度」と説明されています。\n\n![Automated evaluation results: jailbreak success, over-refusal, and compute overhead](https://www.anthropic.com/_next/image?url=https%3A%2F%2Fwww-cdn.anthropic.com%2Fimages%2F4zrzovbb%2Fwebsite%2Fcd6520ed645ade7f12ab336cd02ef5954211dfa8-1650x1077.png&w=3840&q=75)\n\n## Live Demo (Feb 3-10 2025) and Real-World Red-Team Findings\n- **Participation**: 339名のジェイルブレイカーが300,000件以上のチャット・インタラクション(約3,700時間)を生成しました。\n- **Successes**: 4名の参加者が8つのチャレンジ・レベルをすべてクリアし、1名が*universal*(普遍的)なジェイルブレイクを達成し、もう1名が境界線上の普遍的ジェイルブレイクを達成しました。\n- **Common strategies**:\n  * Cipher and encoding tricks to bypass the output classifier.\n  * Role-play system prompts.\n  * Keyword substitution (e.g., "Soman" $\rightarrow$ "water").\n  * Prompt-injection attacks.\n- **Auto-grader performance**: 全体として、提出物の約1%を採点拒否しました(Question 4では10%)。デ・オブファスケイション(難読化解除)による再採点を行えば、ケースの約0.26%の結果が変化した可能性があります。\n- **Prizes**: 4名の成功した参加者に55,000ドルが支払われました(全レベル完了で10,000ドル、ユニバーサル・ジェイルブレイク達成で20,000ドル、および追加の賞金)。\n\n![Demo level-completion bar chart](https://www.anthropic.com/_next/image?url=https%3A%2F%2Fwww-cdn.anthropic.com%2Fimages%2F4zrzovbb%2Fwebsite%2F0caa7bd830986ef74a79a277655bee7e313cbe94-1800x1800.png&w=3840&q=75)\n\n## Limitations and Future Work\n- **Incomplete coverage**: Constitutional Classifiersは、ユニバーサル・ジェイルブレイクをゼロにすることを保証するものではありません。残る攻撃は、発見するためにさらなる努力が必要です。\n- **Evolving threats**: 新しいジェイルブレイク技術が登場する可能性があり、補完的な防御策(例:外部モニタリング、動的なレスポンス戦略)が必要になります。\n- **Adaptability**: 基盤となるconstitution(憲法)は、新しい攻撃パターンを取り入れるために迅速に更新可能です。\n- **Ongoing goals**: 本番環境へのデプロイ前に、過剰拒否率をさらに低減し、計算コストを抑え、分類器をさらなる安全性の層と統合することを目指しています。\n\n## How the System Fits Into Anthropic’s Safety Roadmap\nAnthropicの**Responsible Scaling Policy**の下では、モデルはCBRN関連の危害を含むリスクが許容可能なレベルまで軽減されるまで、デプロイされることができません。Constitutional Classifiersは、CBRN能力の閾値を超えたモデルに対して必要な軽減策を提供することを目的としており、より強力なLLMのより安全なスケーリングを可能にします。\n\n## Accessing the Demo\nA Constitutional Classifiersによって保護されたClaude 3.5 Sonnetのライブ・デモは、以下のURL(現在はアーカイブ済み)で利用可能でした:\n[https://claude.ai/redirect/website.v1.082e291e-714e-4b74-8d3d-6bb3e9114f91/constitutional-classifiers](https://claude.ai/redirect/website.v1.082e291e-714e-4b74-8d3d-6bb3e9114f91/constitutional-classifiers)\n\n## References\n- Paper: *Constitutional Classifiers: Defending against universal jailbreaks* (arXiv 2501.18837) – https://arxiv.org/abs/2501.18837\n- Related work: Constitutional AI (arXiv 2212.08073) – https://arxiv.org/org/abs/2212.08073\n- Bug-bounty program: https://www.anthropic.com/news/model-safety-bug-bounty\n- Responsible Scaling Policy: https://www.anthropic.com/news/announcing-our-updated-responsible-scaling-policy

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch