Anthropic Safeguards Framework for Claude

Anthropic は、Claude の能力が有益な結果に活用される一方で、現実世界での被害を防ぐために、多層的なセーフガード戦略を採用しています。このアプローチでは、モデルのライフサイクル全体にわたり、ポリシー、執行、製品、データサイエンス、脅威インテリジェンス、エンジニアリングの専門家が連携しています。

ポリシー開発と害悪フレームワーク

Anthropic のセーフガードチームは、Claude の使用方法(適切な使用と不適切な使用)を規定する使用ポリシーを設計しており、特に児童の安全、選挙の公正性、サイバーセキュリティに焦点を当てています。このポリシー開発は、以下の2つの主要なメカニズムによってガイドされています:

  • 統合的害悪フレームワーク: 物理的、心理的、経済的、社会的、個人の自律性の5つの次元にわたる潜在的な害悪的影響を評価する構造化された視点。このフレームワークは、悪用の可能性と規模を考慮し、執行手順を決定するための根拠となります。
  • ポリシー脆弱性テスト: 恐怖主義、過激化、児童の安全、精神健康などの分野における外部の専門家と協力し、ポリシーの耐久性を検証します。たとえば、2024年の米国選挙期間中に、戦略的対話研究所(Institute for Strategic Dialogue)と提携し、選挙情報の検索時に TurboVote などの公式情報源に誘導するバナーを導入しました。

モデル学習への安全の統合

セーフガードチームとファインチューニングチームの協力により、セーフガードが学習プロセスに直接統合されます。このプロセスには以下の要素が含まれます:

  • 行動ガイドライン: 学習中にモデルが示すべき特定の特性や行動、または避けるべき行動を定義します。
  • 反復的改善: 評価および検出プロセスを用いて有害な出力を特定し、その結果を報酬モデルの更新やシステムプロンプトの調整に反映します。
  • 専門分野の専門知識: ThroughLine などの組織と連携し、自傷や精神健康に関する質問に対する Claude の応答を洗練させ、単なる拒否ではなく、洗練された支援を提供できるようにしています。

その結果、Claude は違法行為の支援を拒否し、悪意あるコードや詐欺的コンテンツの生成、有害な活動の計画を認識するように学習されています。

デプロイ前のテストと評価

新しいモデルがリリースされる前に、以下の3つの主要な評価が行われます:

  • セーフティ評価: 使用ポリシーの遵守状況を、明確な違反や複数ターンの会話などさまざまなシナリオでテストします。これらの評価は他のモデルによって行われ、正確性の確認のため人間によるレビューも実施されます。
  • リスク評価: サイバー被害や化学・生物・放射性・核兵器および高威力爆発物(CBRNE)など、高リスク分野については、政府機関および民間産業のパートナーと協力して AI 機能強化テストを実施します。
  • バイアス評価: 対立する立場の見解に対する応答を比較し、事実性と一貫性を評価することで、政治的バイアスを検出します。また、医療や職業などにおける人種、性別、宗教などのアイデンティティ属性に関連するバイアスもテストしています。

「コンピュータ使用」ツールに関しては、リリース前の評価でスパム生成の増強リスクが特定され、新しい検出手法、プロンプトインジェクション対策、悪用アカウントに対するツールの無効化機能の開発が行われました。

実時間検出と執行

デプロイ後、Anthropic は自動システムと人間によるレビューの組み合わせを用いて使用ポリシーを執行します:

  • 分類器: 特別にファインチューニングされた Claude モデルで、リアルタイムで会話の特定のポリシー違反を監視します。これらの分類器は、計算リソースのオーバーヘッドを最小限に抑えながら、数兆トークンを処理します。
  • CSAM 検出: 第1者製品において、画像のハッシュを既知の児童性虐待物質(CSAM)データベースと照合します。
  • 執行措置: 「応答の方向性調整」(システムプロンプトをリアルタイムで調整して有害な出力を防ぐ、または応答を完全に停止する)や、アカウントレベルでの措置(警告やアカウント停止)が含まれます。

持続的な監視と脅威インテリジェンス

Anthropic は、個々のプロンプトを超えた高度な攻撃パターンを特定するために、トラフィックパターンを監視しています:

  • Claude Insights: プライバシーを守るツールで、会話をトピッククラスタにグループ化し、現実世界での利用状況を分析し、ガードレールの改善に役立てます。
  • 階層的要約: コンピュータ使用やサイバー能力の監視に用いられる技術で、相互作用を要約に凝縮し、自動的な影響操作などの集団的行動を特定します。
  • 脅威インテリジェンス: ハッカーフォーラム、ソーシャルメディア、メッセージングプラットフォームを監視し、内部の悪用指標(たとえば活動の急増)と外部の脅威データを照合して、敵対的な使用を特定します。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch