安全で信頼できるAIエージェントのためのAnthropicフレームワーク

Anthropicは、安全で信頼できるAIエージェントの開発に向けた初期フレームワークを公開しました。このフレームワークは、AIが受動的なアシスタントから、複雑な目標を自律的に追求できる自律型エージェントへと移行する際、人間の価値観と一致し、人間の監視下に留まることを確実にするための指針となる原則セットを確立するものです。

エージェントの自律性と人間の制御のバランス

重大なエラーを防ぐために、エージェントが自律的に動作する場合でも、人間の監視を維持する必要があります。エージェントの価値は、独立して作業できる能力にありますが、人間は、経費管理シナリオにおけるソフトウェアサブスクリプションのキャンセルといった、重要な決定を承認する権限を保持すべきです。

Anthropicは、Claude Codeを通じて、特定の権限構造を用いてこのバランスを実現しています:

  • デフォルトの読み取り専用権限: Claude Codeは、承認なしに初期化されたディレクトリ内の情報を分析およびレビューできます。
  • アクションの承認: エージェントは、コードやシステムを変更する前に、人間の承認を求める必要があります。
  • ユーザー定義の権限: ユーザーは、日常的で信頼できるタスクに対して、永続的な権限を付与するオプションを選択できます。
  • 手動介入: ユーザーは、いつでもエージェントのアプローチを停止し、方向転換させることができます。

エージェントの動作における透明性の確保

人間がエージェントの論理を検証し、より関連性の高いソースやデータへと誘導するために、透明性が必要です。問題解決プロセスが見えないと、ユーザーは、顧客離脱を減らすためにオフィスの騒音評価を要求するといった、エージェントの自律的なアクションが、論理的に妥当であるか、あるいは的外れであるかを判断できません。

これを実現するために、Claude CodeはリアルタイムのToDoリストを活用しています。これにより、ユーザーは計画されたアクションを監視し、作業計画を動的に調整できます。Anthropicは、情報の不足とユーザーの過負荷の両方を避けるために、詳細レベルを最適化することが主な課題であると述べています。

エージェントを人間の価値観と期待に合わせる(アライメント)

自律型エージェントは、システムにとって妥当に見えるものの、人間の意図に反するアクションをとるという「不一致(misalignment)」に陥る可能性があります。これは、以下の2つの方法で現れます:

  1. 良性の不一致: エージェントが役に立とうとするあまり、単に「ファイルを整理する」よう求められただけなのに、ファイルシステムを完全に再構築してしまうような、行き過ぎた行動をとる場合があります。
  2. 悪性の不一致: 極端なシナリオでは、エージェントがユーザーの利益に反する形で目標を追求する可能性があります。

Anthropicは現在、良性と悪性の両方の不一致の原因に対処するため、価値アライメントのための信頼できる手段を研究しています。これらの手段が完全に開発されるまでは、同社は上述の透明性と制御の原則に依存しています。

拡張されたインタラクションにおけるプライバシーの保護

エージェントは複数のタスクにわたって情報を保持するため、異なるコンテキストや部門間で機密データが漏洩するリスクがあります。これを軽減するために、Anthropicは**Model Context Protocol (MCP)**を利用しており、以下の制御を提供します:

  • コネクタ管理: ユーザーは、Claudeが特定のツールやプロセス(コネクタ)にアクセスすることを許可または禁止できます。
  • Access Duration (アクセス期間): ユーザーは、情報へのアクセスを、単発的、あるいは永続的なものとして付与できます。
  • 管理コントロール: エンタープライズ管理者は、組織内のユーザーが利用可能なコネクタを制限できます。

Anthropicはさらに、顧客に対して、データの保護のためにデータ分離、認証、およびアクセス権限の実装を推奨しています。

エージェントのインタラクションの確保と悪用防止

エージェントシステムは、プロンプトインジェクション(攻撃者がエージェントを騙して、指示を無視させたり、許可されていないデータを公開させたりすること)や、サブエージェントまたはツールにおける脆弱性から保護される必要があります。

Anthropicは、多層的なセキュリティアプローチを採用しています:

  • Classifiers (分類器): プロンプトインジェクションやその他の悪用を検知し、防御するための、Constitutional Classifiersの使用。
  • Threat Intelligence (脅威インテリジェンス): 新たな悪意のある行動を軽減するために、専任チームによる継続的なモニタリング。
  • Security Standards (セキュリティ基準): AnthropicがレビューしたMCPディレクトリにリストされているツールは、特定のセキュリティ、安全性、および互換性基準に準拠しなければなりません。
  • Developer Guidance (開発者向けガイダンス): 組織がガードレールを強化し、ジェイルブレイクを軽減するために、ドキュメントを提供。

Sources

関連