Anthropic Trustworthy Agents Framework and Implementation

Anthropicは、単純なチャットボットから、コードの実行、ファイルの管理、複数のアプリケーションにわたる相互作用が可能な自律型システムへと移行することで、信頼できるAIエージェントを開発するための包括的なアプローチを導入しました。この移行は生産性を向上させますが、エージェントがユーザーの意図を誤解する可能性や、プロンプトインジェクションによるサイバー攻撃への脆弱性といった重大なリスクをもたらします。

The Architecture of AI Agents

AIエージェントは、タスクを達成するために自身のプロセスとツールの使用を指示するモデルとして定義され、計画、実行、観察、調整という自己主導的なループの中で動作します。Anthropicは、エージェントの能力とセキュリティプロファイル(安全性)を決定する4つの重要な構成要素を特定しています。

  • The Model: 学習プロセスから得られるコアとなる知能であり、推論と行動を規定します。
  • The Harness: モデルが動作する指示とガードレールのセット(例:確認なしに経費を提出しないというルール)。
  • Tools: メール、カレンダー、または専門的なソフトウェアなど、モデルがアクセスできる外部サービスやアプリケーション。
  • The Environment: エージェントが動作する特定の環境(例:企業のノートPC vs. 個人のスマートフォン)であり、データアクセスとエージェントの行動の重要度を決定します。

Anthropicは、セキュリティはモデルだけに頼ることはできないと強調しています。十分に訓練されたモデルであっても、設定の不適切なHarness、権限が広すぎるTools、または露出したEnvironmentによって侵害される可能性があります。

Implementing Trustworthy Principles

Anthropicは、製品設計において、人間による制御、人間の価値観との整合性、相互作用の保護、透明性、プライバシーという5つのコア原則を適用しています。

Designing for Human Control

自律性とセキュリティのバランスをとるために、Anthropicは階層的な監視メカニズムを実装しています。

  • Granular Permissions: Claude.aiおよびClaude Desktopにおいて、ユーザーは特定のツールに対して権限を設定できます(例:「常に許可」、「承認が必要」、「ブロック」)。
  • Plan Mode: Claude Codeに導入されたこの機能は、ユーザーが実行前にエージェントの意図するアクションプラン全体をレビューして編集できるようにするもので、監視の対象を個的なステップから全体的な戦略へと移行させます。
  • Subagent Coordination: エージェントが並行するSubagentにタスクを委任し始めるにつれ、Anthropicは、これらの複雑なワークフローが制御可能で透明であることを確実にするための調整パターンを研究しています。

Aligning Agent Goals with User Intent

エージェント開発における主な課題は、エージェントがいつ自律的に行動すべきか、いつ明確化のために一時停止すべきかを調整することです。Anthropicはこれを以下の方法で対処しています。

  • Scenario Training: 曖昧な状況で仮定を立てるのではなく、一時停止するようにモデルに報酬を与える学習シナリオを作成します。
  • Constitutional AI: ClaudeのConstitutionを利用して、続行する前に懸念を表明したり、明確化を求めたりする本能を強化します。

研究によれば、複雑なタスクにおいて、Claudeがユーザーに確認を行う頻度が約2倍になり、この調整の有効性が示されています。

Defending Against Prompt Injection

プロンプトインジェクションは、エージェントが処理するデータの中に悪意のある指示が隠されており、モデルを騙して不正なアクションを行わせる可能性がある場合に発生します。Anthropicは多層的な防御戦略を採用しています。

  • Model Training: インジェクションパターンを認識し、無視するようにモデルを訓練します。
  • Traffic Monitoring: 本番環境のトラフィックを監視して、現実世界の攻撃をブロックします。
  • Red-Teaming: 外部の専門家を使用して、システムのテストを行います。

単一の防御策では絶対ではないため、Anthropicは、環境のリスクプロファイルに基づいて、エージェントに付与するツール、データ、および権限を制限することをユーザーに推奨しています。

Ecosystem-Wide Requirements for Agent Security

Anthropicは、エージェントの信頼性は単一の企業によって達成されるものではなく、業界全体のインフラストラクチャを共有する必要があると主張しています。

  • Standardized Benchmarks: NISTのような機関と協力して、プロンプトインジェクションへの耐性と不確実性の提示に関する、独立して検証可能なベンクマークを構築します。
  • Evidence Sharing: エージェントが苦戦する箇所に関するデータを公開する慣行により、政策立案者に現実世界の使用状況を明確なイメージを提供します。
  • Open Standards: Model Context Protocol (MCP) を作成し、その後 Linux Foundation の Agentic AI Foundation に寄贈しました。これにより、セキュリティ特性がデプロイごとにパッチを当てるのではなく、インフラストラクチャに組み込まれるようになり、統合制御ではなくエージェントの品質に競争が集中するようにします。

Sources

関連