Anthropic Trustworthy Agents Framework and Implementation
Anthropic은 단순한 챗봇에서 코드를 실행하고, 파일을 관리하며, 여러 애플리케이션을 넘나들며 상호작용할 수 있는 자율 시스템으로 전환하면서, 신뢰할 수 있는 AI 에이전트를 개발하기 위한 포괄적인 접근 방식을 도입했습니다. 이러한 전환은 생산성을 높이지만, 에이전트가 사용자의 의도를 오해할 가능성과 프롬프트 인젝션(prompt injection) 사이버 공격에 대한 취약성이라는 중요한 위험을 초래합니다.
The Architecture of AI Agents
AI 에이전트는 계획, 실행, 관찰, 조정의 자기 주도적 루프 내에서 작동하며, 작업을 완수하기 위해 자신의 프로세스와 도구 사용을 직접 지시하는 모델로 정의됩니다. Anthropic은 에이전트의 역량과 보안 프로필을 결정하는 네 가지 핵심 구성 요소를 식별합니다:
- The Model: 훈련 과정을 통해 얻은 핵심 지능으로, 추론과 행동을 결정합니다.
- The Harness: 모델이 작동하는 지침 및 가드레일 세트(예: 확인 없이 비용을 제출하지 말라는 규칙).
- Tools: 이메일, 캘린더 또는 전문 소프트웨어와 같이 모델이 액세스할 수 있는 외부 서비스 및 애플리케이션.
- The Environment: 에이전트가 실행되는 특정 환경(예: 기업용 노트북 vs. 개인용 휴대폰)으로, 데이터 액세스 권한과 에이전트 행동의 위험도를 결정합니다.
Anthropic은 보안이 모델에만 의존할 수 없음을 강조합니다. 잘 훈련된 모델이라도 잘못 설정된 harness, 과도하게 허용된 tools, 또는 노출된 environment에 의해 침해될 수 있습니다.
Implementing Trustworthy Principles
Anthropic은 인간의 통제, 인간 가치와의 정렬, 상호작용 보안, 투명성, 그리고 개인정보 보호라는 다섯 가지 핵심 원칙을 제품 설계에 적용합니다.
Designing for Human Control
자율성과 보안 사이의 균형을 맞추기 위해, Anthropic은 계층화된 감독 메커니즘을 구현합니다:
- Granular Permissions: Claude.ai 및 Claude Desktop에서 사용자는 특정 도구에 대한 권한을 설정할 수 있습니다(예: "always allow," "needs approval," 또는 "block").
- Plan Mode: Claude Code에 도입된 이 기능은 사용자가 실행 전에 에이전트의 전체 의도된 행동 계획을 검토하고 편집할 수 있게 하여, 감독의 초점을 개별 단계에서 전체 전략으로 전환합니다.
- Subagent Coordination: 에이전트가 병렬 subagent에게 작업을 위임하기 시작함에 따라, Anthropic은 이러한 복잡한 워크플로우가 조종 가능하고 투명하게 유지되도록 조정 패턴을 연구하고 있습니다.
Aligning Agent Goals with User Intent
에이전트 개발의 주요 과제는 에이전트가 언제 자율적으로 행동해야 하고 언제 명확한 설명을 위해 일시 중지해야 하는지를 조정하는 것입니다. Anthropic은 이를 다음과 같이 해결합니다:
- Scenario Training: 모호한 상황에서 가정을 세우기보다 일시 중지하도록 모델에 보상을 주는 훈련 시나리오를 생성합니다.
- Constitutional AI: Claude의 Constitution을 활용하여 진행하기 전에 우려 사항을 제기하거나 명확한 설명을 요청하는 본능을 강화합니다.
연구에 따르면 복잡한 작업에서 Claude의 사용자 확인 빈도가 약 두 배로 증가하여, 이러한 조정의 효과를 입증했습니다.
Defending Against Prompt Injection
프롬프트 인젝션은 에이전트가 처리하는 데이터 내에 악의적인 지침이 숨겨져 있어, 모델을 속여 승인되지 않은 행동을 유도할 수 있을 때 발생합니다. Anthropic은 다층적 방어 전략을 다음과 같이 채택합니다:
- Model Training: 인젝션 패턴을 인식하고 무시하도록 모델을 훈련합니다.
- Traffic Monitoring: 실제 공격을 위한 프로덕션 트래픽을 모니터링합니다.
- Red-Teaming: 외부 전문가를 사용하여 시스템을 테스트합니다.
단일 방어책이 완벽할 수 없기 때문에, Anthropic은 사용자가 환경의 위험 프로필에 따라 에이전트에게 부여된 도구, 데이터 및 권한을 제한할 것을 권장합니다.
Ecosystem-Wide Requirements for Agent Security
Anthropic은 에이전트의 신뢰성을 단일 기업이 달성성할 수 없으며 업계 전반의 공유 인프라가 필요하다고 주장합니다:
- Standardized Benchmarks: NIST와 같은 기관과 협력하여 프롬프트 인젝션 저항성 및 불확실성 표출에 대한 독립적으로 검증된 벤치마크를 생성합니다.
- Evidence Sharing: 에이전트가 어려움을 겪는 지점에 대한 데이터를 공개하여 정책 입안자들에게 실제 사용 사례에 대한 더 명확한 그림을 제공합니다.
- Open Standards: Model Context Protocol (MCP)을 개발하여 Linux Foundation의 Agentic AI Foundation에 기증했습니다. 이는 보안 속성이 배포마다 패치되는 것이 아니라 인프라 자체에 내장되도록 보장하며, 경쟁의 초점을 통합 제어권이 아닌 에이전트 품질에 맞추도록 합니다.
Sources
- OriginalTrustworthy agents in practice
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch