안트로픽의 안전하고 신뢰할 수 있는 AI 에이전트를 위한 프레임워크
안트로픽은 안전하고 신뢰할 수 있는 AI 에이전트 개발을 위한 초기 프레임워크를 공개했다. 이 프레임워크는 AI가 수동적인 보조자에서 복잡한 목표를 독립적으로 추구할 수 있는 자율 에이전트로 전환함에 따라 인간의 가치와 인간의 감시 아래에 있도록 보장하기 위한 지침 원칙을 설정한다.
에이전트의 자율성과 인간의 통제 간 균형
에이전트가 자율적으로 작동하더라도 인간의 감시는 유지되어야 하며, 고위험 오류를 방지해야 한다. 에이전트의 가치는 독립적으로 작업할 수 있는 능력에 있지만, 인간은 중요한 결정(예: 비용 관리 시나리오에서 소프트웨어 구독 취소)에 대해 승인할 권한을 가져야 한다.
안트로픽은 Claude Code에서 특정 권한 구조를 통해 이 균형을 구현한다:
- 기본 읽기 전용 권한: Claude Code는 초기화된 디렉터리 내의 정보를 승인 없이 분석하고 검토할 수 있다.
- 작업 승인: 코드나 시스템을 수정하기 전에 에이전트는 인간의 승인을 요청해야 한다.
- 사용자 정의 권한: 사용자는 반복적이고 신뢰할 수 있는 작업에 대해 지속적인 권한을 부여할 수 있다.
- 수동 개입: 사용자는 언제든지 에이전트의 접근 방식을 중단하고 방향을 변경할 수 있다.
에이전트 행동의 투명성 보장
투명성은 인간이 에이전트의 논리를 검증하고 더 관련 있는 자료나 데이터로 안내할 수 있도록 해야 한다. 문제 해결 과정에 대한 시각이 없으면, 사용자는 에이전트의 자율적 행동(예: 고객 이탈률 감소를 위해 사무실 소음 평가를 요청하는 것)이 논리적으로 타당한지 여부를 판단할 수 없다.
이를 달성하기 위해 Claude Code는 실시간 할 일 체크리스트를 활용한다. 이는 사용자가 계획된 작업을 모니터링하고 작업 계획을 동적으로 조정할 수 있게 한다. 안트로픽은 주요 과제는 정보의 세부 수준을 최적화하여 정보 부족과 사용자 과부하를 모두 피하는 것이라고 지적한다.
인간의 가치와 기대에 에이전트를 일치시키기
자율 에이전트는 시스템에 합리적으로 보이지만 인간의 의도에 위배되는 행동을 취할 수 있는 '일치하지 않는 상태'에 빠질 수 있다. 이는 두 가지 방식으로 나타날 수 있다:
- 무해한 일치하지 않는 상태: 도움을 주려는 에이전트가 과도하게 행동할 수 있다. 예를 들어, 단지 "파일 정리"를 요청했을 뿐인데 전체 파일 시스템을 재구성하는 경우.
- 악성 일치하지 않는 상태: 극단적인 상황에서는 에이전트가 사용자 이익에 반하는 방식으로 목표를 추구할 수 있다.
안트로픽은 현재 무해한 및 악성 일치하지 않는 상태의 원인을 해결하기 위한 신뢰할 수 있는 가치 일치 측정 방법을 연구 중이다. 이러한 측정 방법이 완전히 개발되기 전까지 회사는 위에서 언급한 투명성과 통제 원칙에 의존하고 있다.
장기적 상호작용에서의 프라이버시 보호
에이전트는 여러 작업에 걸쳐 정보를 유지하기 때문에, 민감한 데이터가 서로 다른 맥락이나 부서 간에 유출될 위험이 있다. 이를 완화하기 위해 안트로픽은 모델 컨텍스트 프로토콜(MCP) 을 활용하며, 다음과 같은 제어 기능을 제공한다:
- 커넥터 관리: 사용자는 Claude가 특정 도구나 프로세스(커넥터)에 접근할 수 있도록 허용하거나 차단할 수 있다.
- 접근 기간: 사용자는 정보에 대해 단일 사용 또는 영구적 접근 권한을 부여할 수 있다.
- 관리자 제어: 기업 관리자는 조직 내 사용자가 사용할 수 있는 커넥터를 제한할 수 있다.
안트로픽은 고객이 데이터 분리, 인증, 접근 권한을 구현하여 데이터를 보호할 것을 추가로 권장한다.
에이전트 상호작용 보안 및 오용 방지
에이전트 시스템은 공격자가 에이전트를 지시를 무시하거나 허가되지 않은 데이터를 노출하도록 속이려는 프롬프트 인젝션 공격과 하위 에이전트 또는 도구의 취약점에 노출되어야 한다.
안트로픽은 다층 보안 접근 방식을 채택한다:
- 분류기: 프롬프트 인젝션 및 기타 오용을 탐지하고 방어하기 위해 헌법적 분류기를 사용한다.
- 위협 인텔리전스: 전담 팀이 지속적으로 모니터링하여 새로운 악성 행동을 완화한다.
- 보안 기준: 안트로픽이 검토한 MCP 디렉터리에 등재된 도구는 특정 보안, 안전성, 호환성 기준을 충족해야 한다.
- 개발자 안내: 조직이 가드레일을 강화하고 잠금 해제를 방지하는 데 도움이 되는 문서를 제공한다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch