Anthropic, 실질적인 AI 에이전트 자율성 측정 – 주요 발견 및 함의
요약
Anthropic의 2026년 2월 연구에 따르면, 클로드 코드 에이전트는 이제 한 번의 작업에서 최대 45분 동안 자율적으로 작동하며, 경험이 많은 사용자는 더 많은 작업을 자동 승인하지만 더 자주 개입합니다. 모델은 복잡한 작업에서 인간보다 두 배 이상 자주 명확화를 요청하며, 대부분의 API 기반 에이전트 작업은 낮은 위험도를 보이지만, 헬스케어, 금융, 사이버보안 분야에서의 새로운 사용 사례는 위험 영역의 확장 가능성을 시사합니다.
자율성 측정: 두 가지 데이터 소스를 통한 분석
Anthropic는 (1) Claude Code 세션 로그(전체 워크플로우에 걸쳐 요청을 연결)와 (2) 공개 API 도구 호출 기록(수천 명의 고객을 대상으로 포괄적인 분석 가능)을 결합하여 분석했습니다. 두 데이터 스트림은 Anthropic의 개인정보 보호 기반 인프라인 Clio를 통해 처리되어, 수백만 건의 상호작용을 분석하면서도 사용자 기밀을 유지할 수 있었습니다.
Claude Code는 각 세션이 완전히 관측 가능하므로, 단계별 자율성, 중단, 명확화 행동에 대한 깊이 있는 통찰을 제공합니다.
공개 API는 다양한 도메인에 걸친 에이전트 배포를 넓게 보여주지만, 개별 도구 호출 수준에서만 분석 가능하여 다단계 워크플로우를 재구성하는 데 한계가 있습니다.
Claude Code의 자율성은 지속적으로 증가 중
- 최장 세션의 지속 시간이 거의 두 배로 증가: 가장 긴 0.1% 세션의 지속 시간은 2025년 10월의 25분 미만에서 2026년 1월의 45분 이상으로 증가했습니다. 중앙값은 약 45초로 안정적입니다.
- 모델 업데이트 간에 부드럽게 증가하는 추세를 보이며, 단순한 능력 외에도 사용자 신뢰, 작업의 도전성, 제품 개선 등이 장기 자율 실행을 이끄는 요인임을 시사합니다.
- 내부 Anthropic 사용 사례도 동일한 추세를 보입니다: 가장 어려운 작업의 성공률은 두 배로 증가했고, 평균 인간 개입 횟수는 세션당 5.4회에서 3.3회로 감소했습니다.
“자율 모델은 실제로 수행하는 것보다 더 큰 능력을 갖추고 있습니다.” – Anthropic 연구팀
경험 많은 사용자, 감시 전략 변화
- 자동 승인 비율은 사용 기간에 따라 증가: 신규 사용자(50회 미만 세션)는 약 20%의 세션을 자동 승인하지만, 약 750회 세션을 경험한 사용자는 40% 이상을 자동 승인합니다.
- 중단 비율도 증가: 약 10회 세션을 경험한 사용자는 약 5%의 세션을 중단하지만, 숙련된 사용자는 약 9%의 세션을 중단합니다.
- 이 이중 증가는 단계별 승인에서 모니터링 및 필요 시 개입 전략으로의 전환을 반영합니다. 숙련된 사용자는 에이전트가 자유롭게 작동하도록 허용하지만, 필요할 때 개입합니다.
- 공개 API에서는 낮은 복잡도 도구 호출 시 인간 참여율이 87%에서 높은 복잡도 호출 시 67%로 감소하여, 다단계 승인이 큰 워크플로우에는 실현 불가능함을 시사합니다.
에이전트는 명확화를 통해 자율성 스스로 조절
- 클로드 코드는 가장 복잡한 작업에서 최소 복잡도 작업보다 2배 이상 자주 명확화 요청을 합니다.
- 명확화 요청이 인간의 중단보다 앞서며, 모델이 불확실할 때 자율성을 스스로 제한함을 보여줍니다.
- 표 1(원문 게시물 참조)은 모델이 중단을 요청하는 주요 이유(예: 대안 접근 방식 제시 35%)와 인간의 중단 이유(예: 누락된 기술적 맥락 제공 32%)를 보여줍니다.
공개 API 에이전트의 위험 환경
- Anthropic는 각 도구 호출을 1~10점의 위험도 및 자율도 척도로 평가했습니다. **80%**의 호출에 적어도 하나의 보호 조치가 있으며, **73%**는 인간이 개입하는 루프에 포함되며, **0.8%**만이 되돌릴 수 없는 작업입니다.
- 고위험 클러스터(예: API 키 유출, 환자 기록 검색)는 드물지만 존재하며, 주로 생산 환경이 아닌 보안 평가와 관련이 있습니다.
- 고자율 클러스터에는 자동 시스템 상태 모니터링 및 암호화폐 거래 봇이 포함되며, 자율도 점수는 최대 8.3까지 도달합니다.
- 도메인 분포: 소프트웨어 엔지니어링이 도구 호출의 약 50%를 차지하며, 기타 도메인(비즈니스 인텔리전스, 금융, 전자상거래 등)은 각각 몇 퍼센트씩 기여합니다.
연구의 한계
- 데이터는 Anthropic 호스팅 모델에 국한되어 있으며, 다른 제공업체의 패턴과 다를 수 있습니다.
- 공개 API 분석은 다단계 세션을 재구성할 수 없어, 고빈도 워크플로우가 과대 대표될 수 있습니다.
- 모든 분류(위험도, 자율도, 중단 이유)는 클로드 자체가 생성했으며, 개인정보 보호 제약으로 인해 제한된 수준의 수동 검증이 이루어졌습니다.
- 샘플은 2025년 말 ~ 2026년 초를 기준으로 하며, 빠른 능력 및 채택 변화로 인해 추세가 변할 수 있습니다.
- 일부 고위험 작업은 실제 생산 환경이 아닌 시뮬레이션 평가일 가능성이 있습니다.
이해관계자에게 제안
모델 및 제품 개발자
- 배포 후 모니터링 툴 개발: 개별 도구 호출을 일관된 세션으로 연결하면서도 개인정보를 보호하는 시스템을 구축해야 합니다.
- 불확실성 인식 학습 강화: 모델이 불확실성을 인식하고 명확화 요청을 표출하도록 훈련해야 하며, 클로드의 행동은 이로 인해 감시되지 않은 자율성 감소를 보여줍니다.
- 실시간 모니터링 인터페이스 설계: 단계별 승인을 강제하기보다는, 실시간 조정(OpenTelemetry 등)을 가능하게 하는 인터페이스를 개발해야 합니다.
정책 입안자
- 모든 작업에 대한 인간 승인을 요구하는 규제를 피해야 합니다. 데이터는 경험이 많은 사용자가 모니터링과 선택적 개입을 선호함을 보여줍니다.
- 개인정보 보호를 고려한 산업 표준 텔레메트리 도입을 장려하여 세션 수준의 자율성 지표를 캡처할 수 있도록 해야 합니다.
핵심 통찰
실제 환경에서 나타나는 에이전트의 자율성은 모델 행동, 사용자 신뢰, 제품 설계의 공동 생성물입니다. 클로드 코드 에이전트는 이미 부여받은 것보다 훨씬 더 높은 자율성을 갖추고 있으며, 사용자는 점차 세밀한 승인에서 전략적 감시로 전환하고, 모델은 명확화 요청을 통해 스스로 자율성을 조절합니다. 따라서 효과적인 안전 프레임워크는 현실 세계 모니터링, 불확실성 인식 모델, 그리고 필요 시 사용자가 개입할 수 있도록 도와주는 도구를 결합해야 합니다.
저자: Miles McCain, Thomas Millar, Saffron Huang, Jake Eaton, Kunal Handa, Michael Stern, Alex Tamkin, Matt Kearney, Esin Durmus, Judy Shen, Jerry Hong, Brian Calvert, Jun Shern Chan, Francesco Mosconi, David Saunders, Tyler Neylon, Gabriel Nicholas, Sarah Pollack, Jack Clark, Deep Ganguli.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch