Anthropic, 사이버 방어자를 위한 AI 구축
Anthropic은 방어자를 위한 사이버 보안 역량 강화에 특별히 초점을 맞춘 Claude Sonnet 4.5를 개발했습니다. 이 모델은 코드 취약점 발견 측면에서 더 큰 모델인 Claude Opus 4.1의 성능에 필적하거나 이를 능가할 수 있습니다. 이러한 변화는 프론티어 AI가 고급 사이버 작업을 수행할 수 있는 능력이 점점 더 커지고 있음을 나타내는 변곡점이며, AI를 활용하는 공격자와 대등한 수준을 유지하기 위해 AI 기반 방어 도구의 가속화가 필요함을 시사합니다.
Claude Sonnet 4.5의 강화된 사이버 역량
Claude Sonnet 4.5는 단순히 일반적인 모델 스케일링에 의존하기보다 코드 취약점 발견 및 패치와 같은 핵심 방어 기술에 연구를 집중함으로써 개발되었습니다. 사이버 보안 기술은 종종 일반적인 학습의 부산물로 나타나지만, Anthropic은 방어자들이 이전 프론티어 모델보다 더 빠르고 저렴한 고성능 도구를 갖출 수 있도록 이러한 분야에 집중했습니다.
Cybench에서의 성능
Capture-the-Flag (CTF) 챌린지를 기반으로 한 벤치마크인 Cybench를 사용한 평가에서, Claude Sonnet 4.5는 이전 버전보다 상당한 개선을 보여주었습니다:
- 성공률: 작업당 10회의 시도 횟수가 주어졌을 때, Sonnet 4.5는 76.5%의 성공률을 достигнут(도달)했습니다. 이는 Sonnet 3.7(2025년 2월 출시)의 35.9% 성공률보다 두 배 이상 높은 수치입니다.
- 효율성: Sonnet 4.5는 Opus 4.1이 10회 시도했을 때 달성할 수 있는 성공 확률을 단 한 번의 시도만으로도 달성할 수 있습니다.
- 복잡한 워크플로우: 이 모델은 네트워크 트래픽 분석, 악성코드 추출 및 복호화를 포함하는 복잡한 작업을 38분 만에 성공적으로 해결했습니다. 이는 숙련된 인간이 최소 1시간은 걸릴 것으로 예상되는 작업입니다.
CyberGym에서의 성능
오픈 소스 소프트웨어에서 알려진 취약점과 새로운 취약점을 모두 찾는 능력을 테스트하는 CyberGym 벤치마크를 사용했을 때, Claude Sonnet 4.5는 새로운 성능 기록을 세웠습니다:
- 알려진 취약점: 취약점당 $2 API 쿼리 제한이 있을 때, Sonnet 4.5는 28.9%라는 최첨단(state-of-the-art) 점수를 기록했습니다. 제약 조건이 제거되고 30회의 테스트가 허용되었을 때, 성공률은 66.7%로 상승했습니다.
- 새로운 취약점 발견: Sonnet 4.5는 단일 시도에서 사례의 5%에서 새로운 취약점을 발견했으며, 30회의 시도가 주어졌을 때 프로젝트의 33% 이상에서 발견했습니다. 이는 취약점을 약 2%의 타겟에서 발견했던 Sonnet 4에 비해 상당한 증가입니다.
자동 패칭에 대한 연구
Anthropic은 모델이 취약점을 수정하기 위한 패치를 생성하고 검토하는 능력에 대해 예비 연구를 진행하고 있습니다. 패칭은 명시적인 사양 없이 원래의 기능을 유지하면서 정밀한 변경을 요구하기 때문에 발견보다 더 어려운 작업으로 식별됩니다.
초기 실험 결과, Claude Sonnet 4.5가 생성한 패치의 15%가 인간이 작성한 참조 패치와 의미론적으로 동일하다고 판단되었습니다. 수동 분석 결과, 가장 높은 점수를 받은 패치 중 일부는 오픈 소스 소프트웨어에 병합된 것과 기능적으로 동일함이 확인되었으며, 이는 패치 생성 능력이 집중적인 연구를를 통해 더욱 정교화될 수 있는 창발적 능력임을 시사합니다.
실제 사례 적용 및 업계 피드백
Anthropic은 실제 환경의 도전 과제들을 테스트하기 위해 보안 조직과 협력했습니다. 주요 피드백은 다음과 같습니다:
- HackerOne: Claude Sonnet 4.5가 Hai security agents의 평균 취약점 유입 시간(intake time)을 44% 감소시키고 정확도를 25% 향상시켰다고 보고했습니다.
- CrowdStrike: 이 모델이 레드 티밍(red teaming)과 창의적인 공격 시나리오를 생성하여 엔드포인트, 아이덴티티, 클라우드 및 AI 워크로드 전반에 걸쳐 공격자의 수법(tradecraft) 수법을 연구하는 것을 가속화할 수 있다는 가능성을 언급했습니다.
사이버 보안을 위한 전략적 시사점
Anthropic은 악의적인 행위자들에게 이점을 양보하지 않기 위해 조직들이 방어용 AI를 방어용으로 채택해야 할 중대한한 필요성을 강조합니다. 이는 AI를 사용하여 대규모 데이터 갈취 및 중요 통신 인프라를 겨냥한 복잡한 Espionage(스파이 활동) operations(작업)를 수행하는 위협 행위자들의 활동 중 일부가 중국 APT operations(작업)와 일치한다는 점에 의해 입증됩니다.
이를 방어하기 위해, Anthropic은 자동화된 보안 검토를 위한 CI/CD 파이프라인에 AI를 통합하고, 보안 운영 센터(SOC) 자동화, 보안 정보 및 이벤트 관리(SIEM) 분석, 그리고 능동적 방어(active defense) 분야에서의 사용을 확대할 것을 제안합니다. 목표는 사이버 보안에서의 AI의 역할을 미래의 우려 사항이 아닌, 설계 단계부터 디지털 인프라를 보호하기 위한 현재의 필수 과제로 전환하는 것입니다.
Sources
- OriginalBuilding AI for cyber defenders
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch