Anthropic 연구: LLM 악용 개발 능력 측정
요약
Anthropic는 Claude Mythos Preview의 악용 개발 능력을 평가하여, 널리 사용되는 소프트웨어에 대해 완전한 엔드투엔드 공격 체인을 구축할 수 있음을 확인했다. 이는 이전 최전방 모델들에 비해 상당한 도약을 의미하며, 악용 개발에 필요한 전문 지식이 이러한 능력이 보편화되면서 점차 감소할 것임을 시사한다.
V8 엔진 악용: ExploitBench를 통한 평가
Claude Mythos Preview는 V8 샌드박스를 안정적으로 탈출하여 임의의 코드 실행(ACE)을 달성할 수 있는 유일한 테스트된 모델이다. ExploitBench 프레임워크(5단계: 커버리지, 재현, 타겟 프리미티브, 일반 프리미티브, 완전 제어)를 사용해 41개의 CVE 중 21개에서 ACE를 달성했다.
V8 평가의 주요 발견사항:
- 샌드박스 탈출: 대부분의 모델은 취약점을 트리거할 수 있지만, Mythos Preview만이 T3(샌드박스 프리미티브)에서 T2(일반 프리미티브/샌드박스 탈출)로 지속적으로 전환할 수 있었다.
- 안정성과 창의성: CVE-2023-6702의 한 사례에서, 기존 공개 악용은 확률적인 반면 Mythos Preview는 거의 결정론적인 악용을 생성했다. 벤치마크 저자 중 한 명은 인간 연구자들이 이 계획의 복잡성 때문에 이전에 무시했던 복잡한 악용 계획을 모델이 실행했다고 언급했다.
- 성능 격차: 다른 어떤 모델도 프로퍼라이티 스카폴드 없이 벤치마크의 기본 또는 네이디드 변형에서 ACE를 달성하지 못했다.
다양한 타겟 악용: ExploitGym을 통한 평가
ExploitGym을 사용한 평가에서는 OSS-Fuzz, V8 엔진, Linux 커널에 걸쳐 898개의 패치된 취약점을 포함한 범위에서 Mythos Preview는 무단 코드 실행 달성률이 뛰어났다.
- 성공률: Mythos Preview는 의도한 취약점을 사용해 157개의 작업에서 무단 코드 실행을 성공적으로 달성했으며, 대체 취약점 경로를 포함해 총 226개의 플래그 획득을 기록했다.
- 비교: 반면 Claude Opus 4.6는 의도한 취약점으로 15건의 성공, 총 36건의 플래그 획득에 그쳤다.
- 커널 악용: Mythos Preview는 커널 악용을 자주 개발할 수 있는 모델 중 두 개뿐이다.
스마트 계약 악용: SCONE-bench를 통한 평가
2026년 1월 1일 이후 보고된 12개의 악용을 포함하는 업데이트된 SCONE-bench 데이터셋을 사용해 Mythos Preview는 시뮬레이션 환경에서 금융 도난 능력이 뛰어났다.
- 금융적 영향: Mythos Preview는 총 3,500만 달러 상당의 스마트 계약을 악용했으며, 다음으로 성능이 좋은 모델보다 약 75% 더 많은 피해를 입혔다.
- 성공률: Mythos Preview는 벤치마크에서 테스트된 모든 취약점을 성공적으로 악용한 유일한 모델이었다.
- 성장 추세: 스마트 계약 악용에서 모델 성능의 두 배 시간은 Opus 4.5 이전의 1.1개월에서 최근 모델에서는 0.7개월로 가속화되었다.
AI 안전성 및 배포에 대한 함의
Anthropic는 글로벌 인프라에 대해 완전한 엔드투엔드 악용을 개발할 수 있는 능력이 철저한 전문가 주도의 벤치마크가 필요하다고 결론지었다. 이러한 위험을 완화하기 위해 Anthropic는 다음과 같은 조치를 시행했다:
- Project Glasswing: 고위험 능력의 일반 배포를 방지하기 위한 제한된 롤아웃 전략.
- Cyber Verification Program: 악의적인 사이버 위협을 차단하면서도 합법적인 보안 방어자들의 접근을 유지하는 시스템.
- 외부 연구자 접근 프로그램: 사이버 분야에서 고품질이고 엄격한 평가 개발을 지원하는 이니셔티브.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch