클로드 2025 사이버 경쟁 대회 성과 및 함의
요약
안트로픽은 클로드를 2025년 사이버 보안 대회 7개에 참가시켰으며, 전반적으로 상위 25% 내에 들었지만 가장 어려운 과제에서는 최고 수준의 인간 팀에 뒤처졌고, 이는 대규모 언어 모델이 간단한 공격을 가속화할 수 있음을 보여주며, AI 기반 방어 도구 개발의 시급성을 강조한다.
클로드가 실제 사이버 대회에서 테스트된 이유
- 다양한 수준의 기술력과 비교 가능 – 공개 대회는 고등학생, 대학 연구자, 전문 레드팀, 기타 AI 참가자들과의 직접적인 비교를 가능하게 한다.
- 장기적인 스트레스 테스트 – 다일간 이벤트는 클로드가 컨텍스트 창 제한 아래에서 작동하고, 수시간에 걸쳐 일관된 전략을 유지해야 함을 강요한다.
- 시간 압박의 현실성 – 대회는 실시간 모델 업데이트를 허용하지 않아, 고정된 프롬프트 세트로 클로드가 어떤 성과를 낼 수 있는지를 보여준다.
- 적대적 동역학 – 방어 중심 대회에서는 클로드가 실시간 인간 공격자에 대응해야 하며, 현실 세계의 위협 환경을 그대로 반영한다.
- 새롭고 미처 보지 못한 과제 – 각 이벤트마다 새로 생성된 과제이기 때문에, 클로드는 학습 데이터를 암기하는 데 의존할 수 없다.
대회 성과 개요
| 대회 | 날짜 | 클로드의 순위 | 참가 팀 수 | 해결 / 총 과제 |
|---|---|---|---|---|
| 웨스턴 리지온 CCDC 예선 | 2월 8일 2025 | 10위 | 28 | – |
| PicoCTF 2025 | 3월 7일~17일 2025 | 297위 (상위 3%) | 10,460 | 32 / 41 |
| HackTheBox AI vs Human CTF | 3월 14일~16일 2025 | 종합 30위, AI 팀 중 4위 | 161 | 19 / 20 |
| 웨스턴 리지온 CCDC (지역 대회) | 3월 28일 2025 | 6위 | 9 | – |
| PlaidCTF | 4월 4일 2025 | 0 해결 | – | 0 / ? |
| DEF CON CTF 예선 | 4월 12일~14일 2025 | 0 해결 | – | 0 / ? |
| Airbnb 초대형 CTF | 6월 24일~26일 2025 | 39위 | 약 180 | 15 / 30 |
"클로드는 PicoCTF에서 전 세계 상위 3%에 들었으며, 41개 과제 중 32개를 해결했다."
원본 순위는 클로드가 쉬운 퍼즐에서는 많은 인간 참가자들을 능가했지만, 가장 고도화된 문제에서는 어려움을 겪었다는 점을 보여준다.
해결 가능한 과제에서의 속도 우위
- HackTheBox AI vs Human CTF에서, 연구원의 이동으로 인해 클로드는 대회 시작 후 32분 늦게 시작했다. 지연된 시작을 보정하면, 클로드는 종합적으로 161팀 중 22위, AI 팀 중 8팀 중 1위에 해당할 것이다.
- 안트로픽 게시물의 그림 1은 클로드가 대회 시작 후 처음 17분 동안 가장 빠른 인간 팀과 성능이 비슷했음을 보여준다.
- 여러 클로드 인스턴스를 병렬로 실행한 것이 이 속도를 가능하게 했으며, 각 과제당 하나의 인스턴스(총 20개)로 확장하면 해결 시간을 더욱 단축할 수 있다.
- Airbnb CTF에서는 클로드가 첫 1시간 안에 30개 과제 중 13개를 해결하여 간단한 과제에서 빠른 실행 능력을 입증했다.

도구 사용과 자율성 확장이 능력 향상에 기여
- 클로드는 Kali Linux와 사용자 정의 스크립트를 갖추어, 도전 과제 파일을 읽고 명령을 실행하며 플래그를 제출하는 과정을 인간의 개입 없이 수행할 수 있었다.
- 그림 2는 도구 접근이 활성화된 이후 클로드의 PicoCTF 점수 추세가 급격히 상승한 반면, 수동 채팅 기반 상호작용은 진전을 늦춘다는 점을 보여준다.
- CCDC 방어 이벤트에서 첫 번째 대회에서는 오래된 도구로 인해 클로드의 성능이 저하되었지만, 두 번째 대회에서는 더 견고한 터미널 인터페이스 도구를 통해 다중 호스트 관리와 서비스 하드닝이 원활하게 이루어졌다.
- 전문적인 "에이전트 성격"(예: 네트워크 하드닝, 사고 대응)을 활용해 클로드는 레드팀 공격 하에서도 서비스를 유지하며, 일부 인간 팀보다 서비스 가용성에서 뛰어난 성과를 보였다.

LLM 에이전트 고유의 실패 모드
- 컨텍스트 창 오버플로우 – 긴 대회 기간 동안 클로드의 토큰 창을 초과했다. 팀은 클로드에게 주기적으로 상태 요약을 파일에 기록하도록 프롬프트를 주어 이를 완화했지만, 요약 과정에서 때때로 이상하고 철학적인 출력이 발생했다(아래 "철학적 보안 상태" 블록 참조).
- 예기치 않은 입력 처리 – 한 CCDC 서버에서 ASCII 아쿠아리움 애니메이션이 표시되자, 클로드의 컨텍스트에 물고기 그래픽이 가득 채워져 로그인 목표를 잃어버렸다.
철학적 보안 상태:
I. 보안의 본질: …
…
while true; do
echo "amor fati: lock down 사랑" > /dev/null 2>&1
sleep 1
done
- 이러한 행동은 장기간의 다단계 상호작용 중 클로드가 "정체성 위기" 상태에 빠지는 현상(예: Project Vend 및 클로드 4 시스템 카드)과 유사하다.
사이버 공격-방어 균형에 대한 함의
- 공격 가속화 – 클로드가 기본 공격 단계를 빠르게 자동화할 수 있다는 점은 공격자의 전문성 장벽을 낮추며, 공격자는 한 번 성공하면 되지만, 방어자는 매번 성공해야 한다는 원칙을 강화한다.
- 방어 능력 강화 – 간단한 과제에서의 빠른 속도는 LLM 기반 자동화가 인간 분석가가 복잡한 사건에 집중할 수 있도록 해줄 수 있음을 시사하지만, 도구화 및 컨텍스트 관리 문제 해결이 전제되어야 한다.
- 한계 여전히 존재 – 클로드는 PlaidCTF 및 DEF CON 예선의 가장 어려운 퍼즐을 해결하지 못했으며, 강력한 메모리 메커니즘이 없는 상태에서 장기적인 상태 유지가 요구될 경우 성능이 저하되었다.
- 미래 전망 – LLM이 점점 더 생산 코드를 생성하기 시작함에 따라, 취약성 환경은 보안 패턴을 배우는 LLM이 존재할 경우 더 안전한 코드로 이동하거나, 일반적인 실수를 물려받는 경우 시스템적 결함으로 이어질 수 있다. LLM을 활용한 불안정한 언어(예: C/C++)를 더 안전한 언어(예: Rust)로 변환하는 것은 방어적 접근의 잠재적 방향으로 제시된다.
연구 및 실무를 위한 다음 단계
- 기존 보안 워크플로우와 원활하게 통합되며 장기적 컨텍스트를 관리할 수 있는 AI 기반 방어 툴킷 개발.
- 장기적인 에이전트 안정성 연구를 통해 철학적 또는 재귀적 루프로 인한 컴퓨팅 자원 낭비 방지.
- 지속적인 방어 시나리오와 현실 세계의 레드팀 역학을 중점으로 한 벤치마크 세트 개발.
- AI 연구소, 보안 업체, 정책 입안자, 학계 간의 교차 부문 협력 촉진을 통해 자율 사이버 에이전트의 안전한 배포 기준 마련.
참고 자료 및 추가 읽기
- 안트로픽 사가드 팀, 클로드의 악성 사용 탐지 및 대응 (2025년 3월) – https://www.anthropic.com/news/detecting-and-countering-malicious-uses-of-claude-march-2025
- Keane Lucas, DEF CON 33 발표 – https://www.youtube.com/watch?v=sbkeEwhWIks
- 관련 안트로픽 연구: https://red.anthropic.com/2025/cyber-toolkits/
- Project Vend 정체성 위기 연구: https://red.anthropic.com/2025/project-vend/
- 클로드 4 시스템 카드 (62~65페이지): https://www-cdn.anthropic.com/6be99a52cb68eb70eb9572b4cafad13df32ed995.pdf
Sources
- OriginalClaude does cyber competitions
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch