Mythos와 curl 취약점 탐색: AI의 과장 vs. 현실
2026년 4월, Anthropic은 새로운 AI 모델인 Mythos가 소스 코드의 보안 결함을 식별하는 데 "dangerously good"하다고 주장하며 상당한 미디어의 관심을 끌었습니다. 이러한 열풍이 너무나 뜨거워 Anthropic은 일반 공개를 제한하고, 일반 출시 전에 중요한 문제를 해결할 수 있도록 소수의 기업에만 모델을 조금씩 공개했습니다. 많은 이들에게 이는 소프트웨어 보안의 미래에 대한 실존적 공포를 불러일으켰고, 다른 이들에게는 마케팅의 정석처럼 보였습니다.
curl의 리드 개발자인 Daniel Stenberg은 최근 이러한 주장을 테스트할 기회를 가졌습니다. Linux Foundation과 project Alpha Omega를 통해, curl은 "magic model"이 세계에서 가장 면밀히 조사되는 C 코드베이스 중 하나인 curl의 취약점을 찾아낼 수 있는지 확인하기 위해 Mythos로 스캔되었습니다.
The Challenge: Scanning a "Polished" Codebase
Mythos 스캔 결과를 이해하려면 먼저 curl의 특성을 이해해야 합니다. 약 176,000줄의 C 코드와 660,000단어—War and Peace의 영어판보다 약 12% 더 많은 분량—로 구성된 curl은 배포 측면에서 거대한 프로젝트입니다. curl은 110개 이상의 운영 체제와 28개의 CPU 아키텍처에서 실행되며, 전 세계적으로 200억 개 이상의 인스턴스에 설치되어 있습니다.
더 중요한 것은, curl은 일반적인 코드베이스가 아니라는 점입니다. curl은 OSS-Fuzz, Coverity, CodeQL 및 여러 유료 감사를 통해 존재하는 가장 많이 퍼징(fuzzed)되고 감사된 프로젝트 중 하나입니다. Stenberg은 모든 프로덕션 코드 라인이 평균 4.14회 작성되고 다시 작성되었다고 언급합니다. 이러한 수준의 정교함은 AI나 인간 분석가 모두에게 매우 어려운 목표가 됩니다.
The Results: Five Findings, One Vulnerability
Mythos 보고서는 처음에 다섯 개의 "확인된 보안 취약점"을 발견했다고 주장했습니다. 그러나 curl 보안 팀의 심층 분석 결과, 목록은 크게 축소되었습니다:
- 세 개의 위양성(false positives): API 문서에 이미 결함으로 기록된 문제들.
- 한 개의 "그저 버그일 뿐": 보안 취약점 임계값에 도달하지 못한 문제.
- 한 개의 확인된 취약점: 6월 말 curl 8.21.0 출시와 함께 CVE 발행이 예정된 낮은 심각도의 결함.
취약점 외에도 AI는 약 20개의 버그를 식별했습니다. 이것들은 보안 결함은 아니었지만, 명확하게 설명되었으며 현재 수정 중입니다.
AI Hype vs. Technical Reality
이러한 결과를 바탕으로, Stenberg은 Mythos를 둘러싼 "dangerously good"라는 서사는 주로 마케팅이었다고 결론지었습니다. 그는 Mythos가 이전의 AI 도구들보다 훨씬 더 높거나 진보된 수준으로 문제를 식별한다는 증거를 찾지 못했습니다. 사실, curl 프로젝트에서 사용되는 다른 AI 기반 도구들—AISLE, Zeropath, OpenAI의 Codex Security—은 이전에 100~300개 사이의 버그 수정을 유발했으며, 여기에는 12개 이상의 확인된 CVE가 포함되어 있습니다.
하지만 이것이 AI가 비효과적이라는 의미는 아닙니다. Stenberg은 AI 기반 코드 분석기가 전통적인 정적 분석기보다 상당히 더 낫다고 강조합니다. 보안 감사에서 LLM의 가치는 다음과 같은 능력에 있습니다:
- Contextual Awareness (문맥적 인식): 주석이 설명하는 코드의 기능과 코드가 실제로 수행하는 기능 사이의 불일치를 포착함.
- **Cross-Platform Analysis (교차 플랫폼 분석): Checking code for platforms and configurations that are difficult to run in traditional environments. (전통적인 환경에서 실행하기 어려운 플랫폼 및 구성에 대해 코드를 확인함.)
- API and Protocol Knowledge (API 및 프로토콜 지식): 제3자 라이브러리 및 프로토콜 사양에 대한 "지식"을 활용하여 잘못된 가정이나 위반 사항을을 탐지함.
- Communication (커뮤니케이션): 구식 분석기보다 훨씬 덜 지루한 방식으로 결함을 설명하고 요약함.
- Remediation (수정): 식별된 문제에 대한 잠재적인 패치를 생성함.
The Broader Implication for Software Security
Mythos가 curl의 보안을 "깨뜨리지" 못했을 수도 있지만, 더 넓은 교훈은 AI 기반 스캔이 이제 필수적이라는 것입니다. AI를 사용하는 연구원들로부터 쏟아지는 고품질 보안 보고서의 홍수, 즉 "high quality chaos"는 현실입니다.
Hacker News 토론에서 한 커뮤니티 구성원이 언급했듯이, curl이 매우 철저하게 감사된 프로젝트라는 사실은 Mythos의 제한된 발견 사항이 모델의 약점이 아니라 curl의 성의를 증명하는 증거라는 점을입니다. 대부분의 AI로 스캔하지 않은 소프트웨어 프로젝트들은 아마도 놀라운 결과를 보였을 것입니다.
"프로젝트에 AI 코드 분석기를 사용하지 않는다는 것은, 당신이 찾지 못한 결함을 적대적 공격자와 공격자들이 찾아내고 악용할 수 있는 시간과 기회를 제공한다는 것을 의미합니다."
Conclusion
AI는 완전히 새로운 유형의의 취약점을 발견함으로써 보안 분야를 재창조하고 있는 것이 아닙니다. 오히려, 이미 정립된 오류 유형의 새로운 사례를 찾는 데 매우 효율적입니다. curl과 같이 정교한 프로젝트에서는 이득이 미미합니다. 하지만 소프트웨어 생태계의 나머지 부분에서는, AI 기반 분석은 더 이상 무시할 수 없는 중요한 방방어 레이어입니다.