AISLE AI, OpenAI와 Anthropic이 0개를 발견한 후 curl CVE 6개 발견

AISLE의 자율 AI 시스템은 curl에서 이전에 알려지지 않았던 6개의 취약점을 발견했으며, 이는 이후 CVE로 할당되었습니다. 이는 OpenAI와 Anthropic의 프론티어 AI 시스템이 동일한 코드베이스에서 추가적인 발견 사항을 보고하지 않은 이후에 발생했습니다. 이 결과는 "System over Model" 논지를 뒷받침하며, 전문화된 AI 하네스(harness)와 자율 시스템이 실제 제로데이 발견에서 원시 프론티어 모델보다 더 나은 성능을 발휘할 수 있음을 시사합니다.

curl 8.22.0에서 식별된 6개의 새로운 CVE

2026년 8월 24일, curl 창시자 Daniel Stenberg가 Anthropic Mythos와 OpenAI Codex Security가 curl에서 더 이상의 취약점을 발견하지 못했다고 언급한 공개 성명 이후, AISLE은 자율 시스템을 코드베이스에 실행했습니다. AISLE은 29개의 보고서를 제출했으며, 그 중 6개는 curl 보안 팀에 의해 검증되었고 curl 8.22.0 릴리스에서 수정되었습니다.

6개의 취약점 모두 Low severity로 평가되었으며, 이는 curl의 높은 엔지니어링 성숙도를 반영합니다. curl에서 남아있는 결함은 일반적으로 좁은 구성이나 미묘한 상호작용에서 발생합니다. 식별된 CVE는 다음과 같습니다:

  • CVE-2026-80229: OpenSSL provider use-after-free
  • CVE-2026-80230: OpenSSL pinning bypass
  • CVE-2026-80231: native CA store connection reuse
  • CVE-2026-80255: secure attribute bypass with tab
  • CVE-2026-82208: wolfSSL CA-cache hit overrides callback
  • CVE-2026-82209: domain-scoped public-suffix cookie

검증 및 방법론

이 발견 프로세스는 표준 AI 사이버 보안 벤치마크나 Capture-The-Flag (CTF) 챌린지와는 달랐습니다. 왜냐하면 훈련 데이터의 알려진 정답을 목표로 하는 대신 현재 프로덕션 코드를 대상으로 했기 때문입니다. 검증은 외부 도메인 전문가인 curl 유지 관리자가 수행했으며, 이들은 발견 사항이 실제인지 여부를 결정하고 다른 이들은 CVE 지정이 필요한지를 결정했습니다.

Daniel Stenberg의 OpenAI와 Anthropic의 발견 사항 0개 보고는 AISLE의 분석이 시작되기 전에 타임스탬프가 찍혀 공개되었으므로, 이 비교는 제로데이 발견을 위한 검증된 베이스라인을 제공합니다.

더 넓은 범위의 영향 및 Linux 커널 관찰 사항

AISLE이 프론티어 모델을 능가하는 패턴은 curl을 넘어 확장되는 것으로 보입니다. Linux stable releases의 유지 관리자인 Greg Kroah-Hartman은 Linux 커널에서도 유사한 결과를 보고하며 다음과 같이 말했습니다: "I'm seeing the same for Linux as well. No idea what Aisle is doing differently, but wow..."

기술 커뮤니티의 관점

발견 사항이 CVE 할당으로 검증되었지만, 기술 커뮤니티는 방법론과 결과의 성격에 대해 몇 가지 사항을 제기했습니다:

  • System vs. Model: 비판론자들은 전문화된 AI 하네스(AISLE)를 기본 모델(OpenAI/Anthropic)과 비교하는 것은 불공평한 비교라고 주장합니다. 한 댓글 작성자는 다음과 같이 언급했습니다: "Put a base model versus a base model + harness + whatever else, and yea, if you do it right then you have a better system to find vulnerabilities."
  • Signal-to-Noise Ratio: 일부 관찰자들은 AISLE이 29개의 이슈를 보고했지만 6개만 CVE였기 때문에 더 높은 오탐(false-positive) 비율을을 나타낸다고 지기했습니다. 한 사용자는 프론티어 도구들이 동일한한 이슈를 발견했을 수도 있지만 낮은 심각도를 인해 인해 심각도가 낮아 필터링했을 수도 있다고 의문문을 던졌습니다.
  • Real-world Utility: 다른 사용자들은 이 도구에 대해 긍정적인 경험을을 보고했습니다. 한 사용자는 AISLE의 스캐너가 libnbd에서 버그를 찾기 위해 두 개의 익스플로잇을 성공적으로 체체인(chain)하여 연결했습니다. 또한 적절한 패치도 함께 제공했습니다.

"Since AISLE reported 29 issues but only 6 warranted a CVE, and all the found CVEs were "low" severity, this makes me wonder if AISLE simply is tuned for a higher false positive rate than the anthropic and openai tools."

"The tool basically had to chain two exploits together to reach this [libnbd bug]. It also came up with a patch to fix which was fairly sensible."",

Sources

관련