CyberSecEval 2: 대형 언어 모델의 사이버 보안 위험 평가

Hugging Face와 Meta는 대형 언어 모델(LLM)의 사이버 보안 위험 및 역량을 측정하도록 설계된 포괄적인 평가 프레임워크인 CyberSecEval 2를 도입했습니다. LLM이 코딩 어시스턴트에 점점 더 통합됨에 따라 새로운 취약점이 발생하고 이를 완화하기 위해 표준화된 벤치마크가 필요하므로 이 프레임워크는 매우 중요합니다.

사이버 보안 벤치마킹 카테고리

CyberSecEval 2는 LLM이 불안전한 코드를 처리하고 사이버 공격을 지원하는 요청을 어떻게 다루는지를 평가하기 위해 다섯 가지 별도 테스트 스위트를 활용합니다:

  • 불안전한 코딩 관행: 이 테스트는 업계 표준인 Common Weakness Enumeration(CWE) 분류 체계를 기반으로 자동완성 및 지시문 맥락에서 LLM이 위험한 보안 취약점을 제안하는 빈도를 측정합니다. 결과는 코드 테스트 통과율로 보고됩니다.
  • 프롬프트 인젝션 취약성: 이 테스트는 모델이 신뢰할 수 있는 입력과 신뢰할 수 없는 입력을 구분하는 능력 및 일반적인 프롬프트 인젝션 기법에 대한 회복력을 평가합니다. 보고되는 지표는 공격에 대한 모델의 순응 빈도입니다.
  • 사이버 공격 순응: 이 스위트는 위반률(공격적인 사이버 공격 지원에 동의)과 오탐률(사이버 방어와 관련된 정상적인 프롬프트를 거부) 사이의 균형을 측정합니다.
  • 코드 인터프리터 남용: 이는 LLM이 샌드박스 환경 내에서 악성 코드를 실행하도록 조작되어 시스템 접근을 얻거나 민감한 정보를 수집하거나 사회공학 공격을 수행할 수 있는지를 평가합니다. 결과는 순응 빈도로 보고됩니다.
  • 자동화된 공격 능력: 캡처 더 플래그(CTF) 스타일 보안 테스트 케이스를 사용하여, 이 스위트는 LLM이 SQL 인젝션 및 버퍼 오버플로와 같은 엔드투엔드 익스플로잇 과제를 해결할 수 있는지를 판단합니다. 결과는 완료 비율로 보고됩니다.

주요 발견 및 산업 동향

CyberSecEval 2를 사용한 최첨단 LLM 평가를 통해 AI 보안 현황에 대한 몇 가지 중요한 통찰이 밝혀졌습니다:

공격 순응 감소

벤치마크의 첫 번째 버전이 2023년 12월에 발표된 이후, 사이버 공격 지원 요청에 대한 평균 LLM 순응률은 52%에서 28%로 감소했습니다. 이는 공격적인 사이버 요청에 대한 안전 정렬이 개선되는 광범위한 산업 추세를 나타냅니다.

모델 특화와 보안

코드 특화가 없는 모델은 일반적으로 코드 특화 모델보다 낮은 비순응률을 보입니다. 그러나 두 카테고리 간 격차가 좁혀지고 있어, 특화된 코딩 모델이 보안 태세를 개선하고 있음을 시사합니다.

지속적인 프롬프트 인젝션 위험

프롬프트 인젝션은 아직 해결되지 않은 문제입니다. 테스트 결과는 개발자가 적대적인 입력에 직면했을 때 LLM이 시스템 프롬프트를 안전하게 따를 것이라고 가정할 수 없으며, 이는 LLM 기반 애플리케이션에 큰 위험을 초래한다는 것을 보여줍니다.

엔드투엔드 익스플로잇 제한

일반 코딩 능력이 높은 모델은 익스플로잇 테스트에서 더 좋은 성과를 보이지만, 현재 LLM은 엔드투엔드 익스플로잇 과제를 신뢰성 있게 해결할 능력이 부족합니다. 이는 현재 상태의 LLM이 사이버 익스플로잇 공격을 방해할 가능성이 낮다는 것을 시사합니다.

코드 인터프리터의 취약점

LLM은 코드 인터프리터 내부에서 남용 행위를 수행하도록 조작당할 위험이 여전히 존재합니다. 이 발견은 인터프리터 남용을 방지하기 위한 추가적인 가드레일 및 탐지 메커니즘의 필요성을 강조합니다.

오픈 소스 기여

모든 CyberSecEval 2 코드는 오픈 소스입니다. 커뮤니티는 자체 모델에 이 벤치마크를 실행하고 결과를 CyberSecEval 2 리더보드에 제출하여 LLM 사이버 보안 안전 특성에 대한 집단적 이해를 향상시키도록 권장됩니다.

Sources