악성코드 제작자가 AI 보안 스캐너를 회피하기 위해 LLM 안전 가드레일을 이용함

악성코드 개발자들은 이제 대규모 언어 모델(LLM)의 안전 거부 반응을 유도하기 위해 스파이웨어에 핵 및 생물 무기와 관련된 텍스트를 삽입하고 있습니다. 이 기술은 AI 보안 스캐너의 공격적인 가드레일을 악용하여, 모델이 코드 분석을 거부하게 만듦으로써 악성 소프트웨어가 자동 탐지를 우회하도록 합니다.

LLM 안전 가드레일을 공격 벡터로 활용

AI 모델의 공격적인 안전 거부 반응은 공격자가 무기화할 수 있는 2차적 사각지대를 생성합니다. LLM 기반의 보안 스캐너가 생물 또는 핵 무기에 대한 지침이나 언급과 같은 금지된 콘텐츠를 마주하면, 모델은 특정 금지된 텍스트를 필터링하는 대신 요청 자체를 완전히 거부하도록 프로그래밍되어 있습니다. 이러한 "fail-open" 취약점은 스캐너의 파이프라인이 거부를 악의적인 신호로 처리하도록 설계되지 않은 경우, 악성코드가 분석되지 않은 채로 남게 만듭니다.

AI 기반 보안 파이프라인에 미치는 영향

이러한 전술의 등장은 프롬프트 조작을 방지하기 위해 악성코드 분석 파이프라인의 의도적인 설계가 필요하다는 점을 강조합니다. 보안 전문가와 개발자들은 다음과 같은 몇 가지 주요 고려 사항을 언급했습니다:

악의적 신호로서의 거부

일부 전문가들은 AI 지원 스캐너가 안전 가드레일에 걸린다면, 해당 코드를 자동으로 악성으로 플래그를 지정해야 한다고 주장합니다. 합법적인 소프트웨어에는 핵 무기 제조에 관한 참조가 거의 포함되지 않기 때문에, LLM의 거부는 무언가 사악한 일이 일어나고 있다는 명확한 신호 역할을 합니다.

"fail-open" 설계의 위험성

자동화된 파이프라인이 "fail-open"으로 구성될 위험이 있습니다. 즉, AI가 파일을 분석하지 못할 경우 단순히 통과시키는 것을 의미합니다. 한 기여자는 이러한 방식이 이미 특정 환경에서 악성 코드를 통과시키는 데 성공했다고 언급했습니다.

다단계 분석 파이프라인

이러한 사각지대를 완화하기 위해 일부에서는 계층적 분석 방식을 제안합니다. 이는 저렴한 오픈 소스 모델을 사용하여 먼저 잠재적인 LLM 거부 콘텐츠를 식별한 다음, 코드를 더 제한적인 주요 LLM으로 전달하여 심층적인 보안 검사를 수행하는 방식입니다.

AI 가드레일에 대한 커뮤니티 논쟁

이 회피 기술의 발견은 엄격한 AI 가드레일의 효능과 필요성에 관한 더 광범위한 논쟁을 불러일으켰습니다.

가드레일의 유용성

일부 비판론자들은 공격적인 가드레일이 종종 정당한 기술적 작업을 방해하고, 공격자에게 예측 가능한 사각지대를 제공함으로써 더 큰 위험을 초래한다고 주장합니다. 그들은 이러한 제한을 제거하면 복잡하고 잠재적으로 악성인 데이터를 다루어야 하는 사이버 보안 전문가들에게 모델이 더 유용해질 것이라고 제안합니다.

핵/생물 무기 제한의 타당성

다른 커뮤니티 구성원들은 핵 또는 생물 무기에 대한 정보를 제한하는 것의 가치가 의심스럽다고 지적하며, 이러한 정보는 종종 전통적인 검색 엔진이나 역사적 문헌을 통해 이미 구할 수 있다고 언급합니다.

"개발 방법을 아는 것은 닫힌 비밀이 아니지만, 전 세계가 알지 못하게 비밀리에 들어가는 것은 불가능하다."

기술적 위험 요약

위험 메커니즘 영향
프롬프트 조작 거부를 유도하기 위해 금지된 키워드를 삽입함 AI 기반 정적 분석을 우회함
2차적 사각지대 1차적 안전성에 과도하게 집중함 보안 범위에 예측 가능한 격차를 생성함
분석 실패 LLM의 입력 처리 거부 자동화된 파이프라인에서 "fail-open" 시나리오로 이어짐

Sources