위장 격차: 도메인 특화 주입 공격이 LLM 방어 장치를 우회하는 이유

대형 언어 모델(LLM) 에이전트가 전문적인 워크플로에 점점 더 통합됨에 따라 업계는 "주입 탐지기"—프롬프트 주입 공격을 식별하고 차단하도록 설계된 안전 분류기—에 크게 의존해 왔습니다. 그러나 최근 논문 "Blind Spots in the Guard: How Domain-Camouflaged Injection Attacks Evade Detection in Multi-Agent LLM Systems" 은 이러한 방어 체계의 체계적인 실패를 밝혀냈습니다.

핵심 문제는 대부분의 탐지기가 명시적으로 오버라이드를 신호하는 정적 템플릿 기반 페이로드(예: "Ignore all previous instructions")에 대해 학습된다는 점입니다. 공격자가 대신 "도메인 위장"—대상 문서의 특정 어휘와 권위 구조를 모방하는 방식—을 사용할 경우 탐지기는 거의 눈이 멀게 됩니다.

위장 탐지 격차 (CDG)

연구자들은 이 취약점을 위장 탐지 격차 (Camouflage Detection Gap, CDG) 로 공식화했습니다. 이는 표준 정적 주입 페이로드와 정당한 도메인‑특화 콘텐츠처럼 위장된 페이로드 사이의 탐지율 차이를 의미합니다.

세 가지 다른 도메인에 걸친 45개의 작업에 대한 결과는 효율성의 급격한 하락을 보여줍니다:

  • Llama 3.1 8B: 정적 페이로드에서 **93.8%**였던 탐지율이 위장 페이로드에서는 **9.7%**로 급락했습니다.
  • Gemini 2.0 Flash: 탐지율이 **100%**에서 **55.6%**로 감소했습니다.
  • Llama Guard 3: 이 프로덕션‑급 안전 분류기는 위장 페이로드를 전혀 탐지하지 못했으며 (IDR = 0.000) 최악의 결과를 보였습니다.

이러한 발견은 안전 분류기가 단지 몇몇 엣지 케이스만 놓치는 것이 아니라, 전문적이거나 도메인‑특화 언어로 포장된 악의적 의도를 근본적으로 인식하지 못하고 있음을 시사합니다.

다중 에이전트 증폭

연구에서 특히 우려되는 점은 이러한 공격이 다중 에이전트 아키텍처 내에서 어떻게 동작하는가입니다. 연구 결과, 다중 에이전트 토론 아키텍처는 작은 모델에서 정적 주입 공격을 최대 9.9배까지 증폭시킬 수 있다는 것이 밝혀졌습니다.

더 강력한 모델은 어느 정도 집단 저항성을 보였지만, 작은 모델에서의 취약성은 에이전트가 정보를 전달하고 "토론"하는 구조가 악의적 페이로드가 시스템에 침투하고 전파될 기회를 오히려 제공한다는 점을 암시합니다.

구조적 취약성 vs. 우연적 결함

연구자들은 목표 탐지기 보강을 통해 이러한 격차를 완화하려 시도했습니다. 결과는 엇갈렸습니다: Gemini는 78.7% 개선을 보였지만 Llama는 **10.2%**에 불과했습니다. 이 차이는 약한 모델의 경우 취약성이 구조적이며 단순히 탐지기에 더 많은 학습 데이터를 추가하는 것만으로는 충분하지 않을 수 있음을 시사합니다.

비판적 관점 및 산업적 함의

이 연구는 보안 실무자들 사이에서 큰 논의를 촉발했습니다. 반복되는 주제는 LLM을 보호하기 위해 "탐지기"에만 의존하는 근본적인 오류입니다.

커뮤니티 멤버 @simonw 가 언급했듯이:

"LLM 시스템을 공격할 수 있는 토큰 조합은 무한합니다. 어떤 종류의 '탐지기'가 모든 경우를 잡아낼 수 있다는 생각은 저에게는 본질적으로 터무니없게 느껴집니다."

이 의견은 입력 공간이 사실상 무한에 가까운 생성 시스템에 전통적인 패턴 기반 탐지(바이러스 백신 소프트웨어와 유사)를 적용하려는 근본적인 긴장을 강조합니다.

또한 일부 비평가들은 테스트가 작은 모델이나 "플래시" 모델(Llama 3.1 8B 및 Gemini Flash 2.0)에서 수행되었다는 점을 지적합니다. 이는 현재 많은 엣지 배포와 비용 효율적인 에이전시 워크플로를 구동하는 모델에서 취약성을 확인했지만, 최첨단 모델이 위장에 대해 더 내재적인 저항성을 가지고 있는지, 아니면 아직 이러한 도메인‑모방 페이로드에 대해 충분히 테스트되지 않았는지는 여전히 미지수입니다.

결론

"위장 탐지 격차"는 현재 세대의 LLM 방어 장치가 공격자가 페이로드를 대상 도메인에 맞추어 정교하게 조정할 경우 쉽게 우회될 수 있음을 증명합니다. 다중 에이전트 시스템을 배포하는 조직에게 주는 교훈은 명확합니다: 안전 분류기만을 유일한 방어선으로 삼는 것은 고위험 전략이며, 보안은 단순 탐지를 넘어 구조적 견고성 및 엄격한 입력 검증으로 나아가야 합니다.

Sources