Anthropic 브라우저 사용을 위한 프롬프트 인젝션 방어 기술

Anthropic은 Claude Opus 4.5와 Claude for Chrome 확장 프로그램의 프롬프트 인젝션—웹 콘텐츠에 숨겨진 AI 에이전트를 하이재킹하도록 설계된 적대적 지침—에 대한 견고성을 개선했습니다. 이러한 업데이트는 공격 성공률을 크게 낮추지만, Anthropic은 실제 브라우저 작업을 수행하는 모든 에이전트에게 프롬프트 인젝션이 여전히 활발한 보안 과제로 남아 있다고 언급합니다.

브라우저 에이전트에서의 프롬프트 인젝션의 특성

프롬프트 인젝션은 AI 에이전트가 웹페이지, 문서 또는 이메일과 같이 숨겨진 악성 지침이 포함된 신뢰할 수 없는 콘텐츠를 처리할 때 발생합니다. 이러한 지침은 사용자의 원래 의도를 무시하고 에이전트가 승인되지 않은 작업을 수행하도록 강제할 수 있습니다.

브라우저 기반 에이전트는 모든 웹페이지, 광고 및 동적으로 로드되는 스크립트를 포함하여 공격 표면이 방대하기 때문에 독특한 위험에 직면합니다. 또한, 브라우저 에이전트는 다음과 같은 고영향 작업을 수행할 수 있어 피해 가능성이 높아집니다:

  • 특정 URL로 이동
  • 양식 작성
  • 버튼 클릭
  • 파일 다운로드

예를 들어, 공격자는 이메일 내에 보이지 않는 텍스트를 삽입하여, 에이전트가 회의 답장을 작성하는 것과 같은 일상적인 작업을 수행하는 동안 기밀 통신 내용을 외부 주소로 전달하도록 브라우저 에이전트에게 지시할 수 있습니다.

Claude의 견고성 향상을 위한 기술적 개선 사항

Anthropic은 프롬프트 인젝션의 공격 성공률(ASR)을 줄이기 위해 다층적 방어 전략을을 구현했습니다. 이러한 개선 사항은 Claude for Chrome 확장 프로그램이 연구 프리뷰에서 Max 플랜 사용자를 위한 베타 버전으로 전환되는 데 밑바탕이 되었습니다.

저항성을 위한 강화 학습

Anthropic은 강화 학습을 사용하여 모델의 핵심 능력에 직접 견고성을 구축합니다. Claude는 훈련 과정 중 시뮬레이션된 웹 콘텐츠에 포함된 프롬프트 인젝션을 경험합니다. 모델은 긴급하거나 권위 있는 것처럼 보이도록 설계된 지침이라 할지라도, 악성 지침을 올바르게 식별하고 준수하기를 거부할 때 "보상"을 받습니다.

강화된 분류기

모델의 컨텍스트 창에 들어오는 모든 신뢰할 수 없는 콘텐츠는 분류기에 의해 스캔됩니다. 이 시스템은 다음과 같은 다양한 형태의 숨겨진 적대적 명령을 탐지지하도록 설계되었습니다:

  • 숨겨진 텍스트
  • 조작된 이미지
  • 기만적인 UI 요소

공격이 탐지되면, 분류기는 모델의 행동을 유도하여 에이전트가 악성 지침을 따르지 않도록 방지하는 개입을 트리거합니다.

전문가 휴먼 레드팀

자동화된 시스템이 놓칠 수 있는 창의적인 공격 벡터를 찾기 위해, Anthropic은 지속적인 탐색을 위해 내부 보안 연구원을 고용합니다. 또한, 이 회사는 업계 표준에 맞춘 견고성을 벤치마크하기 위해 외부 Arena-style 챌린지에 참여합니다.

현재 성능 및 한계

적응형 "Best-of-N" 공격자를 사용한 내부 테스트(환경당 100회 시도)에 따르면, Claude Opus 4.5와 업데이트된 안전 장치는 이전 구성과 비교하여 공격 성공률이 크게 감소했음을 보여줍니다.

하지만, Anthropic은 어떤 브라우저 에이전트도 프롬프트 인젝션에 완전히 면역이 될 수는 없다고 강조합니다. 1%의 공격 성공률이라도 의미 있는 위험을 나타내며, 회사는 이 문제가 아직 완전히 해결되지 않았다고 유지합니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch