Anthropic, AI 시스템의 레드팀 테스트의 도전 과제와 최선의 실천 방안 제시
요약
Anthropic는 AI 모델의 안전성을 평가하기 위해 사용하는 레드팀 테스트 기법에 대한 포괄적인 개요를 발표하며, 각 방법이 안전성에 왜 중요한지, 실질적인 이점과 장애 요소는 무엇인지, 그리고 정책 입안자가 산업 전반의 표준을 만들 수 있도록 어떻게 도울 수 있는지 설명했다.
레드팀 테스트란 무엇이며 왜 표준이 필요한가
레드팀 테스트는 AI 시스템이 배포되기 전에 취약점을 발견하는 적대적 테스트 과정이다. 현재 개발자들이 다양한 기법을 사용하고 있으며, 종종 서로 다른 구현 방식을 채택하고 있기 때문에, 안전성 결과를 비교할 수 있는 공통 프레임워크가 부족하다. Anthropic는 지금 이러한 공유된 실천 방안을 마련함으로써 조직이 현재의 위험을 관리하고, 더 강력한 미래 모델에 대비할 수 있도록 도울 수 있다고 주장한다.
도메인 전문가 기반 레드팀 테스트
정책 취약점 테스트 (신뢰 및 안전성)
목적: 아동 안전, 선거의 공정성, 극단화와 같은 고위험 피해에 대한 질적이고 심층적인 테스트. 방법: Thorn, Institute for Strategic Dialogue, Global Project Against Hate and Extremism 등의 외부 NGO와 협력하여 Anthropic 사용 정책에 따라 모델을 테스트한다. 이점: 복잡하고 맥락에 따라 달라지는 위협에 대한 전문 지식을 활용할 수 있다. 도전 과제: 외부 전문가와의 협력은 시간이 오래 걸릴 수 있으며, 발견된 결과는 종종 질적이고 정량화하기 어렵다.
선도적 위협 레드팀 테스트 (국가 안보)
목적: 화학, 생물, 방사선, 핵 (CBRN), 사이버 보안, 자율 AI 시나리오 등 국가 안보에 영향을 줄 수 있는 위험을 평가한다. 방법: 도메인 전문가와 협력하며, 때로는 위험 완화 기능이 조정된 비상업적 모델 버전을 사용한다. 이점: 실질적이고 큰 영향을 미치는 위협 모델을 직접 다룰 수 있다. 도전 과제: 민감한 전문 지식에 접근해야 하며, 맞춤형 모델 구성이 필요할 수 있다.
다국어 및 다문화 레드팀 테스트
목적: 대부분의 테스트가 영어 중심인 편향을 줄이기 위해 다른 언어와 문화적 맥락에서 모델을 평가한다. 방법: 싱가포르의 Infocomm Media Development Authority (IMDA) 및 AI Verify Foundation과 협력하여 영어, 타밀어, 중국어, 말레이어로 지역적으로 관련 있는 주제에 대해 테스트한다. 이점: 표현의 다양성을 높이고 언어별 고유의 오류 패턴을 발견할 수 있다. 도전 과제: 자격을 갖춘 현지 테스터의 수가 제한적이며, 문화적으로 세밀한 평가 기준이 필요하다.
언어 모델을 활용한 레드팀 테스트
자동화된 레드팀 테스트
목적: 모델이 공격을 생성하는 레드팀과, 결과 데이터로 미세 조정되는 모델을 사용하는 블루팀을 활용해 적대적 테스트의 규모를 확대한다. 이점: 수천 개의 테스트 케이스를 빠르게 생성할 수 있어 새로운 공격 벡터를 빠르게 발견할 수 있다. 도전 과제: 자동화된 공격은 미묘한 인간 중심의 피해를 놓칠 수 있으며, 레드팀/블루팀 사이의 순환은 명확한 평가 지표 없이 '고양이와 쥐' 게임처럼 전개될 수 있다.
새로운 모달리티에 대한 레드팀 테스트
Claude 3을 위한 다중 모달 레드팀 테스트
목적: Claude 3의 이미지 입력 기능을 테스트한다. 이 모델은 사진, 스케치, 차트를 분석할 수 있지만 이미지를 생성하지는 않는다. 방법: 내부 신뢰 및 안전 팀과 외부 파트너가 유해한 시각적 및 텍스트 입력에 대한 거부 행동을 평가한다. 이점: 이미지 기반 사기, 아동 안전 위반, 극단주의 콘텐츠와 같은 새로운 위험을 배포 전에 식별할 수 있다. 도전 과제: 다중 모달 평가는 순수 텍스트 테스트와 다른 새로운 도구와 전문 지식이 필요하다.
개방형, 일반적인 레드팀 테스트
커뮤니티 기반 레드팀 테스트 (예: DEF CON AI Village, GRT Challenge)
목적: 비기술적 참여자도 포함한 광범위한 대중을 동원하여 공개된 모델을 테스트한다. 이점: 창의성을 유도하고 참여 범위를 넓히며 예상치 못한 실패 모드를 드러낼 수 있다. 도전 과제: 대규모이고 다양한 참여자 기반에서 안전성, 데이터 프라이버시, 재현 가능성 관리가 어렵다.
질적 레드팀 테스트에서 정량적 평가로 전환
Anthropic는 반복적인 파이프라인을 설명한다:
- 질적 탐색 – 전문가가 위협 모델을 정의하고 즉흥적인 공격을 수행한다.
- 표준화 – 레드팀은 유해한 행동을 더 신뢰성 있게 유도할 수 있도록 입력을 개선한다.
- 자동화 – 언어 모델이 성공적인 공격의 대규모 변형을 생성한다.
- 평가 – 자동화된 테스트 세트가 정량적 지표를 제공하며, 이는 모델 미세 조정에 피드백으로 활용된다. 이 워크플로우는 이미 선도적 위협 및 선거 공정성 테스트에 적용되었으며, 더 넓은 위협 모델에도 적용될 예정이다.
레드팀 테스트 생태계를 강화하기 위한 정책 제안
- 표준 개발 지원 – NIST와 같은 기관이 안전한 AI 레드팀 테스트를 위한 기술 가이드라인을 개발하도록 지원한다.
- 독립적 테스트 기관 지원 – 개발자들과 도메인 전문 위험 평가를 수행할 수 있는 정부 및 비영리 조직을 재정적으로 지원한다.
- 전문 레드팀 시장 조성 – 공통된 기술 기준을 충족하는 기업에 대한 인증 체계를 장려한다.
- 제3자 접근 의무화 – AI 기업이 검증된 외부 그룹이 안전한 조건에서 레드팀 테스트를 수행할 수 있도록 요구한다.
- 레드팀 테스트를 규모 확장 정책과 연계 – 더 큰 모델을 배포할 수 있는 능력을, 명백한 레드팀 테스트 결과와 책임 있는 규모 확장 약속과 연결한다.
결론
Anthropic의 분석에 따르면, 모든 AI 안전성 도전 과제에 대해 단일한 레드팀 테스트 방법만으로는 충분하지 않다. 도메인 전문가, 자동화, 다중 모달, 커뮤니티 접근 방식을 결합하고, 질적 인사이트에서 정량적 지표로 전환하는 것은 재현 가능하고 확장 가능한 안전성 테스트로 나아가는 길이다. 정책 입안자와 산업 이해관계자는 표준 개발을 지원하고, 독립적인 테스터를 지원하며, 인증과 투명성 요구 사항을 제도화함으로써 이 진전을 가속화할 수 있다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch