앤트로픽, 미국 CAISI 및 영국 AISI와 함께 AI 안전장치 협력
앤트로픽은 미국 인공지능 표준 및 혁신 센터(CAISI)와 영국 인공지능 보안 연구소(AISI)와 지속적인 파트너십을 맺어, 자체 AI 모델의 취약점을 식별하고 완화하고 있습니다. 이 협력은 국가 안보, 사이버보안 및 위협 모델링 분야의 정부 전문 지식을 활용하여, 정교한 악용에 대응하는 AI 안전장치의 강건성을 높이는 데 중점을 두고 있습니다.
레드팀을 통한 헌법적 분류기 강화
앤트로픽은 클로드 오퍼스 4 및 4.1과 같은 모델을 배포하기 전에, CAISI와 AISI를 활용하여 헌법적 분류기(일명 '자기 통제 분류기')의 여러 버전을 평가했습니다. 이 반복적인 스트레스 테스트 과정을 통해 다음과 같은 중요한 취약점 유형이 발견되었습니다:
- 프롬프트 주입: 정부 레드팀은 특정 주석(예: 인간 검토가 이루어졌다는 허위 진술)을 통해 분류기 탐지를 회피할 수 있는 약점을 발견했습니다.
- 일반화된 잠금 해제(jailbreak): 테스터들은 표준 탐지 방식을 회피하기 위해 해로운 상호작용을 인코딩한 정교한 잠금 해제 기법을 개발했습니다. 이로 인해 앤트로픽은 단순한 패치가 아닌, 안전장치 아키텍처를 근본적으로 재구성하게 되었습니다.
- 암호 기반 공격: 암호화, 문자 대체 및 기타 가시성 왜곡 기법을 사용해 분류기를 회피하는 사례가 발생했으며, 이에 따라 암호화 방식에 관계없이 위장된 콘텐츠를 인식할 수 있도록 탐지 시스템이 개선되었습니다.
- 입력 및 출력 가시성 왜곡: 테스터들은 해로운 문자열을 전체 맥락 내에서 무해한 구성 요소로 분할하는 일반화된 잠금 해제 기법을 발견했으며, 이에 따라 필터링 메커니즘에 특화된 개선이 이루어졌습니다.
- 자동화된 공격 최적화: 파트너들은 공격 전략을 점진적으로 최적화하는 자동화 시스템을 개발하여, 효과적인 일반화된 잠금 해제를 생성했으며, 앤트로픽은 이를 현재 안전장치 개선에 활용하고 있습니다.
위험 평가 방법론 및 평가 강화
특정 기술적 취약점 외에도, CAISI 및 AISI와의 협력은 앤트로픽의 보다 포괄적인 보안 접근 방식을 향상시켰습니다. 정부 기관들은 배포 모니터링, 신속한 대응 능력, 증거 요구 사항에 대한 외부 시각을 제공하여, 앤트로픽의 내부 위협 모델을 검증하고 더 많은 증거가 필요한 영역을 식별하는 데 도움을 주었습니다.
효과적인 정부-산업 협력 프레임워크
앤트로픽은 이 정부 연구 및 표준 기관과의 파트너십이 효과를 발휘할 수 있었던 몇 가지 핵심 요소를 식별했습니다.
포괄적인 시스템 접근성
심층적인 시스템 접근은 더 정교한 취약점 탐지를 가능하게 합니다. 앤트로픽은 정부 레드팀에게 다음 자원을 제공했습니다:
- 배포 전 프로토타입: 안전장치 프로토타입에 대한 접근을 통해 시스템이 운영되기 전에 약점을 식별할 수 있었습니다.
- 다양한 시스템 구성: 완전히 보호되지 않은 베이스 모델부터 완전한 보안 기능이 적용된 모델까지 다양한 구성에 접근할 수 있어, 공격 전략을 점진적으로 개선할 수 있었습니다.
- 내부 문서: 안전장치 아키텍처, 문서화된 취약점, 세부 콘텐츠 정책 정보에 대한 투명성은 테스터가 고가치 영역을 정확히 타겟팅할 수 있도록 도왔습니다.
- 실시간 데이터: 분류기 점수에 직접 접근할 수 있어, 테스터는 공격 전략을 지속적으로 개선하고 타겟팅된 탐색 연구를 수행할 수 있었습니다.
반복적이고 지속적인 참여
일일 소통과 자주 이루어지는 기술적 심층 분석을 포함한 지속적인 협업은 외부 팀이 복잡한 취약점을 발견하기 위해 필요한 깊이 있는 시스템 이해를 개발할 수 있도록 합니다. 단일 평가로는 발견할 수 없는 복잡한 취약점을 탐지할 수 있습니다.
다층적 방어 전략
앤트로픽은 전문적인 정부 평가를 다른 보안 조치와 결합합니다. 예를 들어, 공개 버그 바운티 프로그램 등이 있습니다. 버그 바운티는 광범위한 인재풀에서 다양한 보고를 제공하지만, 정부 팀은 미묘하고 복잡한 공격 벡터를 탐지하기 위해 필요한 깊이 있는 기술 지식을 제공합니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch