앤트로픽과 NNSA, AI 핵 안전장치 분류기 개발
앤트로픽은 미국 에너지부(DOE)와 국립핵안전관리국(NNSA)와 공동으로, 인공지능 모델의 핵무기 개발 용도 오용을 탐지하고 방지하기 위한 전문적인 AI 분류기를 개발했다. 이 협력은 선도적인 AI 모델을 국가안보 위협으로부터 보호하면서도, 합법적인 과학적 및 교육적 목적을 위한 모델의 유용성을 유지하기 위한 공공-민간 협력 틀을 마련한다.
핵 확산 위험을 위한 AI 분류기
앤트로픽과 NNSA는 위험한 핵 관련 대화와 무해한 논의를 구분하도록 설계된 자동 분류 시스템을 구축했다. 합성 데이터를 사용한 초기 테스트에서 이 분류기는 전반적인 정확도 96.2%를 기록했으며, 핵무기 관련 질의를 94.8%의 정확도로 탐지했고, 거짓 긍정(false positive)은 0건이었다.
개발 과정
이 분류기는 레드팀 테스트와 검증의 반복 주기를 통해 개발되었다:
- 위험 지표 식별: 안전한 환경에서 1년간 NNSA가 클로드 모델에 대한 레드팀 테스트를 수행한 후, NNSA는 앤트로픽의 정책 및 안전팀과 공유할 수 있도록 분류 수준에 맞춘 핵 위험 지표 세트를 제공했다.
- 분류기 구축: 앤트로픽은 이러한 위험 지표를 실시간 분류기로 변환했으며, 스팸 필터와 유사한 방식으로 대화를 '위험할 수 있음' 또는 '무해함'으로 레이블링한다.
- 합성 검증: 국가안보 기관과 민간 기업 간의 정보 공유 제약을 회피하기 위해 팀은 합성 데이터 생성을 사용했다. 앤트로픽은 NNSA의 예시를 기반으로 수백 개의 테스트 프롬프트를 생성했고, NNSA는 분류기 점수가 예상 레이블과 일치하는지 확인했다.
- 개선: 반복적인 테스트와 개선을 통해 NNSA의 피드백을 바탕으로 시스템을 정교화했다.
실제 환경 배포 및 성능
이 분류기는 현재 앤트로픽의 안전장치 프레임워크에 실험적 추가 기능으로 배포되어 클로드 트래픽의 일부를 모니터링하고 있다. 실제 환경 데이터는 합성 테스트 환경을 넘어서 이 도구의 효과성을 확인했다.
회색 영역과 맥락 처리
배포 데이터는 실제 대화가 합성 데이터보다 훨씬 복잡하다는 점을 드러냈다. 예를 들어, 중동 지역의 현재 사건에 대한 무해한 대화가 때때로 위험한 것으로 표시된 적이 있다. 앤트로픽은 계층적 요약(hierarchical summarization)을 사용해 이러한 거짓 경보를 완화했다. 이 과정은 여러 번 경고된 대화를 함께 검토하여, 그들이 무해함을 식별할 수 있는 충분한 맥락을 제공한다.
적대적 테스트를 통한 검증
분류기의 효과는 앤트로픽 자체 레드팀원들이 일상적인 적대적 테스트 중 사용한 위험한 프롬프트를 성공적으로 탐지한 것으로 더욱 입증되었다. 레드팀원들은 분류기가 배포되어 있다는 사실을 몰랐음에도 불구하고 말이다.
산업적 함의와 모범 사례 제시
앤트로픽은 이 접근 방식을 선도 모델 포럼(Frontier Model Forum)과 공유하여 다른 AI 개발자들이 유사한 안전장치를 도입하도록 장려하고 있다. 정부의 도메인 전문성과 산업계의 기술 역량을 결합함으로써, 이 협력은 자발적인 공공-민간 협력이 다양한 분야에서 고위험 국가안보 위협에 대응할 수 있는 모범 사례가 되고 있다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch