Anthropic과 NNSA, AI 핵 안전장치 분류기 개발

Anthropic은 핵무기 개발을 위한 AI 모델의 오용을 탐지하고 방지하기 위해 설계된 특화된 AI 분류기를 개발하기 위해 미국 에너지부(DOE) 및 국립핵안보국(NNSA)과 협력했습니다. 이 협업은 프론티어 AI 모델의 핵 확산 위험을 평가하고 모니터링하기 위한 민관 협력 모델을 구축합니다.

핵 확산 위험 모니터링

Anthropic은 NNSA 및 DOE 국립 연구소와 공동으로 핵 관련 대화를 자동으로 분류하는 AI 분류기를 공동 개발했습니다. 이 시스템은 무해한 핵 관련 논의와 우려되는 핵 확산 위험을 나타내는 논의를 구분하도록 설계되었습니다.

예비 테스트에서 이 분류기는 96%의 정확도를 달성했습니다. 이 도구는 모델 오용을 식별하기 위한 광범위한 시스템의 일부로 Claude 트래픽에 배포되었습니다.

민관 협력 프레임워크

핵 위험을 평가하는 것은 민간 기업에게 매우 어려운 과제입니다. 평가에 필요한 정보가 매우 민감하기 때문입니다. 이를 해결하기 위해 Anthropic은 2024년 4월에 NNSA와 파트너십을 맺고 모델의 확산 위험을 평가했습니다.

이 파트너십은 핵 안보에 대한 정부의 전문 지식과 AI 개발 분야의 산업 역량을 결합합니다. Anthropic은 다른 AI 개발자들이 NNSA와 협력하여 유사한 안전장치를 구현할 수 있도록 청사진을 제공하기 위해 Frontier Model Forum에 자신의 접근 방식을 공유할 계획입니다.

국가 안보에 미치는 영향

핵 기술은 이중 용도(dual-use) 기술입니다. 즉, 동일한 물리 원리가 발전과 무기 개발 모두에 적용된다는 의미입니다. 따라서 프론티어 AI 모델은 사용자에게 국가 안보를 위협할 수 있는 위험한 기술적 지식을 제공하지 않도록 모니터링되어야 합니다. 이러한 노력은 고위험 보안 위험을 정면으로 다룸으로써 AI 모델을 더욱 신뢰할 수 있고 믿을 수 있게 만들기 위한 광범위한 전략의 일부입니다.

Sources

관련