Anthropic의 AI 안전을 위한 전면 위협 적군 훈련
개요
Anthropic는 생물안보 및 사이버보안과 같은 국가안보에 위협이 될 수 있는 AI 기능을 식별하고 완화하기 위해 "전면 위협 적군 훈련" 접근법을 도입했다. 이 적대적 테스트 프레임워크는 악의적인 행위자가 악용할 수 있는 모델의 잠재적 능력을 발견하도록 설계되었으며, 일반적인 대중 기반 적군 훈련을 넘어 전문가 주도의 특화된 평가로 나아간다.
전면 위협 적군 훈련의 방법론
전면 위협 적군 훈련은 모델의 잠재적 능력을 드러내기 위해 분야 전문 지식과 시간에 대한 집중적인 투자를 필요로 한다. Anthropic의 프로세스는 다음과 같은 핵심 요소를 포함한다:
- 전문가 협업: 프로세스는 수십 년의 경험을 가진 분야 전문가와 협력하여 위협 모델을 정의하는 것으로 시작한다. 이러한 모델은 위험한 정보가 무엇인지, 그 정보가 어떻게 결합되어 피해를 초래하는지, 그리고 피해를 유발하기 위해 필요한 정확도와 빈도를 식별한다.
- 집중적 탐색: 분야 전문가와 LLM 전문가가 모델과 상호작용하여 능력을 탐색하는 데 상당한 시간(100시간 이상)을 투자한다. 이 과정에는 안전 필터를 우회하기 위해 모델을 "재판금"하는 방법을 배우는 것이 포함된다.
- 자동화된 평가: 주요 목표는 전문가 지식을 기반으로 새로운 자동화된 평가 및 도구를 개발하여 테스트 프로세스를 반복 가능하고 확장 가능하게 만드는 것이다.
- 보안 인프라: 발견된 정보는 매우 민감하므로, 이 작업은 신뢰할 수 있는 제3자와의 협력과 강력한 정보 보안 보호 조치를 통해 수행된다.
생물안보 적군 훈련에서의 발견
Anthropic는 생물학적 위험에 초점을 맞춘 테스트 프로젝트를 수행했으며, 공개된 신뢰 및 안전 모니터링이 없는 보안 인터페이스를 사용해 150시간 이상 생물안보 전문가와 협력했다.
주요 위험 요소
- 전문가 수준의 지식: 전면 모델은 때때로 전문가 수준의 정교하고 정확하며 상세한 지식을 생성할 수 있다. 모델이 커질수록 이러한 능력은 증가한다.
- 해로움의 가속화: 제한되지 않은 LLM은 단순히 검색 엔진을 사용하는 것보다 악의적인 행위자가 생물학을 악용하는 능력을 가속화할 수 있으며, 그렇지 않으면 불가능한 작업을 가능하게 한다. 현재 이러한 영향은 작지만, 급속도로 증가하고 있다.
- 단기적 시나리오: Anthropic는 이러한 생물학적 위험이 제한되지 않은 상태로 유지된다면, 5년 이상이 아니라 다음 2~3년 내에 현실화될 수 있다고 추정한다.
시행된 완화 조치
Anthropic는 이러한 위험을 특정 개입을 통해 상당히 줄일 수 있음을 발견했다:
- 학습 프로세스 조정: 헌법 기반 AI에서 사용된 것과 같은 학습 프로세스의 변경은 모델이 해로운 생물학적 사용과 무해한 사용을 더 잘 구분하도록 도와준다.
- 분류기 기반 필터: 이러한 필터는 피해를 유발하기 위해 필요한 연결된 전문가 수준의 정보를 획득하는 것을 어렵게 만든다. 이러한 완화 조치는 현재 Anthropic의 공개 전면 모델에 배포되어 있다.
미래 연구 및 산업적 함의
Anthropic는 현재 전면 모델의 상태가 산업에 대한 "경고 사인"을 제공한다고 주장한다. 회사는 다음과 같은 미래 방향에 집중하고 있다:
- 비교적 가속화 분석: 다음 세대의 도구 사용 및 다중모달 모델에서 전통적인 검색 엔진과 비교해 LLM이 해로움을 생성하는 데 제공하는 가속화를 측정한다.
- 오픈 웨이트 모델의 위험: Anthropic는 악의적인 행위자가 공개적으로 이용 가능한 충분히 능력 있는 기본 모델의 가중치에서 파생된 더 작은, 미세 조정된 모델로부터 해로운 생물학적 능력을 추출할 수 있다고 경고한다.
- 협업적 공개: Anthropic는 다른 연구소와 정부 기관에 위험 요소와 완화 조치를 보고하기 위한 공개 프로세스를 마련하고 있다.
- 제3자 평가: 회사는 민감한 정보에 대한 적절한 보호 조치를 갖춘 국가안보 평가를 수행할 수 있는 공정한 제3자 기관의 창설을 주장하고 있다.
연구 계획의 확장
Anthropic는 미래 능력을 실험하고 확장 가능한 평가를 구축하기 위해 전면 위협 적군 훈련 팀을 확장하고 있다. 이 프레임워크는 모델 기만과 같은 장기적 위험에도 적용될 예정이며, 향후 발생할 가능성이 있는 능력을 식별하고 그 능력이 등장하기 전에 일치 기술을 개발하는 데 목적이 있다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch