앤트로픽 책임 있는 규모 확장 정책(RSP) 프레임워크

앤트로픽은 예측할 수 없는 위험한 AI 능력의 출현을 관리하기 위해 책임 있는 규모 확장 정책(RSP)을 도입했습니다. 이 정책은 모델의 실제 능력에 따라 특정 안전 보호 조치를 시행하는 것이 모델의 배포 및 추가 학습의 전제가 되도록 하는 프레임워크를 설정합니다. 모델의 크기나 버전이 아니라 실제 능력에 따라 결정됩니다.

AI 안전 수준(ASL) 프레임워크

앤트로픽은 모델의 위험 프로파일에 따라 모델을 분류하기 위해 AI 안전 수준(ASL) 시스템을 사용합니다. 각 수준은 "만약-그러면" 구조를 따릅니다: 만약 모델이 특정 능력을 보이면, 추가 배포나 학습 전에 특정 보호 조치를 시행해야 합니다.

ASL-1: 낮은 위험

ASL-1은 체스와 같은 특정 작업을 위한 전용 AI 시스템과 같이 위험이 거의 없거나 없는 모델을 나타냅니다.

ASL-2: 현재 시대의 위험

ASL-2는 현재 AI 모델의 상태를 나타냅니다. 이러한 모델은 다양한 현재 시대의 위험을 지니고 있지만, 화학이나 생물학 분야에서 치명적인 결과를 초래할 수 있는 능력은 아직 보이지 않습니다.

ASL-2에 필요한 보호 조치:

  • 모델 카드
  • 외부 레드팀 테스트
  • 강력한 보안 조치

ASL-3: 치명적 오용 위험

ASL-3은 AI 모델이 화학, 생물, 방사선, 핵(CB RN) 분야에서 치명적인 오용에 실질적으로 유용해졌을 때 발동됩니다.

ASL-3에 필요한 보호 조치:

  • 비국가 행위자가 모델 가중치를 도둑질하는 것을 막을 수 있을 정도의 강력한 보안 조치. 또한 국가 행위자도 이를 수행하기 위해 상당한 노력을 기울여야 하도록 보장.
  • 세계 최고 전문가들에 의해 레드팀 테스트를 수행하더라도, 배포된 모델 버전이 CBRN 위험을 실질적으로 증가시키는 정보를 생성하지 않도록 보장.
  • ASL-3에 도달하기 전에 ASL-4 요건에 대한 엄격한 정의를 마련.

ASL-4: 자율성 및 글로벌 안보 위험

ASL-4는 AI 시스템이 인간 수준의 자율성을 거의 갖추거나, 생물무기와 같은 심각한 글로벌 안보 위협의 주요 원천이 되었을 때 발동됩니다.

ASL-4에 필요한 보호 조치:

  • 모델의 내부 작동 방식에 대해 세밀하고 정확한 이해를 바탕으로, 모델이 안전하다는 "긍정적 증거"를 제시할 수 있도록 하는 것.

RSP의 운영화

RSP가 이론적인 문서가 아니라 실질적인 지침이 되도록 하기 위해, 앤트로픽은 여러 조직 전략을 활용합니다:

  • 임원진의 참여: CEO와 공동 창립자들이 정책 개발에 상당한 시간을 투자하여 조직 전체에 AI 안전의 중요성을 강조했습니다.
  • 로드맵 통합: RSP 프로토콜은 제품 및 연구 요구사항으로 간주됩니다. RSP 마감일을 지키지 못하면 새로운 모델 학습 또는 제품 출시가 중단될 수 있습니다.
  • 자원 배분: ASL-3 요건을 충족하기 위해 보안, 신뢰 및 안전, 레드팀 테스트, 해석 가능성 분야에서 인력을 늘렸습니다.

책임성과 거버넌스

앤트로픽은 다층적 거버넌스 구조를 통해 RSP 준수를 보장합니다:

  • 이사회 감독: RSP는 이사회가 공식적으로 지시하는 사항입니다.
  • 외부 감독: 이사회는 회사에 재정적 이해관계가 없는 외부 전문가로 구성된 장기적 이익 신뢰기구(LTBT)에 책임을 집니다.
  • 준수 메커니즘: 회사는 무고자 보호 정책을 도입했으며, RSP 준수 및 LTBT 보고를 담당하는 책임자를 지정했습니다.

규제와의 관계

앤트로픽은 RSP를 향후 정부 규제의 원형으로 보며, 그 대체물로 보지 않습니다. 목표는 기업들이 이러한 프레임워크를 개선하고, 정부가 최고의 요소들을 채택하여 표준화된 테스트, 감사 제도 및 감독 메커니즘을 마련하는 것입니다. 앤트로픽은 기업과 국가가 협력하여 안전 프레임워크를 개선하는 "상위로의 경주"를 지지합니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch