Anthropic 책임 있는 확장 정책 업데이트

Anthropic은 프론티어 AI 시스템의 파괴적 위험을 완화하기 위해 설계된 위험 거버넌스 프레임워크인 책임 있는 확장 정책(Responsible Scaling Policy, RSP)을 업데이트했습니다. 이번 업데이트는 위험을 평가하고 관리하는 데 있어 더욱 유연한 접근 방식을 도입하여, 개발 중인 모델의 능력에 비례하여 안전 및 보안 보호 조치가 확장되도록 보장합니다.

Proportional Safeguards and AI Safety Levels (ASL)

Anthropic은 단계별 보안 및 안전 조치 세트인 AI 안전 수준(AI Safety Level, ASL) 표준 시스템을 채택하고 있습니다. 이러한 표준은 생물학적 연구에 사용되는 생물 안전 수준(Biosafety Levels)과 유사하게, 모델의 능력이 성장함에 따라 엄격함이 증가합니다.

현재, 모든 Anthropic 모델은 회사가 현재 업계의 최선 사례를 반영한다고 밝힌 ASL-2 Standards 하에서 운영됩니다. 업데이트된 정책은 더 높은 ASL 표준으로의 전환을 트리거하는 두 가지 주요 능력 임계값(Capability Thresholds)을 정의합니다:

  • Autonomous AI Research and Development: 만약 모델이 일반적으로 인간의 전문 지식이 필요한 복잡한 AI 연구 작업을 독립적으로 수행할 수 있다면, Anthropic은 강화된 보안 표준(잠재적으로 ASL-4 또는 그 이상)과 추가적인 안전 보증을 요구합니다.
  • Chemical, Biological, Radiological, and Nuclear (CBRN) weapons: 만약 모델이 기본적인 기술적 배경을 가진 개인이 CBRN 무기를 생성하거나 배치하는 데 유의미하게 도움을 줄 수 있다면, 회사는 강화된 보안 및 배포 제어를 포함하는 ASL-3 standards를 요구합니다.

ASL-3 Safeguards and Deployment Controls

모델이 ASL-3 임계값에 도달하면, Anthropic은 오용을 방지하기 위해 다층적 접근 방식을 구현합니다. 보안 조치는 모델 가중치(model weights)에 대한 더욱 강력한 보호와 더 엄격한 내부 접근 제어를 포함합니다. 배포 보호 조치는 다음과 같습니다:

  • 실시간 및 비동기식 모니터링.
  • 신속한 대응 프로토콜.
  • 배포 전 신속한 레드팀(red teaming) 수행.

Implementation, Oversight, and Governance

RSP를 효과적으로 실행하기 위해, Anthropic은 다음과 같은 여러 운영 프로세스를 구축했습니다:

  • Capability Assessments: 정의된 능력 임계값에 따라 현재의 보호 조치가 적절한지 판단하기 위한 정기적인 평가.
  • Safeguard Assessments: 보안 및 배포 안전 조치가 요구되는 ASL 기준을 충족하는지 확인하기 위한 정기적인 평가.
  • Documentation: 고신뢰성 산업에서 흔히 사용되는 세이프티 케이스(safety case) 방법론을 사용하여 평가 및 의사결정 과정을 문서화함.
  • Internal and External Review: 이 프레임워크는 내부 스트레스 테스트, 안전 문제에 대한 내부 보고 프로세스, 그리고 외부 전문가 피드백 요청을 통해 지원됩니다.

Lessons Learned from Initial Implementation

기존 RSP를 구현한 지 1년이 지난 후, Anthropic은 평가를 예정된 일정보다 3일 늦게 완료하거나 플레이스홀더 평가에 대한 명확성 부족 등 몇 가지 절차적 미비점을 확인했습니다. 회사는 이러한 사례들이 최소한의 위험을 포를할 뿐이지만, 정책의 유연성 확보와 개선된 준수 사항 추적의 필요성을 강조한다고 결론지었습니다.

Organizational Changes and Leadership

Anthropic은 RSP의 확장을 관리하기 위해 리더십 역할을 업데이트했습니다:

  • Responsible Scaling Officer: 공동 창립자이자 최고 과학 책임자(Chief Science Officer)인 Jared Kaplan이 Sam McCandlish의 뒤를 이어 이 역할을 맡게 됩니다.
  • Head of Responsible Scaling: Anthropic은 RSP 준수 및 반복을 담당하는 팀들을 조정할 Responsible for Scaling의 책임자(Head of Responsible Scaling)를 위한 새로운 직책을를 맡게 됩니다.

Frontier Red Team, Trust & Safety, Security and Compliance, Alignment Science, 및 전용 RSP Team을 포함한 여러 내부 팀이 지속적인 위험 관리 프로세스에 기여하고 있습니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch