Anthropic의 책임 있는 규모 확장 정책에 대한 성찰

Anthropic은 전면적인 AI 모델에서의 치명적 위험과 오용을 관리하기 위한 실질적인 지침으로 고도의 안전 개념을 구현하기 위해 책임 있는 규모 확장 정책(RSP)을 운영하고 있습니다. 이 정책은 안전 및 보안 조치가 모델 능력과 함께 확장되도록 보장하기 위해 조직의 우선순위, 프로젝트 일정 및 위협 모델링을 위한 체계적인 프레임워크를 수립합니다.

RSP의 다섯 가지 핵심 약속

Anthropic의 현재 책임 있는 규모 확장 프레임워크는 현재의 안전 기준(ASL-2) 하에서 보관하거나 배포할 수 없을 정도로 위험한 능력을 갖춘 모델의 배포를 방지하기 위해 설계된 다섯 가지 핵심 약속을 기반으로 합니다:

  1. 적색선 능력 설정: 현재의 안전 기준 하에서 보관하거나 배포할 수 없을 정도로 위험한 특정 능력을 식별하고 공개합니다(ASL-2).
  2. 적색선 능력 테스트: 도메인 전문가와 협력하여 "전면적 위험 평가"를 설계합니다. 이는 모델이 적색선 능력을 접근하거나 도달했는지를 나타내는 실험적 테스트입니다.
  3. 적색선 능력 대응: 더 높은 수준의 안전 및 보안 조치인 ASL-3 표준을 개발합니다. Anthropic는 적색선 능력을 가진 모델에 대해 ASL-3 표준을 적용할 수 없는 경우 훈련 또는 배포를 일시 중단하기로 약속합니다.
  4. 반복적 확장: ASL-3 활동을 진행하기 전에 해당 표준의 상한선을 정의하고, ASL-4 표준이 필요해지는 새로운 적색선 능력을 설정합니다.
  5. 보장 메커니즘: 평가를 위한 스트레스 테스트, 감소 조치의 공개 또는 전문가 검증, 이사회 및 장기적 이익 신뢰기구의 감독을 시행합니다.

위협 모델링 및 평가 방법론

Anthropic는 전면적 레드팀과 일치 과학 팀을 활용하여 ASL-3 표준을 유발할 수 있는 능력을 식별합니다. 현재 테스트는 모델의 계산 능력이 최근에 테스트된 모델보다 4배에 도달했을 때 사이버보안, CBRN(화학, 생물, 방사능, 핵), 모델 자율성 영역에서 수행되고 있습니다.

평가 접근 방식

Anthropic는 모델 위험을 평가하기 위해 네 가지 주요 방법론을 활용합니다:

  • 질문 및 답변 데이터셋: 실행이 빠르지만 제한된 형식으로 인해 제한될 수 있습니다.
  • 인간 시험: 모델 지원 사용자와 검색 엔진 사용자를 비교하여 오용 여부를 측정합니다. 이는 강력한 통계적 추론과 전문가 기준이 필요합니다.
  • 자동화된 작업 평가: 가상 환경을 사용하여 자율적 행동을 테스트합니다. 이는 안전한 인프라와 도구 사용에 대한 수동 검토가 필요합니다.
  • 전문가 레드팀: 전문가의 의견을 얻기 위해 대화 기록을 통해 모델 행동을 개방형 탐색합니다.

평가의 기술적 과제

Anthropic는 평가의 신뢰성에 관한 몇 가지 열린 연구 질문을 식별합니다:

  • 예측적 확장: 현재 증거를 바탕으로 미래의 위험 수준을 추정하여 위험한 임계치에 도달하기 전에 감소 조치를 준비해야 합니다.
  • 능력 유도: 테스트 중에 관련된 모든 능력이 유도되었는지 보장하는 것이 어렵습니다. 프롬프트 공학이나 미세 조정 기법은 숨겨진 능력을 해제할 수 있기 때문입니다.
  • 외부 이해 가능성: 표준을 완화하는 생산적 압박을 피하기 위해 사전에 테스트 결과를 명시하려는 노력이 필요하지만, 증거를 더 잘 통합하는 방법을 찾고 있습니다.

ASL-3 보안 표준

ASL-3 표준은 비국가 행위자에 의한 모델 가중치 도용 또는 제품 표면을 통한 모델 오용 위험을 완화하기 위해 설계되었습니다. 이 표준은 막대한 자원을 가진 국가 수준의 행위자에 대한 보호를 목적으로 하지 않습니다.

제품 표면 안전성

Anthropic는 인간의 오용을 방지하기 위해 "심층 방어" 접근법을 사용하며, 다음과 같은 조치를 결합합니다:

  • 인간 피드백을 통한 강화 학습(RLHF)과 헌법적 AI.
  • 프롬프트, 완성, 대화에서의 오용을 탐지하기 위한 다단계 분류 모델.
  • 해킹 시도에 대한 사고 대응 및 패치 적용.

인프라 및 가중치 보안

비국가 행위자에 대응하기 위해 Anthropic는 보안 관련 분야에 약 8%의 직원을 배치하는 등 보안 인력 규모를 확대했습니다. 주요 기술적 통제 조치는 다음과 같습니다:

  • 다자간 승인: 접근에 여러 승인을 요구하여 유출 위험을 줄입니다.
  • 시간 제한 접근 제어: 최소 권한 원칙에 따라 일시적인 접근 권한을 부여합니다.
  • 내부 위협 완화: 내부 장치의 위협이 가장 높은 위험 벡터로 간주되어 대응하고 있습니다.

거버넌스 및 보장 구조

RSP가 의도한 대로 실행되도록 보장하기 위해 Anthropic는 여러 감독 메커니즘을 도입했습니다:

  • 중앙 조율: 전담 책임 있는 규모 확장 팀이 다양한 작업 흐름 간의 의존성을 관리합니다.
  • 적대적 테스트: 일치 스트레스 테스트 팀은 "두 번째 방어선" 역할을 하며, 평가 및 개입 사항을 스트레스 테스트합니다.
  • 내부 보고: 비준수 보고 정책을 통해 직원들이 책임 있는 규모 확장 담당자에게 익명으로 우려를 제기할 수 있습니다.
  • 외부 감독: 이사회, 장기적 이익 신뢰기구 및 미국 상무부 산업 및 보안 국에 정기적으로 업데이트를 제공합니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch