Claude를 위한 Anthropic 안전 장치 프레임워크

Anthropic은 Claude의 기능이 유익한 결과로 이어지도록 보장하는 동시에 현실 세계의 피해를 방지하기 위해 다층적인 안전 장치 전략을 채용합니다. 이 접근 방식은 모델의 전체 수명 주기 동안 정책, 집행, 제품, 데이터 과학, 위협 인텔리전스 및 엔지니어링 분야의 전문가들을 통합합니다.

정책 개발 및 위해 프레임워크

Anthropic의 안전 장치 팀은 아동 안전, 선거 무결성 및 사이버 보안을 구체적으로 다루는 Claude의 사용 정책을 설계합니다. 이 정책 개발은 두 가지 주요 메커니즘에 의해 안내됩니다:

  • Unified Harm Framework: 물리적, 심리적, 경제적, 사회적 및 개인의 자율성이라는 다섯 가지 차원에서 잠재적인 위해를 끼치는 영향을 평가하는 데 사용되는 구조화된 관점입니다. 이 프레임워크는 오용의 가능성과 규모를 고려하여 집행 절차에 정보를 제공합니다.
  • Policy Vulnerability Testing: Anthropic은 테러리즘, 급진화, 아동 안전 및 정신 건강과 같은 분야의 외부 도메인 전문가와 협력하여 정책을 스트레스 테스트합니다. 예를 들어, 2024년 미국 선거 기간 동안 Institute for Strategic Dialogue와의 파트너십을 통해 사용자가 선거 정보를 찾을 때 TurboVote와 같은 권위 있는 출처로 안내하는 배너를 구현했습니다.

모델 학습에 안전성 통합

안전 장치는 안전 장치 팀과 미세 조정(fine-tuning) 팀 간의 협업을 통해 학습 과정에 직접 통합됩니다. 이 프로세스는 다음을 포함합니다:

  • Behavioral Guidance: 학습 중 모델이 보여주거나 피해야 할 특정 특성 및 행동을 정의합니다.
  • Iterative Refinement: 유해한 출력을 식별하기 위해 평가 및 탐지 프로세스를 사용하며, 이는 보상 모델의 업데이트나 시스템 프롬프트의 조정으로 이어집니다.
  • Specialized Domain Expertise: ThroughLine과 같은 조직과 파트너십을 맺어 자해 및 정신 건강 관련 질의에 대한 Claude의 응답을 개선하여, 모델이 단순한 거절이 아닌 미묘한 지원을 제공할 수 있도록 합니다.

그 결과, Claude는 불법 활동에 대한 지원을 거부하고 악성 코드, 사기성 콘텐츠 또는 유해한 활동을 계획하려는 시도를 인식하도록 학습됩니다.

배포 전 테스트 및 평가

새로운 모델이 출시되기 전에, 세 가지 주요 유형의 평가를 거칩니다:

  • Safety Evaluations: 명백한 위반 사항과 멀티턴 대화를 포함한 다양한 시나리오에서 사용 정책 준수 여부를 테스트합니다. 이들은 정확성을 위해 인간의 검토를 거친 다른 모델들에 의해 채점됩니다.
  • Risk Assessments: 사이버 위해 및 화학, 생물학적, 방사능 및 핵 무기 및 고성능 폭발물(CBRNE)을 포함한 고위험 도메인에 대해, Anthropic은 정부 및 민간 산업 파트너와 함께 AI 역량 강화 테스트를 수행합니다.
  • Bias Evaluations: 반대되는 관점에 대한 응답을 것을 비교하여 정치적 편향성을 테스트하고, 사실 관계와 일관성을 평가합니다. 또한 팀은 의료 및 직업과 같은 맥락에서 인종, 성별, 종교와 같은 정체성 속성과 관련된 편향성을 테스트합니다.

"computer use" 도구의 경우, 출시 전 평가를 통해 증강된 스팸 생성 위험을 식별하였으며, 이는 새로운 탐지 방법, 프롬프트 인젝션 보호 기능 및 오용용 계정을 비활성화하는 기능의 개발로 이어졌습니다.

실시간 탐지 및 집행

배포된 후, Anthropic은 사용 정책을 집행하기 위해 자동화된 시스템과 인간의 검토를 결합하여 사용합니다:

  • Classifiers: 특정 정책 위반 사항을 실시간으로 대화 내용을 모니터링하는 특수 미세 조정된 Claude 모델입니다. 이 분류기(classifiers)는 컴퓨팅 오버헤드를 최소화하면서 수조 개의 토큰을 처리합니다.
  • CSAM Detection: 자체 제품에서 이미지 해시를 알려진 아동 성적 학대물(CSAM) 데이터베이스와 비교합니다.
  • Enforcement Actions: 여기에는 유해한 출력을 방지하기 위해 시스템 프롬프트가 실시간으로 조정되는 "response steering"과 경고 또는 계정 해지 등의 계정 수준의 조치를 포함합니다.

지속적인 모니터링 및 위협 인텔리전스

Anthropic은 개별 프롬프트 이상의 정교한 공격 패턴을 식별별하기 위해 트래픽 패턴을 모니터링합니다:

  • Claude Insights: 개인정보를 보호하면서 대화 내용을 주제별 클러스터로 그룹화하여 실제 사용 사례를 분석하고 가드레일을 설정하는 데 정보를 제공하는 도구입니다.
  • Hierarchical Summarization: 자동화된 영향력 작전과 같은 집합적 행동을 식별별하기 위해 상호작용을 요약본으로 압축하여 computer use 및 사이버 역량을 모니터링하는 기술입니다.
  • Threat Intelligence: 팀은 해커 포럼, 소셜 미디어, 메시징 플랫폼을 모니터링하고, 내부의 남용용 지표(예: 활동 급증)를 외부 위협 위협 데이터와 교차 참조하여 적대적 사용을 식별별하기 위해 합니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch