Anthropic 선거 무결성 테스트 및 완화 프레임워크
Anthropic은 AI 모델의 선거 관련 리스크를 식별하고 완화하기 위해 유연하고 반복적인 프로세스를 개발했습니다. 심층적인 전문가 테스트와 대규모 자동 평가를 결합함으로써, 회사는 부정확한 선거 정보의 확산을 방지하고 허위 정보 캠페인과 같이 정책을 위반하는 활동에 모델이 사용되는 것을 차단하는 것을 목표로 합니다.
선거 안전을 위한 다층적 접근 방식
Anthropic은 시스템 안전을 위한 "Swiss cheese model"을 채택하여, 단일 장애 지점이 선거 무결성을 해치지 않도록 계층화되고 중첩되는 개입을 활용합니다. 이 프로세스는 정책 취약성 테스트(Policy Vulnerability Testing), 자동 평가, 완화 전략 구현, 그리고 효능 재테스트의 네 가지 주요 단계로 구성됩니다.
정책 취약성 테스트 (PVT)
정책 취약성 테스트는 Institute for Strategic Dialogue의 연구원들을 포함한 외부 주제 전문가와 함께 수행되는 정성적이고 심층적인 테스트 단계입니다. PVT는 두 가지 주요 리스크에 집중합니다: 사용자가 유해하거나 부정확한 정보를 받는 것과 사용자가 Usage Policy를 위반하는 것입니다.
PVT 프로세스는 세 단계를 따릅니다:
- Planning: 정책 영역(예: 선거 관리, 정치적 형평성, 악의적인 행위자에 의한 잠재적 오용)을 선정합니다.
- Testing: 전문가들이 비적대적 및 적대적 프롬프트를 모두 구성하여 모델 출력을 기록하고 정책에 따라 벤치마크를 수행합니다.
- Reviewing: 안전 시스템의 격차를 식별하고 개선 사항의 우선순위를 정하는 협업 세션입니다.
확장 가능한 자동 평가
수동 테스트로는 달성할 수 없는 폭넓은 범위를 제공하기 위해, Anthropic은 자동 평가를 사용합니다. 이는 전문가가 작성한 PVT 질문을 바탕으로 few-shot prompting 방식을 사용하여 언어 모델을 통해 수백 개의 테스트 질문을 생성함으로써 개발됩니다.
자동 평가는 다음과 같은 이점을 제공합니다:
- Scalability: 여러 모델 변형에 걸쳐 수백 개의 프롬프트를 몇 분 만에 테스트할 수 있습니다.
- Comprehensiveness: 대규모의 타겟팅된 평가 세트를 통해 더 넓은 범위의 시나리오를 평가할 수 있습니다.
- Consistency: 서로 다른 모델에 동일한 질문 세트를 적용하여 변동성을 줄입니다.
품질을 보장하기 위해, Anthropic은 생성된 질문의 샘플을 수동으로 검토합니다. 일례로, EU 선거 관리에 관한 700개 질문 세트 중 64개 질문을 검토한 결과, 모델이 생성한 질문의 89%가 PVT 작업의 관련성 있는 확장판임을 확인했습니다.
리스크 완화 전략
PVT 및 자동 평가 결과는 다음과 같은 구체적인 기술적 및 정책적 개입으로 이어집니다:
System Prompt Updates: 모델의 지식 컷오프 날짜와 같은 컨텍스트를 시스템 프롬프트에 추가하여, 사용자가 제공된 정보의 최신성을 이해할 수 있도록 돕습니다.
Model Fine-Tuning: 특정 학습 데이터를 사용하여 원하는 행동을 유도합니다. 예를 들어, Anthropic은 모델이 권위 있는 출처를 참조하도록 하는 "reward"를 생성했습니다.
Policy Refinement: Usage Policy를 업데이트하여 허위 정보 생성, 선거 프로세스 방해, 또는 특정 정치적 후보나 정당을 옹호하는 행위를 명시적으로 금지합니다.
Enforcement Tooling: 실시간으로 프롬프트와 완료문을 평가하기 위해 fine-tuned 버전의 Claude를 활용하며, 이는 수동 감사 및 정책 위반 사용자의 offboarding을 통해 보완됩니다.
Direct User Redirection: claude.ai의 팝업 배너와 같이 UI 요소를 구현하여, 미국 기반 사용자를 TurboVote로, EU 기반 사용자를 European Parliament 지침으로 리디렉션합니다.
사례 연구를 통한 효능 측정
Anthropic은 개입 조치 이후 동일한 프로토콜을 다시 실행하여 완화 조치가 실제로 작동하는지 검증합니다.
지식 컷오프 참조
시간 민감한 선거 관련 질의에 대해 모델이 자신의 지식 컷오프 날짜(2023년 8월)를 참조하도록 보장하기 위해, Anthropic은 시스템 프롬프트를 업데이트했습니다. Claude 2, Claude 3 Opus의 연구 버전(프롬프트 미적용)과 공개 버전의 Claude 3 Opus(프롬프트 적용)를 비교했을 때, Anthropic은 이 우선순위 완화 조치에서 47.2%의 개선을 관찰했습니다.
권위 있는 출처로의 참조
권위 있는 출처로의 참조 빈도를 높이기 위해, Anthropic은 모델 fine-tuning을 수행했습니다. 이 행동을 유주도하기 위한 fine-tuning이 적용되지 않은 Claude 2와 fine-tuning이 적용된 Claude 3 Opus를 비교했을 때, 모델이 적절한 상황에서 신뢰할 수 있는 출처를를 참조하는 빈도도가 10.4% 개선되었습니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch