Anthropic 미국 선거 대비 태세
Anthropic은 2024년 미국 대선 주기 동안 AI 도구의 오용을 방지하기 위해 포괄적인 안전 조치를 배포했습니다. 이러한 노력은 정치적 캠페인 금지, 허위 정보 대응, 그리고 사용자를 권위 있는 비당파적 투표 정보로 안내하는 데 중점을 둡니다.
Usage Policy and Prohibited Activities
Anthropic은 선거의 무결성을 방해할 수 있는 활동에 Claude를 사용하는 것을 명시적으로 금지하기 위해 Usage Policy를 업데이트했습니다. 이 정책은 세 가지 주요 제한 영역에 집중합니다:
- Political Campaigning and Lobbying: Claude는 특정 후보, 정당 또는 이슈를 홍보하는 데 사용할 수 없으며, 표적 정치 캠페인이나 투표 및 재정적 기부 요청을 위해 사용할 수도 없습니다.
- Misinformation and Interference: 선거법, 후보자 및 관련 주제에 관한 허위 정보를 생성하는 것은 금지됩니다. 또한, 도구를 투표 기계에 대한 공격이나 투표의 집계 및 인증을 방해하는 데 사용할 수 없습니다.
- Media Limitations: 선거 관련 딥페이크 위험을 제거하기 위해, Claude는 텍스트 전용 출력으로 제한되며 이미지, 오디오 또는 비디오를 생성할 수 없습니다.
Enforcement and Detection Mechanisms
이러한 정책 준수를 보장하기 위해, Anthropic은 오용을 탐지하고 방지하기 위해 자동화된 시스템과 인간의 검토를 결합하여 사용합니다. 집행 전략에는 다음이 포함됩니다:
- Prompt Modifications: claude.ai 인터페이스의 프롬프트 변경 사항을 구현합니다.
- API Auditing: first-party API의 사용 사례를 모니터링합니다.
- Account Suspension: 정책 위반의 극단적인 사례에 대해 계정을 정지합니다.
- Cloud Partnership: Amazon Web Services (AWS) 및 Google Cloud Platform (GCP)와 협력하여 이러한 플랫폼을 통해 모델에 액세스하는 사용자의 피해를 식별하고 완화합니다.
Vulnerability Testing and Model Refinement
Anthropic은 선거 관련 위험을 식별하고 체계적으로 해결하기 위해 표적 레드팀(red-teaming) 및 자동화된 평가를 활용합니다. 이 프로세스에는 다음이 포함됩니다:
- Policy Vulnerability Testing (PVT): 외부 전문가와 협력하여, Anthropic은 편향성, 허위 정보 및 적대적 남용과 관련된 위험을 식별하기 위해 심층 테스트를 수행합니다. 여기에는 투표 방법 및 장소에 대한 질문에 대한 모델의 응답을 문서화하는 것이 포함됩니다.
- Automated Evaluations: 회사는 후보자와 주제 전반에 걸쳐 응답의 정치적 형평성을 측정하고, 유해한 쿼리에 대한 거부율의 효과성을, 그리고 유권자 프로파일링 전술에 대한 시스템의 견고성을 측정하기 위한 확장 가능한 테스트를 개발했습니다.
- Iterative Improvement: 이러한 테스트의 결과는 정책을 지속적으로 조정하고, 집행을 강화하며, 모델의 기술적 아키텍처를 개선하는 데 사용됩니다.
Information Accuracy and Transparency
AI 모델은 실시간 학습 데이터를 갖추고 있지 않기 때문에, Anthropic은 사용자가 정확한 투표 정보를 받도록 보장하기 위해 특정 제어 기능을 구현했습니다:
- Authoritative Redirects: 투표 정보를 요청하는 사용자에게는 후보자 이름, 투표 안건, 투표 세부 정보를 제공하는 Democracy Works의 비당파적 리소스인 TurboVote로 안내하는 팝업이 표시됩니다.
- Knowledge Cutoff Transparency: Claude의 시스템 프롬프트는 사용자가 실시간 선거 데이터에 의존하지 않도록 하기 위해 지식 컷오프 날짜를 명시적으로 참조하도록 업데이트되었습니다.
- Industry Collaboration: Anthropic은 자동화된 평가 중 일부를 공개하고, AI 산업 전반의 안전 결과 개선을 위해 제3자 평가를 지원하는 이니셔티브를 시작했습니다.
Sources
- OriginalU.S. Elections Readiness
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch