Anthropic 선거 안전장치 업데이트

Anthropic은 2026년 미국 중간선거 및 기타 글로벌 선거 기간 동안 Claude가 정확하고, 공정하며, 균형 잡힌 정보를 제공할 수 있도록 업데이트된 선거 안전장치를 도입했습니다. 이러한 조치는 정치적 편향과 오용을 방지하기 위해 헌법적 훈련, 엄격한 평가 벤치마크, 실시간 리소스 통합을 결합합니다.

중립성 훈련을 통한 정치적 편향 방지

Claude는 모델이 사용자를 특정 관점으로 유도하는 것을 방지하기 위해 다양한 정치적 관점을 동일한 깊이와 분석적 엄격함으로 다루도록 훈련되었습니다. 이러한 중립성은 두 가지 주요 메커니즘을 통해 달성됩니다:

  • Character Training: 모델은 Claude의 헌법에 정의된 일련의 가치와 특성에 부합하는 응답을 생성할 때 보상을 받습니다.
  • System Prompts: 정치적 중립성에 대한 명시적인 지침이 Claude.ai의 모든 대화에 통합되어 있습니다.

이러한 안전장치를 검증하기 위해 Anthropic은 각 모델 출시 전에 평가를 수행합니다. 최근 테스트에서, Opus 4.7은 95%를 기록했고 Sonnet 4.6은 96%를 기록했습니다 정치적 스펙트럼 전반의 프롬프트에 공정하게 참여하는 능력에서 말입니다. Anthropic은 외부 복제를 허용하기 위해 평가 방법론과 데이터셋을 오픈 소스로 공개했습니다.

또한, 회사는 표현의 자유와 관련된 모델의 행동을 검토하기 위해 The Future of Free Speech, the Foundation for American Innovation, 그리고 the Collective Intelligence Project를 포함한 외부 기관과 협력하고 있습니다.

정책 집행 및 리스크 완화

Anthropic의 Usage Policy는 Claude를 기만적인 정치 캠페인, 담론에 영향을 미치기 위한 가짜 디지털 콘텐츠 생성, 유권자 부정, 투표 시스템 방해, 또는 투표 과정에 대한 오해의 소지가 있는 정보 유포를 위해 사용하는 것을 금지합니다.

탐지 및 방어 메커니즘

이러한 정책을 집행하기 위해 Anthropic은 다층적 방어 전략을 채택합니다:

  • Automated Classifiers: 이 도구들은 잠재적인 정책 위반을 실시간으로 탐지합니다.
  • Threat Intelligence Team: 전담 팀이 조직적인 오용 시도를 조사하고 차단합니다.

성능 벤치마크

Anthropic은 600개의 프롬프트(유해한 프롬프트 300개와 정당한 프롬프트 300개)를 사용하여 Claude의 Usage Policy 준수 여부를 테스트했습니다. 결과에 따르면 Claude Opus 4.7은 100%의 확률로 적절하게 응답했고, Claude Sonnet 4.6은 99.8%의 확률로 적절하게 응답했습니다.

영향력 행사 작업(influence operations)—여론을 조작하기 위한 조직적인 노력—에 관하여, Sonnet 4.6과 Opus 4.7은 시뮬레이션된 멀티턴 대화 동안 각각 90%와 94%의 확률로 적절하게 응답했습니다.

자율적 영향력 행사 작업

처음으로, Anthropic은 모델이 자율적으로 다단계 영향력 캠페인을 계획하고 실행할 수 있는지 테스트했습니다. 안전장치와 훈련 덕분에 최신 모델들은 거의 모든 작업을 거부하도록 되었지만, 안전장치가 없는 상태에서의 테스트에서는 Mythos Preview와 Opus 4.7이 작업의 절반 이상을 완료했습니다, 이는 상당한 인간의 지시가 필요하다는 요구 사항에도 불구하고 지속적인 경계가 필요함을 나타냅니다.

신뢰할 수 있는 선거 리소스 통합

사용자가 사실적인 정보를 받도록 하기 위해, Claude는 선거 배너를 통해 신뢰할 수 있는 비당파적 출처로의 직접 링크를 통합합니다.

  • US Midterms: 유권자 등록, 투표소 위치, 또는 투표 정보에 대해 질문하는 사용자들은 Democracy Works의 리소스인 TurboVote로 안내됩니다.
  • Global Expansion: 유사한 배너 시스템이 올해 말 브라질 선거를 위해 계획되어 있으며, 추가적인 글로벌 확장이 뒤따를 예정입니다.

웹 검색을 통한 최신 정보 제공 보장

LLM은 고정된 지식 컷오프를 가지기 때문에, Anthropic은 후보자 발표 및 선거 결과에 대한 최신 정보를 제공하기 위해 웹 검색을 기능을 사용합니다. 2026년 미국 중간선거와 관련된 600개 이상의 프롬프트에 대한 평가에서, Opus 4.7과 Sonnet 4.6은 각각 92%와 95%의 확률로 웹 검색을 트리거했습니다, 사용자가 최신 데이터에 연결되도록 보장하기 합니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch