Anthropic가 클로드의 정치적 편향을 측정하기 위한 방법 개발

Anthropic는 AI 모델의 '정치적 중립성'을 측정하기 위한 새로운 자동 평가 방법론을 개발하고 오픈소스로 공개했다. 이 프레임워크는 모델이 특정 이념적 입장을 선호하지 않고, 서로 대립하는 정치적 관점에 대해 동등한 깊이, 참여도, 분석 품질을 제공하는지를 평가한다.

정치적 중립성 프레임워크

Anthropic는 정치적 중립성을 모델이 정치적 스펙트럼 전반에서 중립적이고 공정하게 행동할 수 있는 능력으로 정의한다. 목표는 사용자가 특정 의견으로 유도되거나 조롱받는 일이 없도록 하여, 독립적인 판단을 할 수 있도록 하는 것이다.

이상적인 모델 행동

이를 달성하기 위해 Anthropic는 클로드에게 다음과 같은 특정 행동을 목표로 삼고 있다:

  • 균형 잡힌 정보 제공: 정치적 질문에 대해 균형 잡힌 정보를 제공하고, 무단으로 정치적 의견을 제시하지 않기.
  • 사실 정확성 유지: 모든 주제에서 포괄성과 정확성을 유지하기.
  • 이념적 터닝 테스트: 해당 관점을 지지하는 사람들이 인정하고 지지할 수 있도록 반대 의견을 설명할 수 있는 능력.
  • 다양한 관점 표현: 경험적 또는 도덕적 합의가 없는 경우 여러 관점을 표현하기.
  • 중립적 언어 사용: 정치적으로 부담을 주는 표현 대신 중립적인 용어 사용하기.
  • 존중 있는 참여: 무단으로 판단하거나 설득하려 하지 않기.

중립성 훈련 방법론

Anthropic는 클로드에 이러한 특성을 심어주기 위해 두 가지 주요 방법을 사용한다.

시스템 프롬프트

Anthropic는 대화 전에 모델에 제공되는 종합적인 지침인 시스템 프롬프트를 사용하여 클로드가 위에서 언급한 행동을 따르도록 유도한다. 완벽하지는 않지만, 이 방법은 모델의 출력에 상당한 영향을 미친다.

캐릭터 훈련

2024년 초부터 Anthropic는 강화 학습을 통해 특정 '성격 특성'을 따르는 모델을 보상하는 방식으로 훈련을 진행해왔다. 이러한 특성에는 다음이 포함된다:

  • 분열을 유도하거나 선전에 사용될 수 있는 어조를 피하기.
  • 합리적인 사람들이 의견이 갈리는 복잡한 문제를 강한 파벌 입장 없이 논의하기.
  • 단일 입장만을 방어하는 대신 다양한 관점을 세밀하게 설명하기.
  • 사용자의 사고 방식을 바꿔야 한다는 제안 없이 객관적 데이터 제시하기.
  • 문화적 또는 사회적 변화에 대한 논의에서 전통적 가치와 진보적 관점을 함께 인정하기.

쌍 프롬프트 평가 방법

편향을 측정하기 위해 Anthropic는 '쌍 프롬프트' 방법을 개발했다. 이 접근법은 동일한 논란이 있는 주제에 대해 두 가지 대립적인 이념적 관점에서 요청을 제시한 후, 세 가지 기준에 따라 응답을 평가한다:

  1. 중립성: 모델이 양측에 대해 유사한 분석 깊이, 참여 수준, 증거의 강도를 제공하는지 평가.
  2. 반대 관점 인식: 모델이 반대 주장에 대해 조건부 표현, 경고, 불확실성 등을 통해 인정하는지 확인 (예: '그러나', '비록 ~이지만').
  3. 거부 여부: 모델이 요청에 완전히 응답하지 않는지 측정.

평가 설정

  • 데이터셋: 150개 주제와 9가지 작업 유형(이론적 사고, 공식 글쓰기, 서사, 유머 포함)에 걸쳐 총 1,350개의 프롬프트 쌍.
  • 자동 평가: 주요 자동 평가 모델로 Claude Sonnet 4.5를 사용했으며, 유효성 검증은 Claude Opus 4.1과 GPT-5를 통해 수행.
  • 비교 모델: 평가에는 Claude Sonnet 4.5, Claude Opus 4.1, GPT-5(저수준 사고 모드), Gemini 2.5 Pro(최저 사고 구성), Grok 4(사고 활성화), Llama 4 Maverick이 포함.

비교 결과

중립성 점수

클로드 모델은 다른 최상위 모델들과 경쟁적으로 성과를 보였지만, 일부 모델 간에 큰 변동성이 있었다:

  • Gemini 2.5 Pro: 97%
  • Grok 4: 96%
  • Claude Opus 4.1: 95%
  • Claude Sonnet 4.5: 94%
  • GPT-5: 89%
  • Llama 4: 66%

반대 관점 인식 및 거부 여부

  • 반대 관점 인식: Claude Opus 4.1(46%)이 가장 자주 반대 관점을 인정했으며, 그 다음은 Claude Sonnet 4.5(35%), Grok 4(34%), Llama 4(31%) 순이다.
  • 거부율: 클로드 모델은 낮은 거부율을 보였으며, Sonnet 4.5는 3%, Opus 4.1은 5%였다. Grok 4는 거의 0%에 가까운 거부율을 보였고, Llama 4는 9%로 가장 높은 거부율을 기록했다.

유효성과 한계

Anthropic는 결과가 평가 모델에 의존하지 않는지 확인하기 위해 유효성 검사를 수행했다. Claude Sonnet 4.5와 GPT-5 간의 중립성에 대한 샘플별 일치율은 92%였으며, Claude Opus 4.1과는 94%였다. 이는 자동 평가 모델이 인간 평가자보다 더 일관성이 있음을 시사하며, 이전의 쌍별 평가에서 인간 평가자의 일치율은 85%에 불과했다.

주의사항

Anthropic는 연구의 몇 가지 한계를 지적했다:

  • 지리적 초점: 분석은 주로 현재 미국 정치 담론에 집중되어 있다.
  • 범위: 평가는 다단계 대화가 아닌 '단일 대화' 상호작용에 초점이 있다.
  • 지표 선택: 결과는 중립성, 반대 관점 인식, 거부 여부와 같은 특정 편향 차원에 기반하며, 다른 지표를 사용하면 다른 결과가 나올 수 있다.
  • 구성 설정: 제공업체 간 모델 구성 및 시스템 프롬프트의 차이가 결과에 영향을 줄 수 있다.

Sources

관련