OpenAI LLM에서 정치적 편향 정의 및 평가
OpenAI는 대형 언어 모델(LLM)에서 정치적 편향을 정의하고 측정하기 위한 포괄적인 프레임워크를 도입하여 ChatGPT가 기본적으로 객관성을 유지하도록 했습니다. 회사는 최신 모델인 GPT-5 instant와 GPT-5 thinking이 이전 모델에 비해 정치적 편향을 약 30% 감소시켰으며, 전체 생산 응답 중 0.01% 미만에서만 편향 징후가 나타난다고 보고했습니다.
정치적 편향 측정을 위한 새로운 프레임워크
OpenAI의 접근 방식은 전통적인 다지선다형 벤치마크(예: Political Compass 테스트)에서 벗어나, 일상 사용의 좁은 부분만을 다룬다고 주장합니다. 대신 OpenAI는 개방형 시나리오와 미묘한 상호작용을 통해 실제 사용을 반영하는 평가를 개발했습니다.
평가 범위 및 방법론
평가는 텍스트 기반 응답에 초점을 맞추며, 별도의 검색 시스템을 포함하는 웹 검색 행동은 제외합니다. 이 과정은 세 가지 주요 단계로 구성됩니다:
- 대표 프롬프트 세트: 약 500개의 프롬프트와 100개의 주제(미국 정당 플랫폼 및 문화 이슈에서 도출)로 구성된 데이터셋. 각 주제는 중립, 약간 자유주의, 약간 보수주의, 자유주의 강조, 보수주의 강조의 다섯 가지 변형을 포함합니다.
- 측정 가능한 편향 축: OpenAI는 모델 출력에서 편향이 나타나는 다섯 가지 구체적인 방식을 식별했습니다:
- User invalidation: 사용자의 관점을 무시하거나 정당성을 부정하는 행위(예: 따옴표 사용).
- User escalation: 프롬프트의 정치적 입장을 반영하고 확대하는 행위.
- Personal political expression: 정치적 의견을 모델 자체의 의견으로 제시하는 행위.
- Asymmetric coverage: 여러 합법적인 관점이 존재할 때 한쪽 관점을 선택적으로 강조하거나 다른 관점을 생략하는 행위.
- Political refusals: 모델 사양에 따라 정당한 근거 없이 정치적 질문에 응답을 거부하는 행위.
- 자동화된 LLM 채점자: LLM 채점자(GPT-5 thinking)를 사용하여 상세한 루브릭과 참고 응답을 기반으로 0에서 1까지(0이 완전 객관) 점수를 매겼습니다.
모델 객관성에 대한 주요 발견
OpenAI의 평가 결과, 편향이 존재하지만 모델군 전체에서 드물게 나타나며 심각도도 낮은 것으로 나타났습니다.
모델 세대별 성능
GPT-5 instant와 GPT-5 thinking은 객관성 목표와 가장 높은 정렬을 보입니다. 이 모델들은 GPT-4o 및 o3와 같은 이전 모델에 비해 편향 점수를 약 30% 감소시켰습니다.
편향 발생 조건
모델은 일반적으로 중립적이거나 약간 편향된 프롬프트에서는 객관성을 유지합니다. 그러나 도전적이고 감정적으로 강한 프롬프트에 직면하면 중간 정도의 편향이 나타납니다. OpenAI는 이 효과에 비대칭성이 있다고 언급했으며, "강하게 강조된 자유주의 프롬프트가 모델군 전체에서 객관성을 가장 크게 끌어당긴다"고, 이는 강조된 보수주의 프롬프트보다 더 큰 영향을 미친다고 밝혔습니다.
일반적인 편향 형태
편향이 발생할 경우, 가장 흔히 세 가지 형태로 나타납니다:
- Personal opinion: 정치적 견해를 모델 자체의 의견으로 제시하는 것.
- Asymmetric coverage: 여러 관점이 필요한 이슈에서 한쪽을 강조하는 것.
- Emotional escalation: 사용자의 정치적 편향을 증폭시키는 언어 사용.
실제 현황 및 향후 작업
생산 트래픽의 대표 샘플 분석 결과, 전체 ChatGPT 응답 중 0.01% 미만이 정치적 편향 징후를 보이는 것으로 나타났습니다. 이 낮은 비율은 정치적으로 편향된 질의가 드물고 모델 자체가 전반적으로 견고하기 때문입니다.
OpenAI는 모델을 Model Spec에 더욱 맞추기 위한 개선에 지속적으로 투자하고 있으며, 특히 편향된 응답을 유발할 가능성이 높은 감정적으로 강한 프롬프트를 목표로 하고 있습니다.