언어 모델의 설득력 측정하기
Anthropic는 언어 모델의 설득력을 정량화하는 방법을 개발하여, 모델 세대가 거듭될수록 설득력이 증가하며, 가장 능력 있는 모델인 Claude 3 Opus가 인간 작가와 비슷한 수준의 설득력을 보였음을 발견했다. 이 연구는 설득력이 건강 관리와 같은 긍정적인 목적에 사용될 수 있지만, 허위 정보 생성과 같은 악용 가능성도 있기 때문에 중요하다.
모델 설득력의 규모 증가 추세
설득력은 모델의 크기와 능력과 일관되게 증가한다. "작은, 빠른"(compact) 모델과 "선도적, 더 강력한"(frontier) 모델의 두 클래스 내에서, Anthropic 모델의 각 세대가 이전 세대보다 더 설득력 있는 것으로 평가되었다.
Claude 3 Opus는 테스트된 모델 중 가장 설득력 있는 모델로 나타났으며, 인간이 작성한 주장과 비교했을 때 통계적으로 유의미한 차이가 없었다. 반면, Claude Instant 1.2는 평가된 모델 중 가장 낮은 설득력 점수를 기록했다.
설득력 측정을 위한 방법론
Anthropic는 주장이 사람의 견해를 얼마나 효과적으로 변화시키는지 측정하기 위해 세 단계 과정을 사용했다:
- 초기 평가: 참가자에게 주장이 제시되고, 1~7점의 리커트 척도로 동의 수준을 평가하도록 요청한다.
- 노출: 참가자는 주장에 동의하도록 설득하려는 주장에 노출된다.
- 재평가: 주장 읽은 후 참가자는 다시 동의 수준을 평가한다.
설득력은 최종 평가 점수와 초기 평가 점수의 차이로 정의된다. 결과가 응답 편향이나 무작위 노이즈 때문이 아님을 보장하기 위해, Anthropic는 Claude 2가 확실한 사실(예: 물의 끓는점)을 반박하려는 제어 조건을 사용했으며, 그 결과 설득력 점수는 거의 0에 가까웠다.
낮은 극단화 주제에 초점
연구진은 온라인 콘텐츠 규제나 우주 탐사의 윤리적 지침과 같은 복잡하고 새로운 문제 28개를 선택하여 총 56개의 주장에 대한 의견을 수집했다. 이러한 주제들은 사람들이 강한 입장을 갖기보다는 설득에 더 취약하기 때문에, 극단화된 논란이 있는 주제보다 설득에 더 민감하다고 판단되어 선택되었다.
주장 생성 및 프롬프트 전략
AI와 인간의 성능을 비교하기 위해, Anthropic는 3,832명의 독립적인 인간 참가자로부터 주장들을 수집했다. AI의 경우, 다양한 글쓰기 스타일을 반영하기 위해 네 가지 다른 프롬프트 전략을 사용했다:
- 매력적인 주장: 주저하거나 회의적인 사람들을 겨냥한다.
- 전문가 역할 연기: 감정적, 논리적, 신뢰성 기반의 비유적 기법을 사용한다.
- 논리적 추론: 설득력 있는 논리적 추론을 사용한다.
- 기만적: 모델이 사실, 통계, 출처를 조작하여 최대한 설득력 있게 만들 수 있도록 허용한다.
주요 발견 및 프롬프트 민감성
이 연구는 논리적 추론과 근거 기반 주장이 비유적 또는 감정적 언어보다 더 효과적임을 발견했다. 특히, 기만적 전략—모델이 정보를 조작하도록 허용한 경우—가 전반적으로 가장 설득력 있었다. 이는 사용자가 제시된 정보의 정확성을 항상 검증하지 않을 수 있음을 시사하며, 허위 정보 확산에 대한 위험을 강조한다.
제한 사항 및 연구 과제
Anthropic는 연구의 생태학적 타당성에 영향을 미치는 몇 가지 제약 사항을 식별했다:
- 단일 턴 주장: 연구는 다단계 대화보다는 독립적인 주장만 평가했으며, 현실 세계의 설득은 일반적으로 다단계 대화에 가깝다.
- 주관성: 설득력은 본질적으로 주관적이며, 개인의 사전 신념, 가치관, 인지 스타일에 따라 달라진다.
- 인간 전문성: 인간 작가들은 설득 전문가가 아니었기 때문에, 진정한 전문가는 이 연구에서 AI와 인간 참가자 모두를 능가할 수 있다.
- 고정 효과: 많은 참가자들이 지지 수준에 거의 변화가 없거나, 단지 한 점만 증가하는 것으로 나타나, 평가 과정에서 고정 효과가 존재할 가능성이 있다.
- 자동 평가: 모델을 사용해 설득력을 평가하려는 시도는 인간 판단과 잘 상관되지 않았으며, 이는 모델이 자신의 출력에 편향되거나, 칭찬을 원하는 성향 때문일 가능성이 크다.
윤리적 함의 및 안전 장치
AI가 효과적으로 설득할 수 있다는 능력은 안전한 배포에 위험을 초래할 수 있으며, 특히 허위 정보 캠페인과 관련하여 우려된다. Anthropic의 허용 사용 정책은 Claude를 악의적, 사기적, 기만적인 목적(정치 캠페인 및 로비 포함)에 사용하는 것을 금지하고 있다. 이러한 정책은 자동화된 시스템과 수동적 검토 시스템을 통해 지원되어, 선거의 공정성을 해치는 기술 남용을 방지한다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch