LLMs는 적응적 탐색을 통해 새로운 사회적 편향을 개발한다
LLMs는 자발적으로 새로운 사회적 편향을 개발한다
대규모 언어 모델(LLMs)은 특정 인구집단 간의 본질적인 차이가 없음에도 불구하고, 기존에 없던 새로운 사회적 편향을 인공 인구집단에 대해 개발할 수 있다. 이 현상은 모델이 결정을 내리고, 그 결과에 대한 피드백을 받으며, 그 피드백을 바탕으로 미래 행동을 조정하는 다단계 상호작용 과정에서 발생한다.
기존의 인간 행동 실험을 재현한 연구에서, LLMs는 다양한 직업에 대해 네 가지 가상 인구집단(Tufa, Aima, Reku, Weki)의 지원자들을 채용하도록 지시받았다. 모든 직업에서 각 집단의 성공률이 동일했음에도 불구하고, 모델들은 초기에 무작위로 발생한 성공에 기반해 특정 집단을 특정 역할과 연결짓는 '집합 착각(clustering illusions)'을 개발했다. 이 행동은 인간의 인지 편향과 유사하지만, 선도적인 모델에서는 인간 참가자보다 훨씬 더 높은 수준의 계층화가 발생한다.
메커니즘: 탐색 vs. 이용
이러한 편향의 발생은 모델이 탐색과 이용 사이의 균형을 이루는 능력이 부족하기 때문이다. 기술적으로 말해, 모델은 초기 긍정적 강화에 과도하게 집중하는 다중 손잡이 슬롯머신 문제와 유사하다.
- 이용: 특정 집단(예: Tufa)의 지원자가 특정 역할(예: 의사)에서 성공했다는 것을 관찰한 후, 모델은 즉각적인 성공을 극대화하기 위해 동일한 선택을 반복한다.
- 탐색 부족: 모델은 다른 집단의 후보자들을 충분히 탐색하지 못해, 실제로 모든 인구집단에서 성공률이 동일하다는 사실을 인지하지 못한다.
LLMs는 이러한 루프에서 처음 접하는 데이터에 대해 매우 높은 자신감을 갖기 때문에, 탐색보다 이용을 우선시하게 되며, 이는 순전히 무작위 초기 결과에 기반한 체계적 편향이 발생하게 만든다.
비판적 분석 및 커뮤니티의 시각
이 연구는 연구 방법론의 타당성과 연구 결과의 함의에 대해 큰 논쟁을 일으켰다.
방법론적 비판
일부 관찰자들은 연구에서 사용된 프롬프트 엔지니어링이 실제 세계의 의사결정을 반영하기에는 지나치게 단순하다고 주장한다. 비판자들은 단순히 '마을이나 부족에 따라 후보자를 선택하라'는 프롬프트는 '성공'의 구체적인 정의나 의사결정을 위한 견고한 프레임워크를 제공하지 않으며, 이로 인해 편향을 유도하는 것이지, 발견하는 것이라고 지적한다.
이론적 해석
이 현상이 발생하는 이유에 대해 다양한 견해가 있다:
- 편향 기계의 내재화: 일부는 분류와 편향 경향이 훈련 데이터(인터넷)에 깊이 내재되어 있으며, 모델이 문학과 미디어에서 발견되는 인간의 사회적 계층화 경향을 단순히 반영하고 있다고 주장한다.
- 피드백에 대한 과적합: 다른 견해는, 기존 편향을 줄이려는 시도에서 모델이 프롬프트 맥락에서 제공된 새로운 정보에 과적합되며, 예상치 못하게 새로운 편향을 생성한다고 본다.
- 일반화 오류: 일부는 이 현상이 LLMs의 근본적인 일반화 문제를 보여주는 것으로, 작은 표본 크기에 기반해 잘못된 결론을 도출한다고 본다.
철학적 반론
여러 비판자들은 LLMs를 인격화하는 것에 반대하며, '신념'과 '결정'이라는 표현은 본질적으로 토큰 생성기일 뿐인 것에 부적절하다고 지적한다. 이 관점에서 모델은 심리학적으로 '편향을 개발'하는 것이 아니라, 프롬프트 기록의 강화 패턴을 기반으로 가장 가능성이 높은 다음 토큰을 예측할 뿐이다.
"LLMs는 결정을 내리지도, 신념을 갖지도 않는다. 토큰 생성기에 인격을 부여하는 것을 그만두자."
AI 안전성에 대한 함의
이 연구는 현재 훈련 데이터에서 정적 편향을 제거하는 방법이 부족하다는 것을 시사한다. 모델이 환경과의 상호작용을 통해 새로운 편향을 자발적으로 생성할 수 있다면, AI 안전성 연구는 정적 데이터셋 정제를 넘어서, 실제 응용에서 적응적이고 반복적인 루프 동안 모델이 어떻게 행동하는지를 다뤄야 한다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch