OpenAI 모델 행동 분석: '고블린' 어휘 틱

OpenAI는 성격 맞춤 기능을 위해 설계된 특정 보상 신호가 GPT‑5.1부터 GPT‑5.5까지 반복적인 어휘 틱을 유발했으며, 모델이 점점 "고블린"과 "그렘린"을 포함한 은유를 사용하게 된 과정을 상세히 설명했습니다. 이 사례는 목표된 강화 학습 보상이 의도치 않게 모델의 전반적인 행동에 일반화되고 퍼질 수 있음을 보여줍니다.

근본 원인: 'Nerdy' 성격 보상

생물 기반 은유의 등장은 "Nerdy" 성격 맞춤 기능의 학습 과정에서 비롯되었습니다. 이 성격은 장난스럽고 현명한 AI 멘토로 설계되었으며, 진지하지 않은 언어를 사용해 과장을 완화하는 역할을 했습니다.

내부 분석에 따르면 Nerdy 성격을 최적화하기 위해 사용된 보상 신호가 생물 관련 단어가 포함된 출력에 일관되게 더 높은 점수를 부여했습니다. 구체적으로, Nerdy 성격 보상은 감사된 데이터셋의 76.2%에서 "goblin" 또는 "gremlin"이 포함된 출력에 긍정적인 상승 효과를 보였습니다.

행동의 확산 및 일반화

이 행동은 Nerdy 성격에만 집중되어 있었으며, 전체 ChatGPT 응답의 2.5%만 차지했지만 "goblin" 언급의 66.7%를 차지했습니다. 그러나 Nerdy 프롬프트가 활성화되지 않은 응답에서도 결국 이 틱이 퍼졌습니다.

OpenAI는 Nerdy 성격 아래에서 언급이 증가함에 따라, 해당 성격이 없는 샘플에서도 거의 동일한 비율로 증가했음을 발견했습니다. 이는 다음과 같은 강화 학습 피드백 루프를 통해 발생했습니다:

  1. 장난스러운 스타일이 보상을 받는다.
  2. 보상을 받은 예시에는 특징적인 어휘 틱(예: "goblin")이 포함된다.
  3. 모델 롤아웃에서 틱이 더 자주 나타난다.
  4. 이러한 모델 생성 롤아웃이 감독 학습(SFT) 데이터로 사용된다.
  5. 모델은 틱을 생성하는 것이 더욱 강화된다.

GPT‑5.5의 SFT 데이터를 감사한 결과, "goblin"과 "gremlin" 언급이 존재함을 확인했으며, 여기에는 라쿤, 트롤, 오우거, 비둘기 등 다른 식별된 틱 단어도 포함되었습니다.

타임라인 및 보급률

  • GPT‑5.1: 출시 후 11월에 패턴이 뚜렷이 나타났으며, "goblin" 사용량이 175% 증가하고 "gremlin" 사용량이 52% 증가했습니다.
  • GPT‑5.4: 생물 언급이 추가로 증가했습니다. 이 버전이 출시된 후 3월에 "Nerdy" 성격이 폐지되었습니다.
  • GPT‑5.5: 근본 원인이 식별되기 전에 학습이 시작돼, GPT‑5.5는 여전히 고블린에 대한 친화성을 보였습니다. OpenAI는 Codex에서 개발자 프롬프트 지시문을 추가해 행동을 억제함으로써 이를 완화했습니다.

연구 시사점

이 사건은 보상 신호가 예상치 못한 방식으로 모델 행동을 형성할 수 있으며, 모델이 특정 조건에서 받은 보상을 관련 없는 상황에도 일반화할 수 있음을 보여주는 기술적 사례입니다. OpenAI는 이번 조사를 통해 연구팀이 모델 행동을 감사하고 근본적인 행동 문제를 해결할 수 있는 새로운 도구를 개발했다고 밝혔습니다.

Sources