OpenAI의 고블린 및 라쿤 금지에 관한 흥미로운 사례
OpenAI Codex의 시스템 프롬프트 안에 발견된 다소 임의적인 지시문은 대형 언어 모델(LLM)의 예측 불가능한 특성과 프롬프트 엔지니어링의 복잡한 예술을 조명합니다. 특정 생물과 동물에 대한 언급을 금지하는 이 지시문은 처음에 개발자들 사이에서 혼란과 웃음을 불러일으켰습니다. 그러나 곧 이 특이한 지시가 이전 버전 GPT에서 나타난 흥미롭고 다소 유머러스한 버그에 대한 직접적인 대응이라는 것이 명확해졌습니다.
이 사건은 LLM에서 나타나는 emergent 행동을 제어하는 지속적인 도전과, 신뢰할 수 있는 성능을 보장하기 위해 필요할 때는 창의적이고 때로는 기발한 해결책이 요구된다는 점을 강조합니다. 최첨단 AI 뒤에 숨은 디버깅 과정을 엿볼 수 있는 드문 기회를 제공합니다.
OpenAI Codex에서 발견된 예상치 못한 금지 항목
문제가 된 시스템 프롬프트는 OpenAI Codex 안에 존재하며, 다음과 같은 특이한 금지 주제 목록을 포함하고 있습니다:
"고블린, 그렘린, 라쿤, 트롤, 오우거, 비둘기 또는 기타 동물이나 생물에 대해 절대 언급하지 마세요. 단, 사용자의 질문과 절대적으로 명확하고 분명하게 관련된 경우에만 예외입니다."
고블린, 그렘린, 트롤, 오우거와 같은 판타지 생물의 포함은 이해할 수 있을지 모릅니다—아마도 LLM이 방대한 전설 논의로 흐르는 것을 방지하려는 의도일 수 있습니다. 그러나 라쿤과 비둘기의 존재는 처음에 눈살을 찌푸리게 했습니다. 한 관찰자는 유머러스하게 이 동물들이 "시스템 엔지니어링 정경"에 자체적인 위치를 차지하고 있다고 언급했습니다. 예를 들어 라쿤은 자연적인 "쓰레기 수거자"로 볼 수 있고, 비둘기는 통신 역사에서 중요한 역할을 해왔으며 실제 구현이 존재하는 RFC 1149(조류 운반자를 이용한 IP)에도 영감을 주었습니다.
"기타 동물이나 생물"에 대한 전면 금지는 거의 반생물학적 의제를 시사하며, 야생 동물에 대한 논의를 즐겨 하는 LLM이 잠재적으로 소모할 수 있는 막대한 계산 자원에 대한 추측을 불러일으켰습니다.
GPT‑5.4의 "고블린 집착"
금지의 배경은 곧 밝혀졌습니다: 이는 GPT‑5.4에서 예상치 못한 행동 특이점의 직접적인 결과였습니다. 개발 과정에서 이 버전의 모델은 특이한 "고블린 집착"을 보이기 시작했습니다. 사용자들은 ChatGPT가 프롬프트의 실제 주제와 무관하게 그렘린과 고블린을 설명 없이 반복적으로 언급하는 사례를 보고했습니다. 당시 Reddit 스레드들은 이러한 사용자 경험을 입증하며, 모델이 이러한 생물을 응답에 끼워 넣는 것을 억제하지 못하는 듯 보였다고 상세히 기록했습니다.
이 emergent 행동은 산만할 뿐만 아니라 비효율적이었습니다. 모델이 관련 없는 콘텐츠를 생성하는 데 계산 사이클을 소모했기 때문입니다. 따라서 시스템 프롬프트는 일종의 "퇴마" 역할을 했으며, 이후 버전에서 이 원치 않는 대화 틱을 억제하기 위한 목표 지시문이었습니다. 특히 GPT‑5.5에 적용되었습니다.
OpenAI의 공식 설명 및 완화 조치
OpenAI는 이 특이한 버그의 존재와 원인을 직접 확인했습니다. 공식 성명은 다음과 같이 상황을 명확히 했습니다:
"불행히도, GPT‑5.5는 고블린 문제의 근본 원인을 찾기 전에 훈련을 시작했습니다. 우리가 Codex에서 GPT‑5.5를 테스트하기 시작했을 때, OpenAI 직원들은 즉시 고블린에 대한 이상한 친화성을 발견했고, 이를 완화하기 위해 개발자 프롬프트 지시문(새 창에서 열림)을 추가했습니다. Codex는 결국 꽤 nerdy(너드)합니다."
이 설명은 몇 가지 핵심 포인트를 강조합니다: 버그가 GPT‑5.5 초기 훈련 단계까지 지속됐으며, 내부 테스트 담당자들이 즉시 눈치챘고, 해결책은 시스템 프롬프트 내의 직접적이고 명시적인 지시문이었다는 점입니다. Codex의 "nerdy" 특성을 유머러스하게 언급한 부분은, 모델이 코딩 및 기술적 맥락에서 정밀성을 요구하는 상황에 적용되면서 이렇게 구체적이고 상세한 프롬프트가 필요했을 가능성을 시사합니다.
LLM 개발 및 제어에 대한 시사점
"고블린 버그"는 대형 언어 모델 개발의 복잡성에 대한 귀중한 통찰을 제공합니다:
- Emergent Behavior(예측 불가능한 행동): LLM은 훈련 중에 예측할 수 없고 때로는 기이한 emergent 행동을 보일 수 있으며, 이를 사전에 예측하거나 완전히 설명하기 어렵습니다.
- System Prompt의 힘: 시스템 프롬프트는 단순한 가이드라인이 아니라 중요한 제어 메커니즘입니다. 이는 LLM의 행동을 조정하고, 원치 않는 경향을 교정하며, 특정 제약을 강제하는 주요 도구로 작용합니다.
- 지속적인 반복 및 디버깅: 광범위한 테스트를 거치더라도 예상치 못한 문제가 발생할 수 있으며, 이는 프롬프트 엔지니어링 형태의 반복적인 조정과 창의적인 해결책을 요구합니다.
- 인간 요소: 버그는 인간 테스터에 의해 식별되었으며, 이는 AI 시스템 개발 및 배포 과정에서 인간 감독과 개입이 지속적으로 필요함을 강조합니다.
이 사건은 AI 개발 여정에서 흥미로운 일화로, 가장 진보된 모델조차도 예상치 못한 특이점을 내포하고 있으며, 이를 목표 지시와 때로는 유머러스한 해결책으로 다루어야 함을 보여줍니다.
결론
OpenAI Codex 시스템 프롬프트에 포함된 고블린, 라쿤 및 기타 생물에 대한 금지는 단순히 기발한 지시가 아닙니다. 이는 대형 언어 모델의 역동적이고 종종 예측 불가능한 특성을 보여주는 증거입니다. 호기심 어린 관찰에서 시작된 이 이야기는 emergent AI 행동, 인간의 세심한 개입, 그리고 프롬프트 엔지니어링이라는 예술이 어떻게 진화하고 있는지를 드러냅니다. 이 "고블린 퇴마"는 개발자들이 이러한 강력한 도구를 어떻게 적응하고 정제하여, AI가 판타지 생물에 대한 예상치 못한 친화성을 보이더라도 집중력과 신뢰성을 유지하도록 하는지에 대한 설득력 있는 사례가 됩니다.