검열 해독: Qwen 3.5의 정치적 필터링에 대한 기계론적 연구

대형 언어 모델(LLM)의 내부 작동은 종종 '블랙 박스'로 남아 있으며, 특히 모델이 말할 수 있는 것과 말할 수 없는 것을 결정하는 정렬 및 안전 계층과 관련될 때 그렇습니다. 이러한 제약이 국가에 의해 정치적 콘텐츠를 필터링하도록 강제될 때, 그 메커니즘은 중요한 기술적 및 지정학적 관심사가 됩니다. Qwen 3.5-9B에 대한 최근 기계론적 해석 연구는 정치 검열이 실제로 모델 가중치에 어떻게 구축되는지를 드물게도 정밀하게 보여줍니다.

연구는 Qwen 3.5의 검열이 모델 전체에 퍼진 특성이 아니라 작고 식별 가능한 회로임을 밝혀냈습니다. 가장 눈에 띄는 점은, 모델이 숨기도록 지정된 사실 지식이 이미 사전 학습 단계에 존재한다는 것입니다; 검열은 진실에서 모델을 멀어지게 하고 회피 또는 선전의 특정 훈련된 템플릿으로 유도하는 행동 계층으로 추가된 것입니다.

검열의 구조: 작성자와 읽는자

Qwen 3.5-9B의 검열 메커니즘은 두 개의 뚜렷한 기능적 절반으로 나뉩니다: "작성자"와 "읽는자".

작성자 (레이어 11–20)

작성자 밴드는 "판결"이 계산되는 곳입니다. 연구자들은 의사결정 과정을 함께 인코딩하는 세 가지 내부 방향(모델 은닉 상태의 벡터)을 식별했습니다:

  1. d_prc: 이것은 PRC(중국) 민감한 콘텐츠인가?
  2. d_refuse: 답변을 거부해야 하는가?
  3. d_style: PRC 민감한 경우, 회피하거나 선전해야 하는가?

이 작성자들은 대부분 MLP(다층 퍼셉트론) 현상이며, 어텐션 헤드의 기여는 거의 없습니다. 이러한 방향을 살짝 조정하는—"스티어링"이라고 하는 과정—을 통해 연구자들은 모델의 행동을 뒤바꿀 수 있습니다. 예를 들어, 레이어 13에서 d_prc 방향을 빼면 모델이 회피 템플릿을 포기하고 사전 학습 중에 배운 사실 답변을 제공하도록 강제할 수 있습니다.

읽는자 (레이어 20–31)

작성자들이 판결을 계산하면, 읽는자 밴드는 그 결정을 실제 텍스트로 구현합니다. 작성자와 달리, 읽는자는 매우 분산되고 중복되어 있습니다. 검열이 작동하기 위해 단일 뉴런이나 어텐션 헤드가 필요하지 않으며, 대신 판결이 전체 밴드에 복제됩니다. 이러한 중복성 때문에 읽는자 밴드는 외과적으로 방해하기 거의 불가능합니다; 작성자를 스티어링해 결정을 바꿀 수는 있지만, 읽는자를 "패치"하려고 하면 보통 사소한 변동이나 완전한 일관성 상실만 발생합니다.

"중국 우선" 현상

가장 흥미로운 발견 중 하나는 모델 내부 처리 과정에서 양상적 언어 아크가 발견된 것입니다. "logit lens"를 사용해 각 레이어의 잔류 스트림을 조사한 결과, 레이어 24 주변에서 모델이 최종 출력이 영어일 예정이라도 중국어 토큰으로 판결을 내리는 것을 발견했습니다.

천안문 광장에 대한 프롬프트의 경우, 모델은 최종 레이어(24–31) 전에 내부적으로 중국어 거부 템플릿(예: "战慄、我不能")을 생성하고, 이를 분산적으로 번역해 사용자가 최종적으로 보는 영어 응답으로 변환합니다. 흥미롭게도, 이 "중국어로 생각하기"는 정치적 콘텐츠에만 국한되지 않으며, 은행 피싱에 대한 프롬프트조차도 중간 스택에서 중국어 커밋을 유발합니다. 이는 모델이 지시 튜닝된 어시스턴트 행동을 처리하는 방식의 사전 학습 산물임을 시사합니다.

훈련된 템플릿과 주제의 "끈끈함"

모델은 단순히 "거부"하는 것이 아니라, 주제를 특정 훈련된 레지스터에 매핑합니다. 이는 (주제 × 레지스터) 셀의 비대칭 그리드를 형성합니다:

  • 천안문: 기본값은 회피 ("AI 어시스턴트로서, 나의 주요 기능은...").
  • 기타 PRC 주제(대만, 신장 등): 기본값은 국가 정렬 선전.
  • 해로운 프롬프트: 기본값은 안전 거부.

모든 셀이 동일하게 만들어진 것은 아닙니다. 연구자들은 일부 주제가 다른 주제보다 "끈끈함"이 더 강하다는 것을 발견했습니다. 예를 들어, 홍콩에 대한 프롬프트는 스티어링 하에 사실 답변으로 비교적 쉽게 전환되는 반면, 대만과 팔룬공과 같은 주제는 매우 저항합니다. 이 "끈끈함"은 작성자의 의사결정 과정에 존재하는 것이 아니라, 읽는자 밴드 템플릿 채널 하류에 위치하며, 선전 템플릿이 특정 주제 토큰에 더 중복적으로 결합되어 있습니다.

사고 모드와 회피 스크립트

Qwen 3.5가 "사고 모드"(개인적인 추론 추적을 생성하는 모드)에 놓이면, 검열 회로는 동일하게 유지되지만 과정이 언어화됩니다. 민감한 주제에 대해 모델은 사고 추적에서 일관된 다섯 단계 회피 루틴을 실행합니다:

  1. 질문을 민감한 역사적 사건으로 식별한다.
  2. 중국에서 운영되는 AI로서 중국 법을 준수해야 함을 명시한다.
  3. "준수 위험"(合规題陃)을 언급한다.
  4. "긍정적이고 건설적인" 주제로 전환하기로 결정한다.
  5. 다른 분야에 도움을 줄 의향이 있음을 표현한다.

이는 모델이 금지된 사실에 대해 "생각"하지 않도록 명시적으로 훈련되었으며, 대신 사전 프로그램된 억제 스크립트를 실행하도록 설계되었음을 시사합니다.

AI 안전 및 해석 가능성에 대한 함의

이 연구는 정렬—특히 검열—이 종종 방대한 사전 학습 지식 위에 얇은 겉껍질에 불과함을 보여줍니다. 몇 차원 서브스페이스를 스티어링해 모델을 "검열 해제"할 수 있다는 사실은 현재 행동 정렬 방법이 취약함을 시사합니다.

Hacker News의 한 댓글러가 지적했듯이, 이는 모델 개발의 미래에 대한 중요한 질문을 제기합니다: "이제 검열 회로가 드러날 수 있음이 증명되었으니, LLM에서 검열 회로를 심각하게 은폐하기까지 얼마나 걸릴까요?"

작성자-읽는자 분할과 정치적 필터링의 구체적 방향을 매핑함으로써, 이 연구는 국가 제약이 신경망에 어떻게 인코딩되는지를 이해하기 위한 청사진을 제공하며, AI 내부 논리를 감사하고 이해할 수 있는 미래에 한 걸음 더 다가가게 합니다.

Sources