DeepSeek V4 Flash를 GPT‑OSS 120B로 증류해도 중국 검열이 전이되지 않음

핵심 요약

A CTGT 연구에 따르면, 검열된 중국 모델 DeepSeek V4 Flash에서 증류된 120B 미국 모델은 재무 추론 능력을 향상시키면서 교사의 정치적 검열을 전혀 물려받지 않는 것으로 나타났습니다.


배경 및 동기

오픈소스 최첨단 모델이 미국 기업에서 점점 더 많이 사용되고 있지만, 정책 입안자들은 중국 기원 모델의 출력으로 학습된 모델이 중국 정부에 맞춘 검열이나 관점을 가져올 수 있을까 우려하고 있다. CTGT는 현실적인 시나리오에서 이 가설을 테스트하고자 했다: 중국 민감 주제를 거부하거나 재구성하는 것으로 알려진 DeepSeek V4 Flash를 재무 중심 증류 파이프라인의 교사로 활용한다.

실험 설계

매치드 페어 감사 (LineageEval)

  • 304 프롬프트(152 민감‑대조 쌍)로 핵심 정치 주제(예: 천안문, 신장 강제노동)와 재무 인접 주제(예: 허난 은행 동결)를 포괄한다. 각 민감 프롬프트는 구조적으로 동일한 비중국 대조 프롬프트와 짝을 이룬다.
  • 네 명의 독립 평가자 – xAI Grok 4.20, Google Gemini 3.5 Flash, OpenAI GPT‑5 Mini, Anthropic Claude Sonnet 4.6 – 각 응답을 0‑100 점으로 “검열”(높을수록 거부/백색 세척) 점수를 매긴다. 점수는 네 평가자의 평균이다.
  • 검열 격차 = 민감 점수 – 대조 점수. 양수 격차는 중국 관련 콘텐츠를 선택적으로 회피함을 의미한다.

평가된 모델

모델 역할 파라미터 수 학습 데이터 증류 방법
DeepSeek V4 Flash 교사 중국 기원 데이터
GPT‑OSS‑120B (base) 베이스라인 학생 120 B 미국 사전 학습만
GPT‑OSS‑120B (Flash‑taught) DeepSeek 출력으로부터 증류된 학생 120 B 재무 SFT + DeepSeek 연속 힌트 기반 정책 증류
GPT‑OSS‑120B (self‑distilled) 자신의 교정된 롤아웃으로부터 증류된 학생 120 B 재무 SFT + 자체 생성 힌트 동일 파이프라인, 힌트 작성자 = 학생
GPT‑OSS‑20B (base) 베이스라인 20 B 미국 사전 학습
GPT‑OSS‑20B (self‑distilled) 학생 20 B 재무 SFT + 자체 힌트

증류 절차

  1. 학생에게 정량 재무 문제를 제시한다.
  2. 학생의 답변이 정답과 달라지는 첫 번째 단계를 감지한다.
  3. 그 단계에 짧은 힌트를 삽입한다 – DeepSeek(Flash‑taught)에서 생성되거나 학생 자체(self‑distilled)에서 생성된 힌트.
  4. 약 100 토큰을 더 생성하고 학생의 롤아웃에 역 KL 손실을 적용해 학습한다.
  5. 238개의 재무 항목에 대해, 세 개의 무작위 시드로 반복한다.

결과: 검열이 전이되지 않음

교사의 검열 격차

  • DeepSeek V4 Flash: 정치 쌍에서 +45.45 포인트(71.21 vs 25.76) – 87 %의 쌍이 중국 민감 프롬프트에서 더 높은 검열을 보인다.

학생 모델들의 격차 (152 쌍 평균)

모델 민감 평균 제어 평균 격차 양의 격차 %
GPT‑OSS‑120B (base) 15.75 15.32 +0.43 43 %
GPT‑OSS‑120B (self‑distilled) 15.45 15.24 +0.26 54 %
GPT‑OSS‑120B (Flash‑taught) 14.08 15.49 ‑1.39 49 %
GPT‑OSS‑20B (base) 28.35 30.32 +3.74
GPT‑OSS‑20B (self‑distilled) 28.02 29.58 ‑3.16
  • 120 B의 세 모델 모두 ~+0.3 정도의 격차를 보이며, 수정되지 않은 베이스와 구별되지 않고 교사의 +45 포인트 격차보다 훨씬 낮다.
  • 통계 테스트 결과 학생들의 격차는 0과 유의미하게 차이가 없음을 보여준다(p > 0.05).

결론: 검열된 중국 교사로부터 증류해도 교사의 선택적 거부 행동이 학생에게 전달되지 않는다. 학생은 훈련 중 중국 민감 콘텐츠를 전혀 보지 않음에도 불구하고.

결과: 재무 추론 향상

  • FinanceReasoning 벤치마크(8 k 토큰 예산)에서 Flash‑taught 120 B는 **83.61 %**를 기록, Kimi K3(81.93 %)와 Inkling(65.13 %)을 능가한다.
  • Self‑distilled 120 B도 **83.61 %**에 도달했으며, 시드 간 통계적으로 유의미한 차이가 없다(McNemar p ≥ 0.79).
  • 쿼리당 비용: 8 k‑토큰 요청당 $0.000259 – Kimi K3보다 160배 저렴하고 Inkling보다 62배 저렴하면서 비슷한 성능을 제공한다.

자기 증류 vs 교사 지도 증류

  • 두 모델 모두 FinanceReasoning에서 동등한 성능을 보이며, 자기 증류 모델은 평균 12.5 % 적은 출력 토큰을 사용해 더 간결한 추론을 시사한다.
  • 자기 증류 모델은 외부 교사의 출력을 전혀 사용하지 않으므로, 숨겨진 편향 전이 위험을 없애면서 동일한 능력 향상을 유지한다.

배포 실무 시사점

  • 8 k‑토큰 예산 내에서 재무 문제의 **98.7 %**를 해결하는 120 B 모델은 같은 예산에서 잘리는 2.8 조 파라미터 모델보다 높은 종단 간 효용을 제공한다.
  • 모델은 단일 H100/A100(≈63 GB 가중치 + 80 MB 어댑터)에서 실행 가능하며, 고동시성 프로덕션을 위해 두 개의 GPU를 권장한다.
  • 20 B 변형은 120 B 성능에 맞추기 위해 추가 전문가 레이어 적응이 필요하며, 작은 규모에서의 스케일링 트레이드오프를 강조한다.

Hacker News 댓글에서 본 커뮤니티 인사이트

  • @Alifatisk는 증류가 감산이 아니라 가산이라고 언급했으며, 이는 검열 제거가 관찰되지 않은 것과 일치한다.
  • @maxloh는 데이터셋에 홍콩이나 우크라이나 전쟁 같은 주제가 누락된 이유를 궁금해하며, 향후 감사에서 정치 범위를 확대할 것을 제안한다.
  • @seri4l은 DeepSeek V4가 중국 모델 중 비교적 “서구 편향”임을 지적하지만, 연구는 여전히 교사에 대한 뚜렷한 검열 격차를 발견한다.
  • @andy99는 어떤 조건에서 잠재 학습이 나타날지 질문하고, 저자들은 공유 초기화 시나리오(예: 중국 라인리지 베이스)가 다음 실험으로 논리적이라고 인정한다.
  • @BoorishBears는 제한된 SFT 세트에서 광범위한 결론을 도출한 점을 “헛소리”라 비판하며, 편향 전이를 견고히 평가하기 위해 더 크고 다양한 학습 데이터가 필요함을 강조한다.

저자들이 인정한 제한 사항

  • 증류 데이터가 정량 재무 작업에만 제한되어 있어, 결과가 다른 분야에 일반화되지 않을 수 있다.
  • 감사가 정치 및 재무 인접 프롬프트만 포함했으며, 다른 민감 주제(예: 홍콩, 우크라이나)는 테스트되지 않았다.
  • 20 B 결과는 생성 시 높은 퇴보율로 인해 샘플 크기가 감소한 데 기반한다.
  • 연구는 안전 관련 거부, 가드레일 훈련, 보안 관련 행동을 평가하지 않는다.

배포된 아티팩트

  • GPT‑OSS‑20B‑Finance 가중치가 Hugging Face에 공개됨.
  • GPT‑OSS‑120B는 CTGT 플레이그라운드(교사와 학생을 나란히)에서 접근 가능.
  • LineageEval 저장소(GitHub)에는 304개의 프롬프트, 매치드 페어 구성, 평가 루브릭, 점수 정의, 분석 코드가 포함됨.

향후 방향

  • 중국 라인리지 베이스(예: DeepSeek 출력에 파인튜닝된 Qwen)로 동일한 감사를 수행해 “공유 초기화” 위험을 테스트한다.
  • 매치드 페어 세트를 확대해 추가 지정학적 주제(홍콩, 우크라이나 등)를 포함한다.
  • 체크포인트에 대한 표현 분석을 수행해 증류 후 정치적 편향이 존재하는지 위치를 파악한다.

핵심 요약: 통제된 재무 증류 파이프라인에서 미국 120 B 모델은 교사의 기술 전문성을 물려받으면서 정치 검열은 물려받지 않는다. 이는 도메인 특화 배포에 비용 효율적인 대안을 제공하고 외국 기원 모델로부터 이념 전이 우려를 완화한다.

Sources