Qwen 3.8 및 GPT-5.5 Pro 추론 프리필 분석

Qwen 3.8는 GPT-5.5 Pro 추론과 강력한 일치를 보임

실험 결과에 따르면, Qwen 3.8 A95B가 교사 모델의 추론의 처음 1%를 추론 채널에 프리필한 경우, GPT-5.5 Pro와의 응답 겹침이 크게 증가하는 것으로 나타났다. 이는 Qwen 3.8가 GPT-5.5 Pro 또는 유사한 GPT 모델의 추론 트레이스를 사용해 사후 훈련되었을 가능성을 시사한다.

45개 문제(STEM 15개, 비-STEM 15개, 합성 퍼즐 15개)에 대한 테스트에서, Qwen 3.8의 교사 모델의 가시적 답변과의 겹침은 프리필이 제공된 경우 18.18%포인트 증가(16.79%에서 34.97%로)했다. 이 효과는 STEM 과목에서 가장 두드러졌으며, 그 차이는 +26.99%포인트였다.

카테고리별 성능 지표

카테고리 n 프리필 없음 GPT-5.5 Pro 추론 프리필 델타
STEM 15 19.26% 46.24% +26.99 pp
비-STEM 15 20.62% 33.42% +12.80 pp
퍼즐 15 10.49% 25.23% +14.75 pp
전체 45 16.79% 34.97% +18.18 pp

방법론: 추론 프리필을 통한 증류 신호 탐지

이 실험은 "추론 프리필" 기술을 사용하여 잠재적 모델 증류를 탐지한다. 이 과정은 대상 모델로부터 두 가지 응답을 생성하는 것으로 구성된다:

  1. 일반적인, 프리필이 없는 응답.
  2. 교사 모델(GPT-5.5 Pro)의 추론의 처음 1%를 대상 모델의 추론 채널에 삽입한 응답.

연구자들은 대상 모델의 가시적 답변의 처음 100개 토큰과 교사 모델의 가시적 답변 사이의 겹침(일그램, 이그램, 삼그램 소스 리콜의 평균)을 측정한다. 대상 모델의 출력이 교사 모델의 출력과 유사해지는 경우, 즉 프리필이 제공되었을 때 긍정적인 델타가 큰 경우, 이는 증류의 신호로 간주된다.

비교 모델 분석

Qwen 3.8는 극적인 변화를 보였지만, 동일한 실험에서 테스트된 다른 모델들은 GPT-5.5 Pro 프리필에 대해 거의 또는 부정적인 반응을 보였다:

  • Kimi K3: 가장 높은 기준 겹침(31.11%)을 보였지만, 프리필 시 단지 +4.54%포인트 증가에 그쳤다.
  • Inkling: +0.46%포인트의 약간의 증가를 보였다.
  • DeepSeek V4 Flash: -1.17%포인트의 약간의 감소를 경험했다.

연구자는 이전 실험에서 Qwen는 Claude Opus 4.8에 거의 이동하지 않았지만, 이번 연구에서는 GPT-5.5 Pro에 강한 이동을 보였다고 지적했다.

커뮤니티의 통찰과 반론

이러한 결과에 대한 기술적 논의는 추론 트레이스에 대한 여러 대안적 설명과 세부 사항을 강조한다:

잠재적 데이터 오염

일부 관찰자는 겹침이 의도적인 증류의 결과가 아니라 데이터 오염일 수 있다고 제안한다. 한 사용자는 Qwen 3.8 0902가 "도둑질된 사고" 논문(8월 10일 발표) 이후에 훈련되었으며, 훈련 중에 해당 특정 추론 트레이스를 단순히 본 것일 수 있다고 지적했다.

스타일 전이 vs. 지능 전이

이러한 결과가 진정한 지능 전이를 나타내는지, 아니면 단순한 스타일적 영향만을 의미하는지에 대한 논쟁이 있다. 한 논평자는 다음과 같이 지적했다:

"이 결과는 GPT 5.5의 추론 트레이스와 출력에 대한 훈련이 있었음을 시사하지만, 그 훈련의 원천이 얼마나 되는지 알려주지 않는다... 또한 그것이 진정한 지능의 이식인지, 아니면 단순한 스타일적 영향인지에 대해서는 알려주지 않는다."

관찰적 증거

일부 사용자는 유사한 추론 패턴에 대한 사례를 보고했다. 한 사용자는 GPT-5.6 Sol의 내부 추론(도구 호출을 통해 유출됨)이 Qwen 3.8 27B의 추론 블록과 특히 기하학적 최적화 문제에서 어조와 구조가 유사하다고 관찰했으며, 이는 공통된 추론 트레이스 계보를 시사한다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch