Qwen 3.8 与 GPT-5.5 Pro 推理预填充分析

Qwen 3.8 显示出与 GPT-5.5 Pro 推理的高度一致性

实验结果表明,当 Qwen 3.8 A95B 的推理通道被预填充了教师模型前 1% 的推理内容时,其响应重叠度与 GPT-5.5 Pro 相比表现出显著增加。这表明 Qwen 3.8 可能使用了来自 GPT-5.5 Pro 或与其密切相关的 GPT 模型的推理轨迹进行过后训练。

在针对 45 个问题(15 个 STEM 问题、15 个非 STEM 问题和 15 个合成谜题)的测试中,当提供推理预填充时,Qwen 3.8 与教师模型可见答案的重叠度增加了 18.18 个百分点(从 16.79% 增加到 34.97%)。这种效应在 STEM 学科中最为显著,增幅为 +26.99 个百分点

按类别划分的性能指标

Category n Unprefilled GPT-5.5 Pro reasoning prefill Delta
STEM 15 19.26% 46.24% +26.99 pp
Non-STEM 15 20.62% 33.42% +12.80 pp
Puzzle 15 10.49% 25.23% +14.75 pp
All 45 16.79% 34.97% +18.18 pp

方法论:将推理预填充作为蒸馏信号

该实验利用“推理预填充”技术来检测潜在的模型蒸馏。该过程涉及从目标模型生成两种响应:

  1. 一个普通的、未预填充的响应。
  2. 一个将教师模型(GPT-5.5 Pro)前 1% 的推理内容插入到目标模型推理通道中的响应。

研究人员随后测量目标模型可见答案的前 100 个 token 与教师模型可见答案之间的重叠度(unigram、bigram 和 trigram source recall 的平均值)。如果出现高正向 Delta 值——即在提示教师模型的内部推理时,模型的输出变得显著地更像教师模型的输出——则被用作蒸馏的信号。

对比模型分析

虽然 Qwen 3.8 显示出剧烈的变化,但同一实验中测试的其他模型对 GPT-5.5 Pro 的预填充响应极小或呈现负向响应:

  • Kimi K3: 基准重叠度最高(31.11%),但在预填充后仅有 +4.54 pp 的适度增加。
  • Inkling: 显示出轻微的 +0.46 pp 的增加。
  • DeepSeek V4 Flash: 经历了轻微的 -1.17 pp 的下降。

研究人员指出,在之前的实验中,Qwen 对 Claude Opus 4.8 的趋同性很小,这与本研究中其向 GPT-5.5 Pro 的强力趋同形成了对比。

社区洞察与反论点

围绕这些结果的技术讨论突出了关于推理轨迹的几种替代解释和细微差别:

潜在的数据污染

一些观察者认为,重叠度可能不是有意图的蒸馏,而是数据污染。一位用户指出,Qwen 3.8 0902 在一篇关于“被盗的思想”的论文发布(8 月 10 日)之后进行了训练,因此可能在训练期间简单地看到了那些特定的推理轨迹。

风格化 vs. 智能转移

关于这些结果是表示真正的智能转移还是仅仅是风格化影响的争论正在进行中。正如一位评论者所言:

"While this result does imply there was some training on the reasoning trace and output of GPT 5.5, it doesn't tell us how much of the source of its training it was... And it doesn't tell us how much it is more a stylistic influence rather than being a genuine lifting over of intelligence."

观察性证据

一些用户报告了类似的推理模式的经验性证据。一位用户观察到,GPT-5.6 Sol's internal reasoning(通过工具调用泄露)镜像了 Qwen 3.8 27B 的推理块,特别是在几何优化问题中,这表明它们具有共同的推理轨迹谱系。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch