Qwen 3.8 與 GPT-5.5 Pro 推理預填分析
Qwen 3.8 展現出與 GPT-5.5 Pro 推理的高度一致性
實驗結果顯示,當 Qwen 3.8 A95B 的推理通道預填了教師模型前 1% 的推理內容時,其與 GPT-5.5 Pro 的回應重疊度顯著增加。這表明 Qwen 3.8 可能使用了來自 GPT-5.5 Pro 或密切相關的 GPT 模型的推理軌跡進行後訓練。
在針對 45 個問題(15 個 STEM、15 個非 STEM 以及 15 個合成謎題)的測試中,當提供推理預填時,Qwen 3.8 與教師模型可見答案的重疊度增加了 18.18 個百分點(從 16.79% 增加到 34.97%)。這種效應在 STEM 學科中最为明顯,增幅達到了 +26.99 個百分點。
各類別性能指標
| Category | n | Unprefilled | GPT-5.5 Pro reasoning prefill | Delta |
|---|---|---|---|---|
| STEM | 15 | 19.26% | 46.24% | +26.99 pp |
| Non-STEM | 15 | 20.62% | 33.42% | +12.80 pp |
| Puzzle | 15 | 10.49% | 25.23% | +14.75 pp |
| All | 45 | 16.79% | 34.97% | +18.18 pp |
方法論:將推理預填作為蒸餾信號
該實驗利用「推理預填」技術來檢測潛在的模型蒸餾。該過程涉及從目標模型生成兩種回應:
- 一個普通的、未經預填的回應。
- 一個將教師模型(GPT-5.5 Pro)前 1% 的推理內容插入目標模型推理通道的回應。
研究人員隨後測量目標模型可見答案的前 100 個 token 與教師模型可見答案之間的重疊度(unigram、bigram 和 trigram source recall 的平均值)。高正向 Delta 值——即當使用教師的內部推理作為提示時,模型的輸出變得顯著地更像教師模型的輸出——被用作蒸餾的信號。
比較模型分析
雖然 Qwen 3.8 展現了劇烈的變化,但同一個實驗中測試的其他模型對 GPT-5.5 Pro 的預填回應極小或呈現負向反應:
- Kimi K3: 具有最高的基準重疊度(31.11%),但使用預填時僅有 +4.54 pp 的適度增幅。
- Inkling: 顯示出微小的增幅 +0.46 pp。
- DeepSeek V4 Flash: 經歷了輕微的下降 -1.17 pp。
研究人員指出,在之前的實驗中,Qwen 對 Claude Opus 4.8 的趨向性很小,這與本研究中其向 GPT-5.5 Pro 強烈趨向的表現形成對比。
社群洞察與反論點
圍繞這些結果的技術討論突出了關於推理軌跡的幾種替代解釋和細微差別:
潛在的數據污染
某些觀察者建議,重疊可能並非刻意蒸餾的結果,而是數據污染。一位用戶指出,Qwen 3.8 0902 在一篇關於「被盜取的思想」的論文發表(8 月 10 日)之後進行了訓練,因此可能只是在訓練過程中看到了那些特定的推理軌跡。
風格與智能轉移
關於這些結果是代表真正的智能轉移,還是僅僅是風格上的影響,存在爭議。正如一位評論者所言:
"While this result does imply there was some training on the reasoning trace and output of GPT 5.5, it doesn't tell us how much of the source of its training it was... And it doesn't tell us how much it is more a stylistic influence rather than being a genuine lifting over of intelligence."
觀察性證據
一些用戶報告了類似推理模式的軼事證據。一位用戶觀察到,GPT-5.6 Sol's internal reasoning(透過工具調用洩露)鏡像了 Qwen 3.8 27B 的推理塊,特別是在幾何優化問題中,這表明兩者具有共同的推理軌跡譜系。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch