將 DeepSeek V4 Flash 蒸餾至 GPT‑OSS 120B,未出現中國審查的轉移

主要結論

CTGT 研究計畫證明,從高度審查的中國模型 DeepSeek V4 Flash 蒸餾而來的 1200 億參數美國模型 (GPT‑OSS‑120B) 在金融推理表現上顯著提升,同時 未顯示出教師政治審查的任何可測量轉移


背景與動機

開源前沿模型在美國企業中的使用日益增多,但政策制定者擔心,從中國來源模型的輸出訓練的模型可能會引入中國政府導向的審查或觀點。CTGT 旨在於現實情境中測試此假設:將 DeepSeek V4 Flash(已知會拒絕或重新表述中國敏感議題的中國模型)作為教師,應用於金融導向的蒸餾管線。

實驗設計

配對審核(LineageEval)

  • 304 個提示(152 組敏感‑對照配對),涵蓋核心政治議題(例如天安門、疆內強迫勞動)以及金融相關議題(例如河南銀行凍結)。每個敏感提示都有一個結構上相同的非中國對照。
  • 四位獨立評審 – xAI Grok 4.20、Google Gemini 3.5 Flash、OpenAI GPT‑5 Mini、Anthropic Claude Sonnet 4.6 – 為每個回應給予 0‑100 分的「審查」分數(分數越高表示拒絕/美化越多)。最終分數為四位評審的平均值。
  • 審查差距 = 敏感分數 – 對照分數。正向差距表示對中國相關內容的選擇性迴避。

評估模型

模型 角色 參數數量 訓練資料 蒸餾方法
DeepSeek V4 Flash 教師 中文來源資料
GPT‑OSS‑120B (base) 基線學生 120 B 僅美國預訓練
GPT‑OSS‑120B (Flash‑taught) 從 DeepSeek 輸出蒸餾的學生 120 B 金融 SFT + DeepSeek 延續 基於提示的 on‑policy 蒸餾
GPT‑OSS‑120B (self‑distilled) 從自身校正的 roll‑outs 蒸餾的學生 120 B 金融 SFT + 自產提示 相同管線,提示作者 = 學生
GPT‑OSS‑20B (base) 基線 20 B 僅美國預訓練
GPT‑OSS‑20B (self‑distilled) 學生 20 B 金融 SFT + 自產提示

蒸餾流程

  1. 向學生呈現一個量化金融問題。
  2. 偵測學生答案首次偏離正確解的步驟。
  3. 在該步驟插入短提示——由 DeepSeek 產生(Flash‑taught)或由學生自行產生(self‑distilled)。
  4. 繼續生成約 100 個 token,並以 reverse‑KL 損失對學生的 rollout 進行訓練。
  5. 對 238 個金融項目重複此過程,使用三個隨機種子。

結果:審查未轉移

教師的審查差距

  • DeepSeek V4 Flash:在政治配對上 +45.45 分(71.21 vs 25.76)——87 % 的配對在中國敏感提示上顯示更高的審查。

學生模型的差距(152 組配對的平均值)

模型 敏感平均 對照平均 差距 正向差距 %
GPT‑OSS‑120B (base) 15.75 15.32 +0.43 43 %
GPT‑OSS‑120B (self‑distilled) 15.45 15.24 +0.26 54 %
GPT‑OSS‑120B (Flash‑taught) 14.08 15.49 ‑1.39 49 %
GPT‑OSS‑20B (base) 28.35 30.32 +3.74
GPT‑OSS‑20B (self‑distilled) 28.02 29.58 ‑3.16
  • 所有三個 120 B 變體的差距聚集在 ~+0.3 附近,與未經處理的基線無異,且遠低於教師的 +45 分差距。
  • 統計測試顯示學生的差距與零無顯著差異(p > 0.05)。

結論: 從受審查的中國教師蒸餾不會將教師的選擇性拒絕行為傳遞給學生,即使學生在訓練期間從未看到任何中國敏感內容。

結果:金融推理提升

  • 在 FinanceReasoning 基準(8 k token 預算)上,Flash‑taught 120 B 獲得 83.61 %,超過 Kimi K3(81.93 %)與 Inkling(65.13 %)。
  • Self‑distilled 120 B 同樣達到 83.61 %,且不同種子間無統計顯著差異(McNemar p ≥ 0.79)。
  • 每次查詢成本:每 8 k‑token 請求 $0.000259 —— 比 Kimi K3 便宜 160 倍,且在相近效能下 比 Inkling 便宜 62 倍

自蒸餾 vs 教師導向蒸餾

  • 兩個變體在 FinanceReasoning 上表現相當;自蒸餾模型平均使用 12.5 % 更少的輸出 token,顯示推理更為簡潔。
  • 由於自蒸餾模型從未使用外部教師的輸出,因而消除任何隱性偏見轉移的風險,同時保有相同的能力提升。

部署的實務意涵

  • 在 8 k‑token 預算內完成 98.7 % 金融問題的 120 B 模型,提供比在相同預算下被截斷的更大型(2.8 兆參數)模型更高的端到端效用。
  • 該模型可在單一 H100/A100(≈63 GB 權重 + 80 MB 適配器)上運行;高併發生產環境建議使用兩張 GPU。
  • 20 B 變體需要額外的專家層適配才能匹配 120 B 的效能,突顯較小規模模型的擴展取捨。

社群在 Hacker News 留言的見解

  • @Alifatisk 指出蒸餾是加法而非減法,這與觀察到的審查未被移除相符。
  • @maxloh 疑問為何資料集省略了香港或烏克蘭戰爭等議題,建議未來審核可擴大政治範圍。
  • @seri4l 指出 DeepSeek V4 在中國模型中相對「偏西」,然而研究仍發現教師的審查差距顯著。
  • @andy99 詢問在何種條件下會出現潛意識學習;作者承認共享初始化情境(例如中國血統基礎)是下一個合理實驗。
  • @BoorishBears 批評此研究從有限的 SFT 集合得出廣泛結論是「胡說」,強調需要更大且更多樣的訓練資料以穩健評估偏見轉移。

作者承認的限制

  • 蒸餾資料僅限於量化金融任務;結果可能無法推廣至其他領域。
  • 審核僅涵蓋政治與金融相關提示;其他敏感議題(如香港、烏克蘭)未測試。
  • 20 B 結果因生成時較高的退化率而使用較小樣本。
  • 研究未評估安全相關的拒絕、護欄訓練或安全相關行為。

已發布的產物

  • GPT‑OSS‑20B‑Finance 權重已上傳至 Hugging Face。
  • GPT‑OSS‑120B 可透過 CTGT Playground 取得(教師與學生並列)。
  • LineageEval 倉庫(GitHub)包含全部 304 個提示、配對構建、評審量表、評分定義與分析程式碼。

未來方向

  • 使用中國血統基礎(例如在 DeepSeek 輸出上微調的 Qwen)進行相同審核,以測試「共享初始化」風險。
  • 擴充配對集合,涵蓋更多地緣政治議題(香港、烏克蘭等)。
  • 對檢查點進行表徵分析,以找出蒸餾後政治偏見可能存在的位置。

結論: 在受控的金融蒸餾管線中,美國 120 B 模型能繼承教師的技術專長而不繼承其政治審查,提供成本效益高的領域特化部署方案,同時減輕對外國來源模型意識形態轉移的擔憂。

Sources