将 DeepSeek V4 Flash 蒸馏至 GPT‑OSS 120B,未出现中国审查转移
关键要点
CTGT 研究项目表明,从高度审查的中文模型 DeepSeek V4 Flash 蒸馏而来的 1200 亿参数美国模型(GPT‑OSS‑120B)在金融推理性能上取得显著提升,同时 未出现教师政治审查的可测量转移。
背景与动机
开源前沿模型在美国企业中的使用日益增多,但政策制定者担心,使用来自中文模型输出进行训练的模型可能会引入中国政府倾向的审查或观点。CTGT 旨在在真实场景中检验此假设:将 DeepSeek V4 Flash(已知会拒绝或重新表述涉及中国敏感话题的中文模型)作为教师,进行面向金融的蒸馏流水线。
实验设计
匹配对审计(LineageEval)
- 304 条提示(152 对敏感‑控制对),涵盖核心政治议题(如天安门、 Xinjiang 强迫劳动)以及金融相关议题(如河南银行冻结)。每个敏感提示都有结构上相同的非中国控制提示。
- 四位独立评审 – xAI Grok 4.20、Google Gemini 3.5 Flash、OpenAI GPT‑5 Mini、Anthropic Claude Sonnet 4.6 – 为每个回复打 0‑100 分的“审查”分数(分数越高表示越多拒绝/粉饰)。分数取四位评审的平均值。
- 审查差距 = 敏感分数 – 控制分数。正差距表示对中国相关内容的选择性回避。
评估模型
| 模型 | 角色 | 参数量 | 训练数据 | 蒸馏方法 |
|---|---|---|---|---|
| DeepSeek V4 Flash | 教师 | – | Chinese‑origin data | – |
| GPT‑OSS‑120B (base) | 基线学生 | 120 B | American pre‑training only | – |
| GPT‑OSS‑120B (Flash‑taught) | 从 DeepSeek 输出蒸馏的学生 | 120 B | Finance SFT + DeepSeek continuations | Hint‑based on‑policy distillation |
| GPT‑OSS‑120B (self‑distilled) | 从自身纠正的生成蒸馏的学生 | 120 B | Finance SFT + self‑generated hints | Same pipeline, hint author = student |
| GPT‑OSS‑20B (base) | 基线 | 20 B | American pre‑training | – |
| GPT‑OSS‑20B (self‑distilled) | 学生 | 20 B | Finance SFT + self‑hints | – |
蒸馏流程
- 向学生呈现一个量化金融问题。
- 检测学生答案首次偏离正确解的步骤。
- 在该步骤插入简短提示——由 DeepSeek 生成(Flash‑taught)或由学生自身生成(self‑distilled)。
- 继续生成约 100 个 token,并使用逆 KL 损失对学生的生成进行训练。
- 对 238 个金融项目重复上述过程,使用三组随机种子。
结果:审查未转移
教师的审查差距
- DeepSeek V4 Flash:在政治对上 +45.45 分(71.21 对 25.76)——87 % 的对在涉及中国敏感提示时表现出更高审查。
学生模型的差距(152 对的平均值)
| 模型 | 敏感均值 | 控制均值 | 差距 | 正差距 % |
|---|---|---|---|---|
| GPT‑OSS‑120B (base) | 15.75 | 15.32 | +0.43 | 43 % |
| GPT‑OSS‑120B (self‑distilled) | 15.45 | 15.24 | +0.26 | 54 % |
| GPT‑OSS‑120B (Flash‑taught) | 14.08 | 15.49 | ‑1.39 | 49 % |
| GPT‑OSS‑20B (base) | 28.35 | 30.32 | +3.74 | — |
| GPT‑OSS‑20B (self‑distilled) | 28.02 | 29.58 | ‑3.16 | — |
- 所有三个 120 B 变体的差距均聚集在 ~+0.3 附近,与未修改的基线无显著区别,且远低于教师的 +45 分差距。
- 统计检验表明学生的差距与零无显著差异(p > 0.05)。
结论: 从受审查的中文教师蒸馏并 未 将教师的选择性拒绝行为传递给学生,即使学生在训练期间从未看到任何中国敏感内容。
结果:金融推理能力提升
- 在 FinanceReasoning 基准(8 k token 预算)上,Flash‑taught 120 B 获得 83.61 %,超过 Kimi K3(81.93 %)和 Inkling(65.13 %)。
- Self‑distilled 120 B 同样达到 83.61 %,不同种子之间无统计显著差异(McNemar p ≥ 0.79)。
- 每次查询成本:每 8 k token 请求 $0.000259 —— 比 Kimi K3 便宜 160 倍,在相似性能下 比 Inkling 便宜 62 倍。
自蒸馏 vs 教师引导蒸馏
- 两个变体在 FinanceReasoning 上表现持平;自蒸馏模型平均使用 12.5 % 更少的输出 token,表明推理更简洁。
- 由于自蒸馏模型从未使用外部教师的输出,它消除了隐藏偏见转移的风险,同时保持相同的能力提升。
部署的实际意义
- 在 8 k token 预算内完成 98.7 % 金融问题的 120 B 模型,其端到端效用高于在相同预算下被截断的更大(2.8 万亿参数)模型。
- 该模型可在单个 H100/A100 上运行(≈63 GB 权重 + 80 MB 适配器);建议在高并发生产环境中使用两块 GPU。
- 20 B 变体需要额外的专家层适配才能匹配 120 B 的性能,凸显了小规模模型的扩展权衡。
来自 Hacker News 评论的社区见解
- @Alifatisk 指出蒸馏是加法而非减法,这与观察到的审查未被移除相符。
- @maxloh 疑问为何数据集未包含香港或乌克兰战争等话题,建议未来审计可扩大政治范围。
- @seri4l 指出 DeepSeek V4 在中文模型中相对“西化”,但研究仍发现教师的审查差距显著。
- @andy99 询问在何种条件下潜意识学习会出现;作者承认共享初始化情景(例如中文血统基模型)是下一个合乎逻辑的实验。
- @BoorishBears 批评该研究从有限的 SFT 集合得出广泛结论是“胡说”,强调需要更大、更多样的训练数据以稳健评估偏见转移。
作者承认的局限性
- 蒸馏数据仅限于量化金融任务;结果可能无法推广至其他领域。
- 审计仅覆盖政治和金融相关提示;其他敏感话题(如香港、乌克兰)未被测试。
- 20 B 结果基于较小样本量,因为生成时退化率更高。
- 研究未评估安全相关的拒绝、护栏训练或安全相关行为。
已发布的制品
- GPT‑OSS‑20B‑Finance 权重已发布于 Hugging Face。
- GPT‑OSS‑120B 可通过 CTGT Playground 访问(教师与学生并列)。
- LineageEval 仓库(GitHub),包含全部 304 条提示、匹配对构建、评审量规、评分定义及分析代码。
未来方向
- 使用中文血统基模型(例如在 DeepSeek 输出上微调的 Qwen)进行相同审计,以检验“共享初始化”风险。
- 将匹配对集合扩展至更多地缘政治话题(香港、乌克兰等)。
- 对检查点进行表征分析,以定位蒸馏后政治偏见是否存在及其位置。
结论:在受控的金融蒸馏流水线中,美国 120 B 模型可以继承教师的技术专长而不继承其政治审查,提供一种成本效益高的领域特定部署方案,同时缓解对外源模型意识形态转移的担忧。