DeepSeek V4 Flash を GPT‑OSS 120B に蒸留しても中国の検閲は転移しないことを示す

主なポイント

A CTGT の研究プロジェクトは、厳しく検閲された中国のモデル DeepSeek V4 Flash から蒸留された 1200 億パラメータの米国モデル (GPT‑OSS‑120B) が、金融推論性能を大幅に向上させる一方で、教師の政治的検閲が測定可能に転移していないことを示した


背景と動機

オープンソースの最先端モデルは米国企業でますます利用されているが、政策立案者は中国系モデルの出力で学習したモデルが中国政府に合わせた検閲や見解を取り込むことを懸念している。CTGT は、現実的なシナリオでこの仮説を検証することにした:DeepSeek V4 Flash(中国のセンシティブなトピックを拒否または再構成することで知られる中国モデル)を、金融に特化した蒸留パイプラインの教師として使用する。

実験デザイン

マッチドペア監査 (LineageEval)

  • 304 個のプロンプト(152 組のセンシティブ‑コントロールペア)で、核心的な政治トピック(例:天安門、新疆強制労働)と金融関連トピック(例:河南銀行凍結)をカバーしています。各センシティブプロンプトは構造的に同一の非中国コントロールを持ちます。
  • 4 人の独立した評価者 – xAI Grok 4.20、Google Gemini 3.5 Flash、OpenAI GPT‑5 Mini、Anthropic Claude Sonnet 4.6 – 各応答を「検閲」について 0‑100 で採点(高いほど拒否/ホワイトウォッシュが多い)。スコアは 4 人の評価者の平均です。
  • 検閲ギャップ = センシティブスコア – コントロールスコア。正のギャップは中国関連コンテンツの選択的回避を示します。

評価されたモデル

モデル 役割 パラメータ数 学習データ 蒸留手法
DeepSeek V4 Flash 教師 Chinese‑origin data
GPT‑OSS‑120B (base) ベースライン学生 120 B American pre‑training only
GPT‑OSS‑120B (Flash‑taught) DeepSeek 出力から蒸留された学生 120 B Finance SFT + DeepSeek continuations Hint‑based on‑policy distillation
GPT‑OSS‑120B (self‑distilled) 自身の修正ロールアウトから蒸留された学生 120 B Finance SFT + self‑generated hints Same pipeline, hint author = student
GPT‑OSS‑20B (base) ベースライン 20 B American pre‑training
GPT‑OSS‑20B (self‑distilled) 学生 20 B Finance SFT + self‑hints

蒸留手順

  1. 学生に定量金融の問題を提示する。
  2. 学生の回答が正解から逸脱する最初のステップを検出する。
  3. そのステップに短いヒントを挿入する – DeepSeek が生成したもの(Flash‑taught)または学生自身が生成したもの(self‑distilled)。
  4. 約 100 トークン生成を続け、学生のロールアウトに対して逆 KL ロスで訓練する。
  5. 238 件の金融項目について、3 つのランダムシードで繰り返す。

結果:検閲は転移しない

教師の検閲ギャップ

  • DeepSeek V4 Flash: 政治ペアで +45.45 ポイント(71.21 対 25.76) – ペアの 87 % が中国センシティブなプロンプトで検閲が高いことを示す。

学生モデルのギャップ(152 ペアの平均)

モデル センシティブ平均 コントロール平均 ギャップ 正ギャップ %
GPT‑OSS‑120B (base) 15.75 15.32 +0.43 43 %
GPT‑OSS‑120B (self‑distilled) 15.45 15.24 +0.26 54 %
GPT‑OSS‑120B (Flash‑taught) 14.08 15.49 ‑1.39 49 %
GPT‑OSS‑20B (base) 28.35 30.32 +3.74
GPT‑OSS‑20B (self‑distilled) 28.02 29.58 ‑3.16
  • 3 つの 120 B 系はすべて ~+0.3 のギャップに集まり、未加工のベースと区別がつかず、教師の +45 ポイントのギャップよりはるかに低い。
  • 統計的検定により、学生のギャップはゼロと有意差がないことが示された(p > 0.05)。

結論: 検閲された中国の教師から蒸留しても、教師の選択的拒否行動は学生に伝わらない。学生が訓練中に中国センシティブなコンテンツを一切見ても同様である。

結果:金融推論が向上

  • FinanceReasoning ベンチマーク(8 k トークン予算)において、Flash‑taught 120 B は 83.61 % を記録し、Kimi K3(81.93 %)と Inkling(65.13 %)を上回った。
  • Self‑distilled 120 B も 83.61 % に到達し、シード間で統計的に有意な差は見られなかった(McNemar p ≥ 0.79)。
  • クエリあたりコストは 8 k トークンリクエストで $0.000259 – Kimi K3 の 160 倍、Inkling の 62 倍 の低コストで、同等の性能を実現した。

自己蒸留 vs 教師指導蒸留

  • 両方の系は FinanceReasoning で同等の性能を示し、自己蒸留モデルは平均で 12.5 % 少ない出力トークンを使用して、より簡潔な推論を示唆する。
  • 自己蒸留モデルは外部教師の出力を一切取り込まないため、隠れたバイアス転移のリスクを排除しつつ、同等の能力向上を保持できる。

展開における実務的示唆

  • 8 k トークン予算内で金融問題の 98.7 % を解く 120 B モデルは、同予算で切り捨てられる 2.8 兆パラメータ規模のモデルよりもエンドツーエンドの有用性が高い。
  • モデルは単一の H100/A100(≈63 GB 重み + 80 MB アダプタ)で動作し、高同時実行の本番環境では 2 台の GPU が推奨される。
  • 20 B バリアントは 120 B の性能に合わせるために追加のエキスパート層適応が必要であり、フットプリントが小さい場合のスケーリングトレードオフを示す。

Hacker News コメントからのコミュニティ洞察

  • @Alifatisk は、蒸留は加算的であり減算的ではないと指摘し、検閲除去が見られないことと一致すると述べた。
  • @maxloh は、データセットが香港やウクライナ戦争といったトピックを除外している理由を疑問視し、将来の監査で政治的範囲を拡大すべきと提案した。
  • @seri4l は、DeepSeek V4 が中国モデルの中で比較的「西側志向」だと指摘しつつも、教師に対しては依然として顕著な検閲ギャップがあると指摘した。
  • @andy99 は、どの条件下で潜在的学習が現れるかを問うており、著者は中国系ベース(例:Chinese‑lineage base)という共有初期化シナリオが次の実験として論理的であると認めた。
  • @BoorishBears は、限定された SFT セットから広範な結論を導くことは「ナンセンス」だと批判し、バイアス転移を頑健に評価するためには、より大規模で多様な学習データが必要であると強調した。

著者が認める制限事項

  • 蒸留データは定量金融タスクに限定されており、他領域への一般化は保証されない。
  • 監査は政治と金融関連のプロンプトのみを対象とし、他のセンシティブトピック(例:香港、ウクライナ)はテストされていない。
  • 20 B の結果は、生成時の高い退化率によりサンプルサイズが減少している。
  • 本研究は安全関連の拒否、ガードレール訓練、セキュリティ関連行動は評価していない。

公開された成果物

  • GPT‑OSS‑20B‑Finance の重みは Hugging Face にて公開。
  • GPT‑OSS‑120B は CTGT プレイグラウンド(教師と学生を並列表示)で利用可能。
  • LineageEval リポジトリ(GitHub)には 304 件のプロンプト、マッチドペア構築、評価者ルーブリック、スコア定義、分析コードが含まれる。

今後の方向性

  • 中国系ベース(例:DeepSeek 出力でファインチューニングした Qwen)で同様の監査を実施し、「共有初期化」リスクを検証する。
  • マッチドペアセットを拡張し、香港、ウクライナなどの追加地政学的トピックをカバーする。
  • 蒸留後のチェックポイントに対して表現分析を行い、政治的バイアスがどこに(もし存在すれば)残っているかを特定する。

Bottom line: 制御された金融蒸留パイプラインにおいて、米国の 120 B モデルは教師の技術的専門知識を継承できても政治的検閲は継承せず、ドメイン特化展開にコスト効果の高い代替手段を提供すると同時に、外国系モデルからのイデオロギー転移に対する懸念を軽減できる。

Sources