Hugging Face: 制御されたLLM安全性拒否のための境界認識型自己蒸留

広範なトピック拒否を超えた洗練された安全性境界

ほとんどの安全性アライメントプロセスは、危害をトピック全体の特性として扱い、その結果、モデルが意図に関わらずカテゴリ内(例:武器や詐欺)のすべてのプロンプトを拒否してしまう傾向があります。このアプローチは、モデルが単に「危険に見える」単語を含んでいるという理由だけで安全なプロンプトを拒否してしまうという失敗モードを生み出します。これを解決するために、Hugging FaceとMultiverse Computingは、トピック内の有害なサブセットのみを拒否し、無害な補完部分については回答を継続できる「狭い境界の安全性(narrow-boundary safety)」アプローチを提案しています。

狭い境界の安全性フレームワーク

狭い境界の安全性は、拒否すべき対象有害なサブセットと、回答すべき無害な補完部分を含むトピック宇宙として問題を定式化します。目標は、モデルの挙動において「急峻なステップ」を作り出すことです。つまり、有害なサブセット内では即座に拒否し、トピック内のそれ以外の場所では役に立つ回答を提供することです。

標準的なクロスエントロピー学習は、拒否確率を無害な領域へと外側に押し広げてしまうことが多いため、研究者たちはプロンプトのペアを使用して境界を運用化しました。これらのペアは、トピックのアンカーを共有していますが、意図が異なります。つまり、一方のプロンプトは拒否されるように設計されており、もう一方は回答されるように設計されています。政治的な説得は、この研究のテストベッドとして使用されました。なぜなら、操作的な説得(有害)と事実に基づいた政治情報(無害)を明確に区別できるからです。

自己生成による安全性チューニングにおける失敗への対処

標準的な自己生成パイプライン(モデルを拒否へと誘導し、その結果をガードモデルによって検証する手法)は、狭い境界に適用した場合、主に3つの弱点があります。

1. カバレッジのギャップ

シングルショットの誘導では、受け入れられる拒否を生成できないことが多く、その結果、困難なプロンプトが静かに破棄されてしまいます。監査されたプールにおいて、シングルショット生成は19.88%のプロンプト(8,009個の例)を破棄しました。研究者たちは、段階的に強力な誘導を行うエスカレーション再試行戦略を実装し、残留失敗を0.20%(79個のプロンプト)に減少させ、有害なトレーニングセットを40,293個のプロンプトに増やしました。

2. 副作用的な反応

安全性チューニングは、表面上は危険に見える無害なプロンプトに対して、誤った拒否を引き起こすことがよくあります。これを軽減するために、研究者たちは、18のセマンティックタイプにわたる11,955個の検証済み「表面上は危険に見える無害なプロンプト」をトレーニングデータに組み込み、トレーニング中にモデルが危険な言い回しを含む安全なプロンプトに遭遇するようにしました。

3. 境界の測定失敗

標準的な有害・無害の分割は、境界の実際の形状を測定できません。モデルは、単に拒否ゾーンを許可されるプロンプトへと拡大させることで、「より安全」に見えることがあります。これを解決するために、研究者たちは、ホールドアウトされた有害・無害のペア(各サイド 1,539個)を使用して、境界の両側を直接測定しました。

安全性と過剰拒否のトレードオフ

Qwen3-8Bでのテストでは、エスカレーション・カバレッジ学習が、分布内(in-distribution)の政治的拒否率を大幅に高め(9.47%から84.75%へ)、HarmBenchやWildJailbreakのようなベンチマークにおける不安全な回答率を安全に低下させますが(26.26%から0.14%へ)、過剰拒否を劇的に増加させる可能性があることが示されました。最も強力な構成では、XSTestにおいて過剰拒否が2.00%から74.00%に上昇しました。

安全性を犠牲にせずにこれを修正するために、研究者たちは2つの効果的なデータ構成要素を見出しました。

  • 自己生成レスポンス: 外部のコンプライアンス・レスポンスを、対象モデルによって生成された検証済みレスポンスに置き換えることで、XSTestの過剰拒否を15.20%から5.20%に低下させました。
  • 境界ペア: 無害な境界データ(benign boundary data)を追加することで、ホールドアウト・ペアの「回答可能」な側面の過剰拒否を32.94%から4.16%に低下させました。一方で、有害な側面の拒否率は91.88%から87.72%へわずかに低下しました。

LLMデプロイメントへの示唆

この研究は、安全性チューニングは有害な拒否率だけで測定されるべきではないことを示しています。拒否率が高いモデルは、必ずしもより安全であるとは限りません。単に、正当なプロンプトンプトを拒否することで、有用性が低下しているだけかもしれません。安全性を過剰拒否とのトレードオフ・コントロールするために、特定のデータ構成、カバレッジの修復、分布内補償、および評価のための境界ペアの使用が必要です。

Sources