GPT-5 セーフコンプリーション: 拒否ベースから出力中心の安全トレーニングへの移行
OpenAIはGPT-5向けにセーフコンプリーションを導入しました。これは、モデルがユーザーの入力を評価するのではなく、モデル自身の出力の安全性を評価することに焦点を移す新しい安全トレーニング手法です。このアプローチにより、GPT-5は「デュアルユース」プロンプト—意図が不明確で、善意でも悪意でも使用できる質問—に対して安全境界を損なうことなく有用な回答を提供できます。
拒否ベースの安全トレーニングの限界
従来の安全トレーニングは二元的な判断に依存します。モデルはプロンプトに完全に従うか、全く拒否するかのどちらかです。明らかに有害な要求に対しては効果的ですが、この二元的アプローチは、花火を点火するために必要なエネルギーの要求のようなデュアルユースプロンプト(学校のプロジェクト用か爆薬製造用か不明)に苦労します。
拒否ベースのシステムでは、モデルはプロンプトが「回答するにはあまりにも有害」かどうかを判断しなければなりません。これにより、二つの最適でない結果が生じます。
- 過剰遵守: モデルが悪意あるユーザーに危険な情報を提供する。
- 過剰拒否: モデルが無害な要求を拒否し、ユーザー体験が不親切になる。
セーフコンプリーション: 出力中心のアプローチ
セーフコンプリーションのトレーニングは、安全境界をユーザーの入力からモデルの出力へと移します。プロンプトを拒否するかどうかを判断する代わりに、モデルは安全ポリシーに違反しない最も有用な回答を生成するように訓練されます。
これは、ポストトレーニング時に二つの主要なトレーニングパラメータで実装されます。
- 安全制約: 報酬システムは安全ポリシーに違反する回答にペナルティを課し、ペナルティの強さは違反の重大度に応じてスケーリングされます。
- 有用性最大化: 安全境界内に留まる回答については、モデルは有用性に基づいて報酬を受けます。これは、ユーザーの目的を直接達成するか、あるいは安全で有用な代替案を示す情報的な拒否を提供することで実現されます。
GPT-5 における性能向上
OpenAIはセーフコンプリーションをGPT-5の推論版とチャット版の両方に統合しました。GPT-5 Thinking(gpt5-r)とOpenAI o3 を比較したところ、セーフコンプリーションのトレーニングは安全性と有用性の両方で改善を示し、特にデュアルユースの質問で顕著でした。
OpenAI の実験から得られた主な発見は以下の通りです。
- 有用性の向上: GPT-5 Thinking は o3 と比較して、安全な回答に対する安全スコアと平均有用性スコアが高くなりました。
- 被害の深刻度低減: モデルが誤って安全でない出力を生成した場合でも、その深刻度は拒否ベースでトレーニングされたモデルが生成する安全でない出力よりも低くなります。
安全性研究の進化
セーフコンプリーションは、OpenAI が安全性と有用性のバランスを取るアプローチの進化を示しています。GPT-4 が有用性と安全性のトレードオフを管理するためにルールベースの報酬を使用したのに対し、GPT-5 のセーフコンプリーションはこの二つの目標をより深く統合します。プロンプトの意図ではなく回答の安全性に焦点を当てることで、OpenAI はますます複雑になる安全課題に対して、より微妙な対応ができる基盤を築くことを目指しています。