gpt-oss-safeguard リリースノート / 新機能

OpenAIは、gpt-oss-safeguardの研究プレビューをリリースしました。これは安全分類のために特別に設計されたオープンウェイト推論モデルのセットです。これらのモデルは、gpt-oss-safeguard-120bおよびgpt-oss-safeguard-20bの2つのサイズで利用可能であり、Hugging Faceを通じて許容的なApache 2.0ライセンスの下で配布されています。

推論ベースの安全分類

gpt-oss-safeguardは、ラベル付き例から決定境界を推論する分類器の訓練から、推論ベースのアプローチへの安全分類パラダイムをシフトします。トレーニング中に重みにポリシーを組み込むのではなく、モデルは推論時に開発者が提供したポリシーを直接解釈します。

主な技術的機能

  • ダイナミックポリシー適用: 開発者はポリシーと分類対象のコンテンツを同時に提供できます。モデルはこのポリシーを使用して、提供された特定のルールにコンテンツが違反しているかを判断し、進化するリスクやニッチなドメインに対して高い柔軟性を提供します。
  • チェーンオブソート推論: モデルはその決定に至る推論とともに結論を出力します。これにより透明性が提供され、開発者はモデルがポリシーをどのように解釈しているかを確認できます。
  • イテラティブポリシー改善: ポリシーは推論時に提供されるため、開発者はモデルを再トレーニングすることなく安全ガイドラインを改訂できます。

理想的なユースケース

この推論ベースのアプローチは、次のシナリオで特に効果的です:

  • 潜在的な害が急速に発生または進化しており、迅速なポリシー適応が必要です。
  • ドメインが非常に微妙で、小規模な従来の分類器では対処が難しいです。
  • 特定のリスクごとに高品質な分類器を構築する十分なトレーニングデータがありません。
  • 低遅延よりも説明可能性と高品質なラベルが優先されます。

従来の分類器との比較

OpenAI Moderation APIで使用されるような従来の安全分類器は、通常、安全かつ安全でないコンテンツの数千件の手動でキュレートされた例で訓練されます。これらの従来の分類器は低遅延と低い運用コストを提供しますが、開発と更新には相当な時間とデータが必要です。

対照的に、gpt-oss-safeguardは開発者がカスタム作成されたものを含む任意のポリシーを適用できるようにし、推論を活用して新しいポリシーにわたって一般化し、安全を超えて特定の製品ニーズのための一般的なコンテンツラベリングへその有用性を拡張します。

内部実装: Safety Reasoner

gpt-oss-safeguardは、OpenAIが内部で使用しているツールであるSafety Reasonerのオープンウェイト実装です。このツールは、ポリシーラベル付けタスクでの強化ファインチューニングを使用して開発され、人間の専門家の判断を模倣するモデルに報酬を与えます。

OpenAIは、自社のインフラストラクチャ内でSafety Reasonerをいくつかの方法で利用しています:

  • イテラティブデプロイメント: 新しいモデルは、Safety Reasonerに厳格なポリシーと高い計算リソースを割り当てて慎重に適用されることが多く、本番のリスクが理解されるにつれてポリシーが調整されます。
  • リアルタイムブロック: 画像生成とSora 2に対して、リアルタイムで安全でない生成をブロックするために段階的な評価を実行します。
  • マルチレイヤーディフェンス: 生物学や自傷などのドメインでは、まず高速で高再現率の分類器を使用して関心のあるコンテンツを特定し、その後Safety Reasonerが最終的な決定のためにレビューします。
  • システム統合: GPT-5とChatGPT Agentのセーフガードの一部を形成し、詳細なタクソノミーに対して出力を分類します。

パフォーマンスとベンチマーク

OpenAIは、内部および外部のデータセットでgpt-oss-safeguardを評価しました:

  • マルチポリシー精度: gpt-oss-safeguardと内部のSafety Reasonerは、マルチポリシー精度においてgpt-5-thinkingおよびgpt-ossオープンモデルの両方を上回りました。
  • 2022年モデレーション評価セット: gpt-oss-safeguardは、gpt-5-thinkingおよび内部のSafety Reasonerを含む他のすべてのテスト済みモデルをわずかに上回りました。
  • ToxicChat: このセットでは、内部のSafety Reasonerとgpt-5-thinkingがgpt-oss-safeguardをわずかに上回りましたが、OpenAIはgpt-oss-safeguardの小さなサイズが多くのタスクにおいて好ましい選択肢であることを指摘しています。

制限事項

推論ベースのアプローチには、主に2つの制限があります:

  1. パフォーマンスギャップ: 数万件の高品質なラベル付きサンプルで訓練された分類器は、複雑なリスクに対して依然として推論ベースのモデルを上回ることがあります。
  2. 計算量とレイテンシー: このプロセスは従来の分類器よりも計算集約的で遅いです。OpenAIは内部で、まず小さな分類器を使用してコンテンツをフィルタリングしたり、Safety Reasonerを非同期で実行することで低レイテンシーのユーザー体験を維持して管理しています。

コミュニティコラボレーション

OpenAIは、Discord、Tomoro、SafetyKit、ROOSTの信頼と安全の専門家と協力してgpt-oss-safeguardを開発しました。このリリースの一環として、ROOSTはGitHub上に**ROOST Model Community (RMC)**を設立し、オープンソースAI安全モデルをワークフローに実装するためのベストプラクティスを共有しています。

Sources