OpenAI gpt-oss-safeguard テクニカルレポート

OpenAIは、提供されたポリシーに従ってコンテンツを分類するように設計されたオープンウェイト推論モデルであるgpt-oss-safeguard-120bおよびgpt-oss-safeguard-20bをリリースしました。これらのモデルはgpt-ossファミリからポストトレーニングされ、Apache 2.0ライセンスの下で利用可能です。

モデルバージョンとライセンス

gpt-oss-safeguardモデルは、120bと20bの2つのサイズで利用可能です。これらのモデルはテキスト専用であり、Responses APIと互換性があります。Apache 2.0ライセンスおよびOpenAIのgpt-oss使用ポリシーの下でリリースされています。

テクニカルな機能とカスタマイズ

これらのモデルはポリシーベースのコンテンツ分類のために設計されています。提供されたポリシーを推論して、コンテンツをそれに応じてラベル付けすべきかを判断するように最適化されています。主なテクニカルな機能には以下が含まれます:

  • Chain-of-Thought (CoT): モデルは完全なチェーン・オブ・ソート推論を提供し、ユーザーが分類決定に至る内部ロジックを確認できるようにします。
  • Reasoning Effort Levels: ユーザーは、パフォーマンスとレイテンシーのバランスを取るために、異なる推論努力レベル(低、中、高)でモデルを設定できます。
  • Structured Outputs: モデルは構造化出力をサポートし、分類ラベルが予測可能で機械可読な形式で返されることを保証します。

意図された使用法とアプリケーション

OpenAIは、アプリケーションのコアなユーザー向け機能ではなく、分類レイヤーとしてgpt-oss-safeguardモデルを使用することを推奨します。汎用的な相互作用については、元のgpt-ossモデルがより適しています。

安全性とリスク評価

これらのモデルがオープンウェイトであるため、OpenAIはチャット設定で使用された場合でも安全基準を満たすことを確認するために安全評価を実施しました。これは彼らの意図した主な使用ケースではないにもかかわらずです。

フロンティアリスクについては、OpenAIは、これらのモデルが追加の生物学的またはサイバーセキュリティデータなしでgpt-ossからファインチューニングされたと述べています。その結果、元のgpt-ossリリース時に行われたリスク評価—特に最悪ケースシナリオの推定に関する作業—は、gpt-oss-safeguardシリーズにも適用されます。

Sources