OpenAI gpt-oss-safeguard モデルが Ollama 経由でリリースされました

TL;DR

OpenAI、Ollama、および ROOST は、Apache 2.0 ライセンスの下で、オープンソースの gpt-oss-safeguard モデル(20B および 120B パラメータ)を発表しました。これは、任意のユーザー定義ポリシーを解釈し、その思考プロセス(chain-of-thought)を公開できる、推論ベースの安全性分類器を提供します。


モデルの利用可能性とライセンス

要点: モデルは自由にダウンロード可能で、Ollama を介して実行でき、寛容な Apache 2.0 ライセンスが付与されています。これにより、商用利用や実験的な利用におけるコピーレフトや特許に関する懸念が解消されます。

  • 2 つのモデルサイズが提供されています: gpt-oss-safeguard:20b および gpt-oss-safeguard:120b
  • インストール手順は簡単です: Ollama をダウンロードし、次に ollama run gpt-oss-safeguard:20b(または :120b)を実行します。
  • Apache 2.0 ライセンスにより、制限のない修正、再配布、および商用展開が可能です。

コア技術的特徴

要点: モデルは安全性推論のために専用設計されており、カスタムポリシー、透明な推論出力、および調整可能な推論負荷をサポートしています。

安全性重視のトレーニング

  • 入出力フィルタリング、オンラインコンテンツのラベル付け、オフラインの信頼性と安全性(trust-and-safety)パイプラインなどの安全性分類タスクについて推論するように、明示的にトレーニングおよびファインチューニングされています。

Bring‑Your‑Own‑Policy (BYOP)

  • モデルは推論時にテキスト形式のポリシー記述を受け取り、追加のエンジニアリングなしで多様な製品に適用できます。

生のスコアではなく、推論に基づいた決定

  • 完全な思考プロセス(CoT)の説明を返します。これにより、開発者は決定をデバッグし、監査することが可能になります。
  • 生の CoT 出力は、エンドユーザーではなく、安全性実務家向けに意図されています。

設定可能な推論負荷

  • ユーザーは、低、中、または高の推論負荷を選択でき、レイテンシと分析の深さのトレードオフを行えます。

評価結果

要点: OpenAI の内部および外部のベンチマークにより、gpt-oss-safeguard は、複数の同時実行ポリシーに対してテキストを正確に分類し、確立されたモデレーション・データセット上で競争力のある性能を発揮することが示されています。

  • 内部マルチポリシー・テスト: 精度は、モデルのラベルが提供された すべて のポリシーに対してゴールドセットと一致する場合にのみ測定されます。これは非常に厳格な基準です。
  • OpenAI Moderation Dataset (2022): モデルは、OpenAI の 2022 年のモデレーション研究論文で公開されたものと同じデータセットで評価されました。
  • ToxicChat Benchmark: パフォーマンスは、公開されている ToxicChat ベンチマークでも測定されました。これは、オープンソースのチャットボットに対する現実世界のユーザーのクエリを反映しています。

Internal multi‑policy evaluation OpenAI moderation benchmark ToxicChat benchmark


コミュニティと組織的背景

要点: このリリースは、オープンソースの安全性ツールに専念する非営利団体 ROOST によってサポートされており、透明でコミュニティ主導の AI 安全性インフラストラクチャへの広範な動きを強調しています。

“gpt-oss-safeguard は、『独自のポリシーと危害の定義を持ち込む』設計の、最初のオープンソース推論モデルです。組織は、重要な安全性技術を自由に研究、修正、使用することができ、イノベーションを起こすことができなければなりません。私たちのテストでは、このモデルは異なるポリシーを理解し、その推論を説明し、ポリシーの適用におけるニュアンスを捉えることに長けており、これは開発者や安全性チームにとって有益であると信じています。”Vinay Rao, CTO of ROOST

About ROOST

  • ROOST (Robust Open Online Safety Tools) は、2025 年に設立された非営利団体であり、デジタル組織に高品質でオープンソースの安全性ツールを提供します。
  • テクノロジー企業、慈善団体、およびアカデミアの連合によってサポートされています。

はじめに使うためのリソース

要点: 開発者は、公式ガイドやコミュニティのリポジトリに従って、モデルをモデルのパイプラインに統合できます。


AI 安全性の展望への影響

要点: Apache 2.0 ライセンスの下で、高機能でポリシー駆動型の安全性モデルをリリースすることで、OpenAI とそのパートナーは、組織が堅牢なコンテンツモデレーションを実装するための障壁を低くしています。これは、業界や研究における責任ある AI 実践の導入を加速させる可能性があります。

  • BYOP 設計により、専用の安全性モデルのトレーニングが必要な手間が減り、小さなチームのリソースを節約できます。
  • 透明な推論は、信頼を醸成し、説明責任が求められる規制遵守を容易にします。
  • オープンライセンスにより、コミュニティによる監査、拡張、および多様なエコシステムとの統合が促進され、ベンダーロックインのリスクを mitigated 軽減します。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch