OpenAI gpt-oss-safeguard モデルが Ollama 経由でリリースされました
TL;DR
OpenAI、Ollama、および ROOST は、Apache 2.0 ライセンスの下で、オープンソースの gpt-oss-safeguard モデル(20B および 120B パラメータ)を発表しました。これは、任意のユーザー定義ポリシーを解釈し、その思考プロセス(chain-of-thought)を公開できる、推論ベースの安全性分類器を提供します。
モデルの利用可能性とライセンス
要点: モデルは自由にダウンロード可能で、Ollama を介して実行でき、寛容な Apache 2.0 ライセンスが付与されています。これにより、商用利用や実験的な利用におけるコピーレフトや特許に関する懸念が解消されます。
- 2 つのモデルサイズが提供されています:
gpt-oss-safeguard:20bおよびgpt-oss-safeguard:120b。 - インストール手順は簡単です: Ollama をダウンロードし、次に
ollama run gpt-oss-safeguard:20b(または:120b)を実行します。 - Apache 2.0 ライセンスにより、制限のない修正、再配布、および商用展開が可能です。
コア技術的特徴
要点: モデルは安全性推論のために専用設計されており、カスタムポリシー、透明な推論出力、および調整可能な推論負荷をサポートしています。
安全性重視のトレーニング
- 入出力フィルタリング、オンラインコンテンツのラベル付け、オフラインの信頼性と安全性(trust-and-safety)パイプラインなどの安全性分類タスクについて推論するように、明示的にトレーニングおよびファインチューニングされています。
Bring‑Your‑Own‑Policy (BYOP)
- モデルは推論時にテキスト形式のポリシー記述を受け取り、追加のエンジニアリングなしで多様な製品に適用できます。
生のスコアではなく、推論に基づいた決定
- 完全な思考プロセス(CoT)の説明を返します。これにより、開発者は決定をデバッグし、監査することが可能になります。
- 生の CoT 出力は、エンドユーザーではなく、安全性実務家向けに意図されています。
設定可能な推論負荷
- ユーザーは、低、中、または高の推論負荷を選択でき、レイテンシと分析の深さのトレードオフを行えます。
評価結果
要点: OpenAI の内部および外部のベンチマークにより、gpt-oss-safeguard は、複数の同時実行ポリシーに対してテキストを正確に分類し、確立されたモデレーション・データセット上で競争力のある性能を発揮することが示されています。
- 内部マルチポリシー・テスト: 精度は、モデルのラベルが提供された すべて のポリシーに対してゴールドセットと一致する場合にのみ測定されます。これは非常に厳格な基準です。
- OpenAI Moderation Dataset (2022): モデルは、OpenAI の 2022 年のモデレーション研究論文で公開されたものと同じデータセットで評価されました。
- ToxicChat Benchmark: パフォーマンスは、公開されている ToxicChat ベンチマークでも測定されました。これは、オープンソースのチャットボットに対する現実世界のユーザーのクエリを反映しています。
コミュニティと組織的背景
要点: このリリースは、オープンソースの安全性ツールに専念する非営利団体 ROOST によってサポートされており、透明でコミュニティ主導の AI 安全性インフラストラクチャへの広範な動きを強調しています。
“gpt-oss-safeguard は、『独自のポリシーと危害の定義を持ち込む』設計の、最初のオープンソース推論モデルです。組織は、重要な安全性技術を自由に研究、修正、使用することができ、イノベーションを起こすことができなければなりません。私たちのテストでは、このモデルは異なるポリシーを理解し、その推論を説明し、ポリシーの適用におけるニュアンスを捉えることに長けており、これは開発者や安全性チームにとって有益であると信じています。” – Vinay Rao, CTO of ROOST
About ROOST
- ROOST (Robust Open Online Safety Tools) は、2025 年に設立された非営利団体であり、デジタル組織に高品質でオープンソースの安全性ツールを提供します。
- テクノロジー企業、慈善団体、およびアカデミアの連合によってサポートされています。
はじめに使うためのリソース
要点: 開発者は、公式ガイドやコミュニティのリポジトリに従って、モデルをモデルのパイプラインに統合できます。
- OpenAI blog post: https://openai.com/index/introducing-gpt-oss-safeguard/
- Developer cookbook: https://cookbook.openai.com/articles/gpt-oss-safeguard-guide
- ROOST model community repo: https://github.com/roostorg/open-models
AI 安全性の展望への影響
要点: Apache 2.0 ライセンスの下で、高機能でポリシー駆動型の安全性モデルをリリースすることで、OpenAI とそのパートナーは、組織が堅牢なコンテンツモデレーションを実装するための障壁を低くしています。これは、業界や研究における責任ある AI 実践の導入を加速させる可能性があります。
- BYOP 設計により、専用の安全性モデルのトレーニングが必要な手間が減り、小さなチームのリソースを節約できます。
- 透明な推論は、信頼を醸成し、説明責任が求められる規制遵守を容易にします。
- オープンライセンスにより、コミュニティによる監査、拡張、および多様なエコシステムとの統合が促進され、ベンダーロックインのリスクを mitigated 軽減します。
Sources
- OriginalOpenAI gpt-oss-safeguard
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch