OpenAI gpt-oss-120b と gpt-oss-20b のリリース

OpenAI は、エージェントワークフロー向けに設計された 2 つのオープンウェイト推論モデル gpt-oss-120bgpt-oss-20b をリリースしました。これらのモデルは Apache 2.0 ライセンスと gpt-oss 使用ポリシーの下で提供され、強力な指示遵守、ツール使用、カスタマイズ可能な推論努力のためのツールをオープンソースコミュニティに提供します。

モデルの機能と統合

gpt-oss モデルはテキストのみの推論モデルで、構造化出力をサポートし、完全なチェーン・オブ・ソート(CoT)可視性を提供します。エージェントワークフローへの統合を目的として設計されており、特に Python コード実行やウェブ検索といったツール使用をサポートします。

主な技術的特徴は次のとおりです:

  • カスタマイズ性: モデルは特定のニーズに合わせてカスタマイズ可能です。
  • 指示遵守: 複雑な指示に対する高い遵守能力を備えています。
  • 推論努力: 複雑な推論を必要としないタスクに対して、ユーザーが推論努力を調整できます。
  • API 互換性: モデルは OpenAI Responses API と互換性があります。

安全性とリスク評価

オープンウェイトモデルはサードパーティによって安全性の拒否を回避するように微調整され得るため、OpenAI はこれらをプロプライエタリモデルとは異なるリスクプロファイルとして扱います。OpenAI は、これらのモデルを実装する開発者や企業は、OpenAI のプロプライエタリ API 製品に見られる保護機能を再現するために、独自のシステムレベルの保護策を実装する必要があると指摘しています。

これらのモデルのリスクを評価するために、OpenAI は Preparedness Framework を用いて gpt-oss-120b のスケーラブルな能力評価を実施しました。評価は次の 3 つの追跡カテゴリに焦点を当てました: 生物・化学能力、サイバー能力、AI 自己改善。結果として、デフォルトモデルはこれらのカテゴリのいずれにおいても「高い能力」の閾値に達していないことが確認されました。

敵対的テストとオープンモデルのフロンティア

OpenAI は、攻撃者が gpt-oss-120b を改変して生物・化学またはサイバー領域で「高い能力」に到達させられるかどうかを調べるため、敵対的微調整シミュレーションを実施しました。

調査結果は次のとおりです:

  • 敵対的微調整: OpenAI のトレーニングスタックを用いた堅牢な微調整を行っても、gpt-oss-120b は生物・化学リスクまたはサイバーリスクにおいて「高い能力」に到達しませんでした。
  • 既存モデルとの比較: gpt-oss-120b のリリースは、オープン基盤モデルにおける生物学的能力のフロンティアを大幅に前進させるものではありません。既存のオープンモデルのデフォルト性能は、敵対的に微調整された gpt-oss-120b の性能としばしば同等です。

OpenAI は、このリリースが有益な AI の推進と AI エコシステム全体の安全基準向上へのコミットメントの一環であると述べています。

Sources