OpenAI Model Spec: 明示的なモデル動作のためのフレームワーク
OpenAIはModel Specを導入しました。これは、意図されたAIモデルの動作を明示的かつ読みやすく、ユーザー、開発者、研究者が改訂可能な形にすることを目的とした、正式な公開フレームワークです。
公開行動フレームワークとしてのModel Spec
Model Specは、モデルの動作を暗黙的なトレーニングプロセスから明示的で読みやすい文書へと移行させることを目的としています。内部開発の「北極星」として機能し、外部のステークホルダーがAIの応答を支配するトレードオフやルールを理解できる公開リファレンスとなります。
このフレームワークは、OpenAIのより広範な安全エコシステムの一部であり、先端能力リスクに焦点を当てたPreparedness Frameworkや、AGIへの社会的適応に取り組むAIレジリエンスイニシアチブを補完します。行動期待を公開することで、OpenAIは公平性の向上(ユーザーが偏った扱いを特定し質問できるようにする)と安全性の向上(有能なシステムがどのように振る舞うべきかの明確な期待を提供する)を目指しています。
Model Specの構造的要素
AIインタラクションの多様性に対応するため、Model Specは単純なルールのリストではなく、複数のガイダンス層を採用しています。
高レベルの意図と公開コミットメント
フレームワークは、ユーザーを支援するためにモデルを段階的に展開すること、重大な危害を防止すること、OpenAIの運営許可を維持することという3つのシステムレベルの目標を概説する序文から始まります。これらの目標はSpec内の曖昧さの解決を導きますが、モデルへの自律的な指示ではありません。さらに、Specには「Red-line principles」などの公開コミットメントが含まれており、OpenAIがファーストパーティ展開において客観性を保ち、収益や滞在時間の最適化のために応答を調整しないことを約束しています。
指揮系統
指揮系統は、OpenAI、開発者、ユーザーからの矛盾する指示を解決するための核心メカニズムです。指示は主に2つのタイプに分類されます。
- Hard Rules: カテゴリを上書きできない境界(ルートまたはシステムレベル)で、壊滅的リスク、直接的な身体的危害、違法行為を防止します。これには「Stay in bounds」や「Under-18 Principles」セクションが含まれます。
- Defaults: 上書き可能な出発点で、特定の好みが示されていない場合に予測可能な動作を保証します。これにはガイドラインレベルのデフォルト(トーンやスタイル)とユーザーレベルのデフォルト(真実性と客観性)が含まれ、後者は透明性を確保するために明示的な指示で上書きする必要があります。
解釈支援
「グレー領域」を解決するために、Specは以下を活用します。
- Decision Rubrics: 競合する目的をバランスさせるための枠組みで、例として不可逆的な行動を最小化しつつタスクを効果的に完了させることがあります。
- Concrete Examples: コンプライアンスと非コンプライアンスの振る舞いを示すプロンプトと応答のペアで、意思決定の境界を明確にします。
実装とガバナンス
OpenAIは、Model Specがインターフェース(モデルが何をすべきか)であり、実装(どのように訓練されるか)ではないことを明確にしています。これはモデルの振る舞いを記述したものであり、製品全体の機能や利用ポリシーを記述したものではありません。
知性と明示的ルールの役割
OpenAIは、知性だけでは価値に関わる判断を解決できないと主張しています。モデルが自律的に数学問題を解くことができても、「有用性と安全性」は文脈依存であり、人間が定義した価値判断が必要です。明示的なルールは、これらの判断がモデルだけに委ねられることを防ぎ、人間の議論と改訂のためのメカニズムを提供します。
開発と反復
Specは、研究、安全、ポリシー、法務チームを含む横断的な社内プロセスで開発され、公開フィードバックや民主的な意見に基づいて反復されます。OpenAIはSpecを「現実的に志向的」なものとし、通常は現在のモデル能力の0〜3か月先の振る舞いを目標としています。
整合性の測定とギャップの特定
トレーニングがSpecの更新に遅れたり、意図しない一般化を生む可能性があるため、OpenAIはシナリオベースの評価スイートであるModel Spec Evalsをリリースしました。このスイートは実際のモデルの振る舞いとSpecの主張との整合性を追跡します。
Specの更新は通常以下によって推進されます:
- 公開された問題や失敗モード。
- テスト中に発見された内部の曖昧さ。
- 高レベルの安全ポリシーの変更。
- マルチモーダルインタラクションや自律エージェントなどの新たな能力の出現。
Spec内容の設計原則
フレームワークが実行可能であることを確保するために、OpenAIは以下の執筆原則に従います:
- Clarity and Precision: 曖昧な表現を避け、衝突を解決するための明示的な指針を提供します(例:温かみのために「白い嘘」を使うよりも真実性を優先する)。
- Substantive Rules: ルールが十分に明確で、異なる読者が応答がコンプライアンスしているかどうかに合意できるようにします。
- High Signal-to-Noise Examples: 最も難しい衝突や意思決定の境界を強調する例を使用します。