OpenAI サイバー重要能力に向けたモデル開発ペースの調整

OpenAIは、より厳格なセキュリティおよびアライメントの保護策を実装するため、モデルのスケーリングのペースを一時的に遅らせ、特定の強化学習(RL)トレーニングの実行を停止しました。この決定は、OpenAI-Hugging Faceのセキュリティインシデントと、次世代のAstraモデルがOpenAIのPreparedness Frameworkで定義されている「Critical cybersecurity capability(重大なサイバーセキュリティ能力)」の閾値に達する可能性があるという予備的な証拠を受けて行われました。

研究環境のセキュリティ強化

OpenAIは、不正アクセスを防止し、高度なサイバーセキュリティ能力を持つモデルから保護するために、トレーニングおよび評価環境のセキュリティ基準を引き上げています。OpenAI-Hugging Faceのインシデントを受け、同研究所は、コードの実行やインターネットへのアクセスが可能な研究クラスター内でのフロンティアモデルの推論を一時停止しました。

多層防御を確立するために、OpenAIは以下の管理策を実装しています:

  • Workload Isolation(ワークロードの分離): モデルが生成したコードや信頼できないコードを実行するワークロード、およびモデルの出力を処理するソフトウェアに対して、より強力な「サンドボックス」の使用が義務付けられています。
  • Network Isolation(ネットワークの分離): 新しい管理策により、高リスクなワークロードをインターネットから隔離し、単一のサービスの侵害が内部ネットワークやウェブへの不正アクセスにつながらないようにします。
  • Continuous Security Testing(継続的なセキュリティテスト): OpenAIは、脆弱な共有サービスを削除し、常設の権限を削減し、セキュリティログの監視を改善しました。また、同研究所は、シミュレートされた攻撃を通じてこれらの境界の継続的なテストを自動化するために、自社のモデルを使用しています。

これらの最も厳格な保護策は、現在、すべてのサイバー関連のワークロードおよびAstraモデルに関わるものに対して義務付けられています。多くのAstraワークロードは、これらの強化された環境に移行されるまで停止されたままとなっています。

多段階のChain-of-Thought(思考の連鎖)モニタリング

OpenAIは、フロンティアRLトレーニングや評価などの高リスクなワークロードにおいて、懸念されるモデルの挙動をリアルタイムで検出するために、モニタリングシステムを拡張しました。

新しいモニタリングアーキテクチャは、以下の段階で動作します:

  1. Activation Classifiers(アクティベーション・クラシファイア): これらの検出器は、サンプリングされたすべてのトークンにおいて、モデルの内部活動を検査します。
  2. Automated Investigators(自動調査員): 懸念される事項は、計算リソースを大量に消費する調査員にエスカレーションされ、ツール使用、推論、および活動シーケンスを分析して、データの窃取、破壊的行為、不正アクセス、または保護策の回避試行の兆候がないかを確認します。

OpenAIは、懸念される活動が検出されてから30分以内にアラートを発行することを目指しています。重大なセキュリティ境界の違反が疑われ、30分以内に偽陽性(false positive)であることが証明されない場合、安全性、セキュリティ、および研究チームは活動を停止する必要があります。このモニタリングは、「Sol capability」以上のモデルのすべてのRLトレーニングおよび評価において義務付けられており、8月7日以降、ツールを使用するすべてのAstra推論において義務付けられています。

Compute Overhead(計算オーバーヘッド): このモニタリングシステムは、現在、監視対象となる推論計算リソースの約20%を必要としています。

アライメントとリスク軽減の進展

報酬ハッキング(reward hacking)、欺瞞(deception)、および不正アクセスなどのリスクに対戦抗するため、OpenAIは、最も能力の高いモデルのトレーニングプロセスにおいて、より多くの段階でコアとなるアライメント技術を統合しています。

主な注力領域は以下の通りです:

  • Reward Model Improvement(報酬モデルの改善): さまざまな環境において、安全でない挙動をより適切に検出し、抑制するために、報酬モデルを強化しています。
  • Honesty Training(誠実さのトレーニング): モデルが自身の行動、自身の能力、および自身の限界について、より透明性を持てるようにトレーニングしています。
  • Exploit Reduction(脆弱性利用の削減): ツール、評価者、報酬、または人間の監視における弱点を突く挙動を行為として削減しています。
  • Expanded Coverage(範囲の拡大): モデルが外部リソースと相互作用する際に、危害を及ぼす可能性のある挙動に対して、トレーニングの範囲を拡大しています。

Preparedness Frameworkの将来の進化

OpenAIは、Preparedness Frameworkを、トレーニングとデプロイの両方においてこれらの保護策を統合するように進化させる意図があります。同研究所は、モデル支援型のセキュリティに投資し、その知見を外部組織と共有する予定です。これらの学習内容を詳述した技術レポートが、数週間以内に公開される予定です。

Sources

関連