OpenAI サイバーレジリエンス戦略

OpenAIは、進化するAIサイバーセキュリティ能力のデュアルユースリスクを管理する戦略を発表しました。同社は、レイヤードセーフティスタックを導入し、新たな防御ツールと諮問機関を設置して、モデルがより高度になるにつれて、サイバーセキュリティの防御者に悪意ある行為者よりも大きな優位性をもたらすことを確保しています。

AIサイバー能力の急速な進歩

AIモデルは、サイバーセキュリティタスクを実行する能力が大幅に向上していることを示しています。OpenAIは、キャプチャー・ザ・フラグ(CTF)チャレンジで測定された能力が、2025年8月のGPT-5で27%から、2025年11月のGPT-5.1-Codex-Maxで76%に向上したと報告しています。

OpenAIは現在、Preparedness Frameworkに従って「High」レベルのサイバーセキュリティ能力に到達するモデルへの準備を進めています。このレベルは、堅牢に防御されたシステムに対して機能するゼロデイリモートエクスプロイトを開発できるモデル、または複雑でステルスな企業または産業侵入作業に意味のある支援を提供できるモデルとして定義されています。

不正使用の緩和のためのレイヤードセーフティスタック

防御的および攻撃的なサイバーワークフローはしばしば同じ基礎知識に依存するため、OpenAIは防御者のユーティリティを維持しながら悪意のある強化を制限するために、ディフェンスインデプスアプローチを採用しています。

インフラストラクチャとモニタリング

基盤として、OpenAIは以下の組み合わせを利用しています:

  • アクセス制御
  • インフラストラクチャのハードニング
  • エグレス制御
  • 潜在的な悪意のある活動を検出するシステム全体のモニタリング

安全でない活動が検出された場合、システムは出力をブロックし、プロンプトを能力の低いモデルにルーティングするか、深刻度と繰り返しの挙動に基づいて人間によるレビューに問題をエスカレートする可能性があります。

モデルトレーニングとレッドチーム

OpenAIは、教育および防御的なユースケースで役立ち続けながら、明らかなサイバー悪用を可能にするリクエストを拒否するようにフロンティアモデルを訓練しています。これらの保護を検証するため、同社はエキスパートのレッドチーム組織と協力し、エンドツーエンドの評価を実施しています。決意し、十分なリソースを持つ敵対者をシミュレートし、セキュリティギャップを特定して封じ込めます。

防御的レジリエンスのためのエコシステムイニシアティブ

OpenAIは、責任ある修復を加速し、防御者に高度なツールを提供するいくつかのイニシアティブを立ち上げています。

Aardvark エージェンティックセキュリティリサーチャー

Aardvarkは現在プライベートベータ版のエージェンティックセキュリティリサーチャーです。コードベースをスキャンし、パッチを提案することで、開発者とセキュリティチームがスケールで脆弱性を見つけて修正するのを支援するように設計されています。Aardvarkはすでにオープンソースソフトウェアにおける新しいCVEを特定しています。OpenAIは、ソフトウェアサプライチェーンを保護するため、選択された非商用オープンソースリポジトリに無料のカバレッジを提供する計画です。

トラストドアクセスと諮問委員会

OpenAIは、資格を持つサイバー防御ユーザーに最新モデルにおける強化された機能への階層的アクセスを提供するトラストドアクセスプログラムを導入しています。さらに、同社は経験豊富なサイバー防御者とセキュリティ実務者からなるアドバイザリーグループであるFrontier Risk Councilを設立し、責任ある能力と潜在的な悪用の境界について助言を行います。

業界全体のコラボレーション

すべてのフロンティアモデルにおけるサイバー悪用のリスクに対処するため、OpenAIはFrontier Model Forumを通じて他のラボと協力しています。この非営利の取り組みは、脅威モデルの共有理解を深め、兵器化の経路を特定し、脅威行為者にとっての重要なボトルネックを特定することに焦点を当てています。OpenAIはまた、外部チームと協力して独立したサイバーセキュリティ評価を開発し、業界全体でのモデル能力の共有理解を構築しています。

Sources