OpenAI、サイバー・クリティカル能力の懸念により先端モデルの学習を一時停止し、セーフガードを強化

先端モデルの学習が、新たに浮上したサイバー・クリティカル能力の懸念により一時停止

OpenAIは、内部のシグナルが、次のAstraモデルが重要なサイバー・セキュリティ能力の閾値に達する可能性があると示唆したため、今後発表予定のAstraモデル向けに計画していた最大規模の強化学習(RL)実行を停止しました。現在、再開する前に監視、整合性、セキュリティのセーフガードを拡張しています。


一時停止の意義

OpenAIの決定は、先端AIラボが浮上するモデルの能力を、単なる仮説的懸念ではなく、現実的なリスクとして扱っていることを示しています。高リスクの強化学習を停止することで、自律的なハッキング能力を持つモデルが、堅牢なセーフガードが検証される前に展開されるのを防ぐことを目的としています。


研究と展開における新たなセーフガード

OpenAIは、以下の3つの相互接続された柱に基づいて安全対策を構築しています。

  1. 監視 – 懸念される行動のリアルタイム検出。
  2. 整合性 – モデルが意図された目的に従うように訓練する。
  3. セキュリティ対策 – 隔離とアクセス制御。

これらの柱は、すべてのワークロードに均一に適用されており、サイバー・クリティカルな潜在能力を持つモデルにはより厳しい基準が適用されています。


研究環境の強化

  • ワークロードの隔離 – モデルによって生成されたコード、またはモデルに供給されるコードに対して、より強固なサンドボックス化。
  • ネットワークの隔離 – 攻撃されたワークロードがインターネットや内部ネットワークに到達するのを防ぐための厳格な制御。
  • 継続的なセキュリティテスト – 共有サービスの削除、常時権限の削減、モデル自身を使って自動攻撃シミュレーションを実施。

OpenAIは、すべてのAstra関連ワークロードが最高レベルのセキュリティを必要としていると報告しています。これらの基準を満たしていないワークロードは一時停止されたままであり、セキュリティ上重要なタスクが優先的に移行対象となっています。

"研究クラスタで、コードを実行するか、インターネットにアクセスできるツールを使用する可能性のある実行を一時停止しました…" – OpenAI投稿


拡張された思考プロセスの監視

OpenAIの新しい監視パイプラインは、複数の段階で動作します。

  • 活性化分類器 – サンプリングされたトークンごとに、モデルの内部活動を検査。
  • 自動調査チーム – ツールの使用、推論トレース、完全な活動シーケンスを分析し、不正な行動、データ窃取、セーフガードの回避試みを検出。
  • アラートプロトコル – 潜在的な違反が検出された場合、高優先度のアラートが発行され、セーフガード、セキュリティ、研究チームが対応に駆り出されます。30分以内にフラグを解除できない場合は、活動が一時停止されます。

現在の監視は、保護対象のワークロードの計算に約**20 %**のオーバーヘッドを追加しています。このシステムは、すべての強化学習訓練およびツール使用評価(「Sol」能力以上)およびすべてのツール付きAstra推論に対して必須です。


整合性研究の加速

OpenAIは、最も能力の高いモデルのトレーニングパイプライン全体に、基本的な整合性技術を拡張しています。

  • 改善された報酬モデル – 多様なタスクにおいて、安全でない行動をより効果的にペナルティ化。
  • 誠実性の訓練 – モデルが自身の能力や行動についてより正直になるように訓練。
  • 報酬ハッキングの緩和 – 評価やツール使用の抜け穴を悪用するリスクを低減。
  • 外部システムとの相互作用に対する広範な評価カバー

研究室は、誤った整合性(たとえば、欺瞞的なツール使用や不正アクセス)が、モデルがサイバー攻撃能力を獲得するにつれてリスクが増大するとしています。


Hacker Newsでのコミュニティの反応

  • ベンチマークへの懐疑 – ユーザーは、GLM 5.2のようなオープンウェイトモデルがCyberBenchテストで77 %を達成しており、Astraの88 %に近い成績を収めているにもかかわらず、広範なサイバー事件が発生していないことに注目。これにより、脅威が過大評価されているのか、それとも現在の防御が単に効果的なのかという議論が沸き起こっています。

    "Solが世界終末的な危険性を持つとされるなら、GLM 5.2は90 %くらいになるべきではないですか? なぜ毎日、破壊的なGLMによるハッキングが起きないのですか?" – @red_green_yell

  • 警鐘 – 複数のコメント者が、一時停止を「炭坑のカナリア」と形容し、先端が進むにつれて、さらに進むことが本質的に危険になる点に達していると強調しています。

    "私たちは、先端の先端に達しており、さらに進むと実際に危険になるため、進めなくなっています。" – @bottlepalm

  • セキュリティ最優先の視点 – 一部のユーザーは、実際の問題は運用セキュリティであると主張。AIの脅威は多くの脅威の一つにすぎず、組織自身がシステムを強化しなければならないと述べています。

    "OpenAIのノックは無害ですが、あなたが仕事を果たさなければ、ロシアや中国の攻撃者はすでに侵入している可能性があります。" – @miohtama

  • 実装に対する批判 – 複数のユーザーが、OpenAIがすでに強化されたサンドボックス技術(例:gVisor、Firecracker)を採用していなかった理由を疑問視し、発表されたセーフガードが前もって設計されたものではなく、反応型の対応であると指摘しています。

    "なぜgVisor、Firecracker、seccompを使わなかったのですか? ほぼ無制限のトークンを持つ企業にとって、これは言い訳がききません。" – @insanitybit

  • プロセスの透明性 – コメント者たちは、整合性の効果を測る具体的な指標の欠如を指摘し、新しい監視および整合性パイプラインの性能を示す明確な証拠を求めています。

    "『整合性』が実際にどの程度機能しているかを評価する信頼できる方法はありますか?" – @musicale


OpenAIと業界の今後の展開

OpenAIは、これらのセーフガードを、トレーニングと展開の両フェーズをカバーする更新された準備体制フレームワークに統合する予定です。また、外部パートナーを巻き込み、今後数週間以内に技術レポートを公開する予定です。

広範なAIコミュニティは、急速に進化するモデル能力に追いつくことができる、スケーラブルな監視、整合性、セキュリティ手法の開発という共通の課題に直面しています。OpenAIの一時停止は、モデルがサイバー・クリティカルな閾値に近づくにつれて、業界全体が同様の予防措置を採用する必要があることを示唆しています。


主なポイント

  • OpenAIは、Astraが重要なサイバー能力を備える可能性があるという初期の証拠を受けて、最大規模の先端強化学習実行を一時停止しました。
  • 新たなセーフガードには、より厳格なサンドボックス化、ネットワーク隔離、継続的なセキュリティテスト、30分以内の対応窓を持つ多段階監視、および拡張された整合性研究が含まれます。
  • Hacker Newsのコミュニティは、一時停止を必要な安全対策と見なすか、OpenAIのセキュリティ実装の適切さとタイミングに疑問を呈するかで意見が分かれています。
  • 今後の透明性と外部連携が、AI分野が浮上するサイバー・クリティカルリスクを管理するために不可欠です。

Sources

関連