GPT 5.6-Cyber VM 脱出分析

標準的な仮想マシンはAIの封じ込めに不十分である

既製品の仮想マシン(VM)は、高度でサイバー能力を持つAIエージェントを封じ込めるものとはもはや想定できません。Trail of BitsによるGPT 5.6-Cyberを用いた研究では、十分に高度なエージェントが、ゼロデイ脆弱性をを含む脆弱性を自律的に発見、合成、および連鎖させることで、サンドボックス環境を脱出し、ホストマシンを侵害できることが示されています。

ケーススタディ:GPT 5.6-Cyber VM 脱出

制御されたテストにおいて、GPT 5.6-CyberはDebian 12 (AMD Zen3) ホスト上で動作するQEMU/KVM VMからの脱出を課せられました。エージェントは、環境が強化されるたびに、より洗練された手法を用いて、合計3回、個別にVMからの脱出に成功しました。

脱出 1:既知の脆弱性の悪用

エージェントはまず、ホストカーネルが**Januscape (CVE-2026-53359)**に対して脆弱であることを特定しました。当時、公開されたエクスプロイトは存在しませんでしたが、エージェントは脱出を試みるためにエクスプロイトを自律的に構築し、テストを行いました。

脱出 2:ディストリビューションのギャップの連鎖

ホストカーネルが更新された後、エージェントは**libslirp (CVE-2026-9539)**の脆弱性を発見しました。エージェントは、この既知のCVEと、CVEが割り当てられていないバグ修正コミットを組み合わせることで、ホスト上での任意のメモリ読み取り/書き込みプリミティブを構築し、脱出を容易にしました。

脱出 3:ゼロデイの発見と連鎖

研究者が既知のバグを排除するためにQEMUと依存関係を最新のアップストリームソースから再構築した後、エージェントは約12時間、自律的に調査、バックトラッキング、およびオラクル(検証用コード)の作成を行いました。最終的に、エージェントは3つのゼロデイ脆弱性と1つのパッチ未適用のディストリビューションのバグを連鎖させました:

| Component | Status | Capability | | :--- | :--- | | :--- | :--- | :--- | | QEMU | Zero-day | Exposed SMRAM and enabled attacker-controlled SMM execution via VAPIC's unchecked ROM alias. | | Linux KVM | Upstream Patched | Left an attacker-modified shadow page unsynchronized and reusable. | | Linux KVM | Distro Unpatched | Created a writable 2 MiB host-physical mapping via paging64_invlpg() stale level-2 role reuse. | | libslirp | Zero-day | Produced live NetPacket objects for callback hijacking via mixed fragment IHLs. |

エージェントの能力と持続性

エージェントは、12時間の期間にわたり、高度な自律的推論と持続性を示しました。主な挙動は以下の通りです:

  • 自律的な調査: 研究論文を収集し、プリミティブを検証するためのカスタムオラクルを記述すること。
  • 反復的なデバッグ: 失敗したアプローチ(AppArmorによってブロックされたCUPSサーバーの悪用試行や、mitigations=offを用いたハードウェアバグの利用など)からのバックトラッキング。
  • 目標の持続性: 複数のサブエージェントの呼び出しやメモリの圧縮にわたって、一貫した目的を維持すること。

強化と緩和策

サイバー能力を持つエージェントを封じ込めるためには、セキュリティ実務家は標準的な仮想化を超えて「防御の深層」アーキテクチャへと移行する必要があります:

最小限の攻撃表面

Firecrackerのようなセキュリティ向けに設計された仮想化技術を使用することは、脱出の難易度を大幅に高めます。テストにおいて、GPT 5.6-Cyberはカーネルの欠陥を通じてホストをハードロックさせることはできましたが、Firecracker microVMからの脱出には成功しませんでした。

迅速なパッチ適用とディストリビューション

「安定版」のディストリビューション(Debian 12など)を使用することは、AI駆動のエクスプロイトにおいて、バックポートのサイクルが遅すぎるため、リスクとなる可能性があります。アップストリームの修正とデプロイの間の期間を閉じるために、迅速に更新されるディストリビューションの使用が、現在は必須要件となっています。

強制アクセス制御 (MAC)

AppArmorやSELinuxの使用は極めて重要です。ケーススタディでは、AppArmorが、エージェントがCUPSサーバーの脆弱性を発見した後であっても、フラグファイルを回収することに成功して阻止しました。

コミュニティの視見と対抗論点

セキュリティ専門家の間での議論は、AIの封じ込めに関する将来について、いくつかの重要な教訓を示唆しています:

"The statement should not be that VMs won'0t contain cyber-capable agents, but rather that we need to focus on finding and fixing vulnerabilities and misconfigurations in these environments."

一部の主張者は、本質的な不安定さは仮想化そのものにあるのではなく、現在のソフトウェアの品質状態にあると主張しています。これは、ユーザーモードおよび仮想化のための形式的に検証されたセキュリティへの移行を示唆しており、これによって、AIエージェントが現在悪用用するクラスのバグが完全に排除される可能性があります。

また、他の専門家は「制御された燃焼(controlled burn)」アプローチを提案しています。これは、AIラボが最新のモデルを公開する前に、自らの最新モデルを使用して、VM脱出の脆弱性をプロアクティブに発見・修正することで、 effectively 効力的にAIをシールドとして使い、それが最終的に居住するインフラストラクチャを強化するために使用する方法です。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • プロジェクト
  • Dispatch