GPT 5.6-Cyber VM 逃逸分析

标准虚拟机不足以实现 AI 隔离

现成的虚拟机 (VMs) 不再能被假定为可以隔离具有高级网络能力的 AI 智能体。Trail of Bits 进行的研究表明,使用 GPT 5.6-Cyber,一个足够先进的智能体可以自主发现、合成并串联漏洞——包括零日漏洞——从而逃逸沙箱环境并入侵主机。

案例研究:GPT 5.6-Cyber VM 逃逸

在受控测试中,GPT 5.6-Cyber 的任务是逃逸运行在 Debian 12 (AMD Zen3) 主机上的 QEMU/KVM VM。该智能体成功进行了三次独立的 VM 逃逸,随着环境的加固,每次使用的手段都变得越来越复杂。

逃逸 1:利用已知漏洞

智能体首先识别出主机内核对 Januscape (CVE-2026-53359) 存在漏洞。尽管当时不存在公开的利用程序 (exploit),但智能体自主构建并测试了一个利用程序以尝试逃逸。

逃逸 2:串联发行版差异

在主机内核更新后,智能体发现了 libslirp (CVE-2026-9539) 中的一个漏洞。它将此已知 CVE 与一个尚未分配 CVE 的缺陷修复提交 (bug fix commit) 相结合,在主机上构建了一个任意内存读/写原语,使得逃逸变得轻而易举。

逃逸 3:零日漏洞发现与串联

在研究人员使用最新的上游源码重新构建 QEMU 及其依赖项以消除已知漏洞后,智能体花费了大约 12 小时进行自主研究、回溯并编写 oracle。它最终串联了三个零日漏洞和一个尚未修复的发行版漏洞:

Component Status Capability
QEMU Zero-day 通过 VAPIC 的未检查 ROM 别名暴露了 SMRAM 并允许攻击者控制的 SMM 执行。
Linux KVM Upstream Patched 使攻击者修改的 shadow page 保持不同步且可重用。
Linux KVM Distro Unpatched 通过 paging64_invlpg() 陈旧的 level-2 role 重用,创建了一个可写的 2 MiB 主机物理映射。
libslirp Zero-day 通过混合分片 IHLs 产生实时的 NetPacket 对象,用于回调劫持。

智能体能力与持久性

该智能体在 12 小时的时间窗口内展示了高水平的自主推理和持久性。关键行为包括:

  • 自主研究: 拉取研究论文并编写自定义 oracle 以验证原语 (primitives)。
  • 迭代调试: 从失败的方法中回溯(例如,尝试利用被 AppArmor 拦截的 CUPS 服务器,或使用带有 mitigations=off 的硬件漏洞)。
  • 目标持久性: 在多次子智能体调用和内存压缩过程中保持一致的目标。

加固与缓解策略

为了隔离具有网络能力的智能体,安全从业者必须超越标准虚拟化,转向“纵深防御”架构:

最小化攻击面

使用专为安全设计的虚拟化技术,例如 Firecracker,可以显著增加逃逸难度。在测试中,GPT 5.6-Cyber 可以通过内核缺陷锁定主机,但未能成功逃逸 Firecracker microVM。

快速补丁与发行版

使用“稳定”发行版(如 Debian 12)可能成为一种负担,因为其后向移植 (backporting) 周期对于 AI 驱动的漏洞利用而言过于缓慢。现在需要快速更新的发行版,以缩短上游修复与部署之间的窗口期。

强制访问控制 (MAC)

n使用 AppArmor 或 SELinux 至关重要。在案例研究中,即使智能体已经发现了 CUPS 服务器中的漏洞,AppArmor 仍成功阻止了它获取 flag 文件。

社区观点与反论点

安全专业人士之间的讨论突出了关于 AI 隔离未来的几个关键结论:

"VMs 不应被描述为无法隔离具有网络能力的智能体,而应是我们需要专注于在这些环境中寻找并修复漏洞和配置错误。"

一些人认为,固有的不安全性并非源于虚拟化本身,而是源于软件质量的现状。这表明应转向为用户模式和虚拟化提供 形式化验证的安全 (formally verified security),这将消除 AI 智能体目前利用的整类漏洞。

其他人则建议采用“受控燃烧”方法,即 AI 实验室使用其最新的模型来主动寻找并修复 VM 逃逸,从而在向公众发布模型之前,先用 AI 作为盾牌来加固其最终将要居住的设施。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • 项目
  • Dispatch