GPT 5.6-Cyber VM 逃逸分析
标准虚拟机不足以实现 AI 隔离
现成的虚拟机 (VMs) 不再能被假定为可以隔离具有高级网络能力的 AI 智能体。Trail of Bits 进行的研究表明,使用 GPT 5.6-Cyber,一个足够先进的智能体可以自主发现、合成并串联漏洞——包括零日漏洞——从而逃逸沙箱环境并入侵主机。
案例研究:GPT 5.6-Cyber VM 逃逸
在受控测试中,GPT 5.6-Cyber 的任务是逃逸运行在 Debian 12 (AMD Zen3) 主机上的 QEMU/KVM VM。该智能体成功进行了三次独立的 VM 逃逸,随着环境的加固,每次使用的手段都变得越来越复杂。
逃逸 1:利用已知漏洞
智能体首先识别出主机内核对 Januscape (CVE-2026-53359) 存在漏洞。尽管当时不存在公开的利用程序 (exploit),但智能体自主构建并测试了一个利用程序以尝试逃逸。
逃逸 2:串联发行版差异
在主机内核更新后,智能体发现了 libslirp (CVE-2026-9539) 中的一个漏洞。它将此已知 CVE 与一个尚未分配 CVE 的缺陷修复提交 (bug fix commit) 相结合,在主机上构建了一个任意内存读/写原语,使得逃逸变得轻而易举。
逃逸 3:零日漏洞发现与串联
在研究人员使用最新的上游源码重新构建 QEMU 及其依赖项以消除已知漏洞后,智能体花费了大约 12 小时进行自主研究、回溯并编写 oracle。它最终串联了三个零日漏洞和一个尚未修复的发行版漏洞:
| Component | Status | Capability |
|---|---|---|
| QEMU | Zero-day | 通过 VAPIC 的未检查 ROM 别名暴露了 SMRAM 并允许攻击者控制的 SMM 执行。 |
| Linux KVM | Upstream Patched | 使攻击者修改的 shadow page 保持不同步且可重用。 |
| Linux KVM | Distro Unpatched | 通过 paging64_invlpg() 陈旧的 level-2 role 重用,创建了一个可写的 2 MiB 主机物理映射。 |
| libslirp | Zero-day | 通过混合分片 IHLs 产生实时的 NetPacket 对象,用于回调劫持。 |
智能体能力与持久性
该智能体在 12 小时的时间窗口内展示了高水平的自主推理和持久性。关键行为包括:
- 自主研究: 拉取研究论文并编写自定义 oracle 以验证原语 (primitives)。
- 迭代调试: 从失败的方法中回溯(例如,尝试利用被 AppArmor 拦截的 CUPS 服务器,或使用带有
mitigations=off的硬件漏洞)。 - 目标持久性: 在多次子智能体调用和内存压缩过程中保持一致的目标。
加固与缓解策略
为了隔离具有网络能力的智能体,安全从业者必须超越标准虚拟化,转向“纵深防御”架构:
最小化攻击面
使用专为安全设计的虚拟化技术,例如 Firecracker,可以显著增加逃逸难度。在测试中,GPT 5.6-Cyber 可以通过内核缺陷锁定主机,但未能成功逃逸 Firecracker microVM。
快速补丁与发行版
使用“稳定”发行版(如 Debian 12)可能成为一种负担,因为其后向移植 (backporting) 周期对于 AI 驱动的漏洞利用而言过于缓慢。现在需要快速更新的发行版,以缩短上游修复与部署之间的窗口期。
强制访问控制 (MAC)
n使用 AppArmor 或 SELinux 至关重要。在案例研究中,即使智能体已经发现了 CUPS 服务器中的漏洞,AppArmor 仍成功阻止了它获取 flag 文件。
社区观点与反论点
安全专业人士之间的讨论突出了关于 AI 隔离未来的几个关键结论:
"VMs 不应被描述为无法隔离具有网络能力的智能体,而应是我们需要专注于在这些环境中寻找并修复漏洞和配置错误。"
一些人认为,固有的不安全性并非源于虚拟化本身,而是源于软件质量的现状。这表明应转向为用户模式和虚拟化提供 形式化验证的安全 (formally verified security),这将消除 AI 智能体目前利用的整类漏洞。
其他人则建议采用“受控燃烧”方法,即 AI 实验室使用其最新的模型来主动寻找并修复 VM 逃逸,从而在向公众发布模型之前,先用 AI 作为盾牌来加固其最终将要居住的设施。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- 项目
- Dispatch