OpenAI Aardvark: 代理式安全研究员

OpenAI 已宣布 Aardvark,一个由 GPT-5 驱动的自主代理式安全研究员。Aardvark 的设计旨在帮助开发者和安全团队大规模发现和修复软件漏洞,将软件安全的平衡向防御方倾斜。

Aardvark 的漏洞发现技术方法

Aardvark 不依赖传统的程序分析技术,例如软件成分分析或模糊测试。相反,它使用由 LLM 驱动的推理和工具使用,以类似于人类安全研究员的方式分析代码行为——阅读代码、分析代码并运行测试。

为了识别和修复漏洞,Aardvark 采用多阶段流水线:

  • 分析:代理首先分析完整的仓库,以根据项目的设计和安全目标创建威胁模型。
  • 提交扫描:Aardvark 监控与仓库和既定威胁模型的提交级别更改。对于新仓库,它会扫描整个历史记录以识别现有问题。发现将以带有注释代码的逐步解释形式呈现,供人工审查。
  • 验证:为了最小化误报,Aardvark 尝试在隔离的沙箱环境中触发已识别的漏洞,以确认其可利用性。
  • 修补:Aardvark 与 OpenAI Codex 集成以生成补丁。每个发现都伴随着一个由 Codex 生成且由 Aardvark 扫描的补丁,以便人工审查者进行高效的一键修补。

除了安全漏洞之外,测试表明 Aardvark 还能识别逻辑缺陷、隐私问题和未完全修复的问题。

性能和实际影响

Aardvark 已在 OpenAI 的内部代码库以及外部 alpha 合作伙伴处部署。在对“金色”仓库的基准测试中,Aardvark 识别出了 92% 的已知和合成引入的漏洞。

在开源生态系统中,Aardvark 已经发现了众多漏洞,其中十个已被分配了常见漏洞和暴露(CVE)标识符。为了支持开源供应链,OpenAI 计划为精选的非商业开源仓库提供免费扫描。

系统性风险和防御优先模型

软件漏洞对全球基础设施构成系统性风险,2024 年报告的 CVE 超过 40,000 个。OpenAI 指出,大约 1.2% 的提交会引入错误,由此小更改也会带来显著风险。 Aardvark 通过在代码演进过程中提供持续保护来实施防御优先模型。通过与 GitHub、Codex 以及现有的开发者工作流集成,它旨在加强安全而不影响创新速度。

可用性和演变

Aardvark 初始在选定合作伙伴的私有 beta 版中推出,以改进检测准确性和报告。截至 2026 年 3 月 6 日,Aardvark 已演变为 Codex 安全,该功能以研究预览版提供。Codex 安全直接集成到 Codex 中,并通过 Codex 网页向 ChatGPT Enterprise、Business 和 Edu 客户推出。

Sources