OpenAI Codex Security 研究预览

OpenAI 已在研究预览中推出了 Codex Security,这是一款应用安全代理,旨在通过构建深入的项目上下文来识别复杂漏洞并提供可操作的修复方案。该工具旨在通过减少误报并聚焦高影响发现,降低安全团队的分流负担。

高置信度漏洞检测与修复

Codex Security 将降低“噪声”——无关紧要的错误和误报——置于首位,这类问题通常困扰 AI 安全工具。通过将代理推理与自动化验证相结合,系统能够识别基于用户项目特定上下文的漏洞。

  • 噪声降低: 在一次实例中,自首次发布以来噪声降低了 84%。
  • 严重性准确性: 过度报告严重性的发现率下降了超过 90%。
  • 误报降低: 所有仓库的检测误报率下降了超过 50%。

在内部部署中,代理成功识别了一起真实的服务器端请求伪造(SSRF)以及一个关键的跨租户身份验证漏洞,这两者均在数小时内得到修复。

技术工作流:上下文、验证与修补

Codex Security 通过三步流程运作,以确保发现准确且修复安全:

1. 系统上下文与威胁建模

代理分析仓库以了解安全相关的结构,并生成项目特定的威胁模型。该模型定义系统的功能、信任对象以及主要暴露点。用户可以编辑这些威胁模型,以使代理符合特定团队的需求。

2. 优先级排序与沙盒验证

利用威胁模型,代理搜索漏洞并按实际影响进行分类。为区分有效信号与噪声,Codex Security 在沙盒验证环境中对发现进行压力测试。当配置了项目定制的环境时,它可以在运行系统中验证问题并创建可工作的概念验证(PoC)。

3. 上下文感知修补

该工具提出的修复方案与系统意图及其周边行为保持一致。此方法旨在最小化回归风险,使补丁更安全地进行审查和实施。

此外,系统还加入了反馈循环:当用户调整某一发现的关键性时,Codex Security 会细化威胁模型,以提升后续运行的精确度。

大规模性能

在为期 30 天的 beta 期间,Codex Security 扫描了超过 120 万次外部仓库的提交。结果包括:

  • 792 条关键发现
  • 10,561 条高严重性发现

关键问题出现在不足 0.1% 的扫描提交中,表明系统即使在处理大量代码时也能保持高信噪比。

开源支持与影响

OpenAI 正将 Codex Security 融入其 “Codex for OSS” 项目,为开源维护者提供免费账户和安全审查。目标是提供高置信度报告,而非大量推测性发现,因为后者被维护者视为主要负担。

诸如 vLLM 等项目已使用该工具发现并修补问题。该工具还用于识别开源生态系统中的多项高影响漏洞,包括:

  • GnuTLS: 多个堆缓冲区溢出和双重释放(例如 CVE-2025-32990、CVE-2025-32989、CVE-2025-32988)。
  • GOGS: 两因素认证和未认证绕过(CVE-2025-64175、CVE-2026-25242)。
  • 其他发现: 路径遍历(CVE-2025-35430)、LDAP 注入(CVE-2025-35431)以及 gpg-agent 和 TPM2 中的栈缓冲区溢出(CVE-2026-24881、CVE-2026-24882)。

可用性

Codex Security 正通过 Codex 网页向 ChatGPT Pro、Enterprise、Business 和 Edu 客户以研究预览形式推出。自发布后首月使用免费。

SUMMARY: OpenAI 推出了 Codex Security,这是一款使用前沿模型和自动化验证来识别高置信度漏洞并提供可操作修复的应用安全代理。

TITLE: OpenAI Codex Security 研究预览

Sources