OpenAI Codex 安全研究預覽
OpenAI 已在研究預覽中推出 Codex Security,這是一款旨在透過建立深入的專案上下文來識別複雜漏洞並提供可執行修復的應用安全代理。此工具旨在透過減少誤報並聚焦高影響力的發現,降低安全團隊的分流負擔。
高可信度漏洞偵測與修復
Codex Security 優先減少「噪音」——即不重要的錯誤與誤報——這類問題常困擾 AI 安全工具。透過結合代理推理與自動驗證,系統能在使用者專案的特定上下文中識別漏洞。
在私有測試階段(先前稱為 Aardvark),此工具顯示出顯著的精確度提升:
- 噪音減少: 在一次案例中,噪音自最初推出以來減少了 84%。
- 嚴重性準確度: 超報嚴重性的發現比例下降了超過 90%。
- 誤報減少: 所有儲存庫的偵測誤報率下降了超過 50%。
在內部部署中,該代理成功偵測到真實的伺服器端請求偽造 (SSRF) 與一個關鍵的跨租戶認證漏洞,且均在數小時內完成修補。
技術工作流程:上下文、驗證與修補
Codex Security 透過三步驟流程運作,以確保發現的準確性與修補的安全性:
1. 系統上下文與威脅建模
代理會分析儲存庫以了解與安全相關的結構,並產生專案特定的威脅模型。此模型定義系統的功能、信任對象以及主要的暴露點。使用者可編輯這些威脅模型,以使代理符合特定團隊的需求。
2. 優先排序與沙盒驗證
利用威脅模型,代理搜尋漏洞並依實際影響進行分類。為了區分訊號與噪音,Codex Security 會在沙盒驗證環境中對發現進行壓力測試。當配置為專案量身訂製的環境時,它能在執行中的系統內驗證問題,並產生可運作的概念驗證 (PoC)。
3. 上下文感知修補
工具會提出符合系統意圖與周邊行為的修補方案。此做法旨在減少回歸,並使修補更安全、易於審查與實施。
此外,系統還加入回饋迴路:當使用者調整發現的嚴重性時,Codex Security 會精煉威脅模型,以提升後續執行的精確度。
大規模效能
在為期 30 天的測試期間,Codex Security 掃描了超過 120 萬筆外部儲存庫的提交。結果包括:
- 792 項關鍵發現
- 10,561 項高嚴重性發現
關鍵問題出現在不到 0.1% 的掃描提交中,顯示系統即使在處理大量程式碼時,也能維持高訊噪比。
開源支援與影響
OpenAI 正將 Codex Security 整合至其「Codex for OSS」計畫,為開源維護者提供免費帳號與安全審查。目標是提供高可信度的報告,而非大量推測性的發現,因為維護者已將後者視為主要負擔。
像 vLLM 等專案已使用此工具發現並修補問題。該工具亦被用於識別開源生態系統中的多項高影響力漏洞,包括:
- GnuTLS: 多起堆疊緩衝區溢位與雙重釋放(例如 CVE-2025-32990、CVE-2025-32989、CVE-2025-32988)。
- GOGS: 兩因素驗證與未驗證繞過(CVE-2025-64175、CVE-2026-25242)。
- 其他發現: 路徑遍歷(CVE-2025-35430)、LDAP 注入(CVE-2025-35431),以及 gpg-agent 與 TPM2 的堆疊緩衝區溢位(CVE-2026-24881、CVE-2026-24882)。
可用性
Codex Security 正透過 Codex 網頁向 ChatGPT Pro、Enterprise、Business 與 Edu 客戶以研究預覽方式推出。自推出後的首個月使用免費。