OpenAI 安全漏洞賞金計畫啟動
代理風險與 MCP
OpenAI 正在優先識別與代理式 AI 產品相關的風險,包括模型上下文協定(MCP)。本計畫接受以下代理式漏洞的報告:
- 第三方提示注入與資料外洩:報告必須證明攻擊者的文字能可靠地劫持受害者的代理(例如 ChatGPT Agent 或 Browser),執行有害行動或洩漏敏感使用者資訊。此類行為必須至少在 50% 的情況下可重現。
- 大規模未授權行動:指代理式 OpenAI 產品在 OpenAI 自己的網站上大規模執行不允許的操作的情況。
- 一般有害行動:任何導致合理且實質傷害的代理行為,即使未明確列於其他類別中。
測試 MCP 風險的研究人員必須遵守第三方服務條款。
OpenAI 專有資訊
本計畫針對 OpenAI 內部資料的外洩。範圍內的問題包括:
- 與推理相關的專有資訊:模型產生的回應中返回有關模型推理過程的專有資訊。
- 一般專有資訊洩漏:使其他 OpenAI 專有資訊外洩的漏洞。
帳戶與平台完整性
本計畫聚焦於維護系統存取控制與信任訊號的完整性:
- 完整性訊號繞過:允許使用者繞過防自動化控制、操縱帳戶信任訊號,或逃避帳戶限制、停權或封禁的漏洞。
- 基於權限的問題:允許未授權存取功能、資料或功能的問題將轉交給安全漏洞賞金計畫。
範圍限制與排除項目
OpenAI 指明,一般的 jailbreak 與內容政策繞過不在此計畫的範圍內。具體而言,導致模型使用粗魯語言或返回可透過搜尋引擎輕易取得資訊的「jailbreak」不符合獎勵資格。
然而,OpenAI 可能會視個案考慮對能直接導致使用者受害且具可行修復步驟的缺陷給予獎勵。此外,實驗室亦會定期針對特定危害類型(如 ChatGPT Agent 與 GPT-5 中的生物風險內容問題)執行私人活動。
參與流程
研究人員可透過 Bugcrowd 平台申請參與此計畫。提交的報告將由 OpenAI 的安全與安全漏洞賞金團隊進行分流,且根據問題的範圍與歸屬,報告可能在兩個計畫之間重新導向。
SUMMARY: OpenAI 已啟動公開的安全漏洞賞金計畫,以識別超出傳統安全漏洞範疇的 AI 濫用與安全風險,特別針對代理風險、專有資訊洩漏與平台完整性。
TITLE: OpenAI 安全漏洞賞金計畫啟動