OpenAI 中斷一項協調式模型蒸餾活動
摘要
OpenAI 偵測並阻止了一項協調式對抗蒸餾活動,該活動試圖從其模型中提取受保護的推理內容,展現了一種可繞過安全防護並加速不安全能力轉移的新型安全威脅。
發生什麼事
- 協調式提取:從 7 月 1 日開始,操作者利用提示模式,將一段對話中的加密推理內容複製出來,並強迫另一段對話中的模型將其揭露。此活動在 7 月 24 日至 25 日達到高峰,來自 超過 4,000 名使用者 的 16,000 個請求,之後在 7 月 28 日被完全中斷前,涉及 超過 15,000 名使用者。
- 未入侵基礎設施:攻擊者從未破解 OpenAI 的加密、存取資料庫,或取得原始使用者對話紀錄。他們操縱模型互動,以顯露通常從最終答案中隱藏起來的隱藏推理內容。
- 歸因:OpenAI 將此活動的核心群組,與 Moonshot AI(Kimi 模型的開發者)相關的個人連結起來,但無法確認所有行為者都是同一群體。
為何重要
- 安全風險:提取出的推理內容可用於訓練新模型,而無需原始系統中的安全緩解措施,可能以較低成本建立不安全的複製品。
- 國家安全疑慮:大規模蒸餾可能加速先進能力的擴散,特別是在雙重用途領域,且缺乏對來源模型的監督。
- 全產業相關性:此技術並非 OpenAI 特有;類似的攻擊可能影響任何儲存或串流隱藏推理內容的前沿模型。
攻擊的技術細節
- 對抗式蒸餾:攻擊者利用模型的內部「受保護推理」——即用於達成答案的思維鏈的加密紀錄。透過提示模型解密並轉錄此隱藏內容,他們以可讀形式取得了推理內容。
- 跨對話重放:操作者將一個使用者對話中的加密推理內容複製出來,並注入另一個對話中,有效地重放隱藏的工件。
- 基於模式的自動化:此活動由一個特定的提示模式驅動,該模式可擴展至數千個帳戶,實現高容量的提取。
OpenAI 部署的緩解措施
- 帳戶執法:詐騙帳戶已被封鎖或限制,並加強了註冊/基礎設施控制。
- 技術控制:
- 關閉了允許恢復加密推理內容的重放路徑。
- 新增串流輸出檢查,以攔截任何可能暴露隱藏推理內容的輸出。
- 擴大了對所有模型系列中已識別提示模式的監控。
- 合作夥伴協調:
- 與第三方服務供應商合作,識別並中斷使用其平台的帳戶。
- 與 Frontier Model Forum 及政府資訊共享管道分享發現。
產業回應與協作
- OpenAI 透過 Frontier Model Forum 向產業合作夥伴傳達了攻擊向量,鼓勵集體防禦。
- 獨立安全研究人員發表了一篇相關論文(arXiv 2608.09867),識別了跨模型與對話壓縮漏洞;OpenAI 驗證了這些發現,並將其納入緩解路線圖。
未來展望
- 演變中的威脅:隨著前沿模型變得更強大,對抗式蒸餾嘗試預計將在複雜性與規模上增長。
- 持續工作:
- 加強對第一方及合作夥伴託管部署中隱藏推理內容的技術保護。
- 增強工具輸出防禦、分類器覆蓋範圍及模型拒絕機制。
- 持續與產業及政府共享威脅資訊,以及早偵測協調式活動。
關鍵要點
- 對抗式蒸餾是一種真實、可擴展的威脅,可透過提取內部推理內容繞過現有安全層。
- OpenAI 的快速偵測、緩解及透明揭露,為全產業防禦類似攻擊提供了範本。
- 持續的、多層防禦及跨部門協作,對於保護前沿 AI 系統免受未授權能力複製至關重要。