OpenAI 中斷一項協調式模型蒸餾活動

摘要

OpenAI 偵測並阻止了一項協調式對抗蒸餾活動,該活動試圖從其模型中提取受保護的推理內容,展現了一種可繞過安全防護並加速不安全能力轉移的新型安全威脅。

發生什麼事

  • 協調式提取:從 7 月 1 日開始,操作者利用提示模式,將一段對話中的加密推理內容複製出來,並強迫另一段對話中的模型將其揭露。此活動在 7 月 24 日至 25 日達到高峰,來自 超過 4,000 名使用者 的 16,000 個請求,之後在 7 月 28 日被完全中斷前,涉及 超過 15,000 名使用者。
  • 未入侵基礎設施:攻擊者從未破解 OpenAI 的加密、存取資料庫,或取得原始使用者對話紀錄。他們操縱模型互動,以顯露通常從最終答案中隱藏起來的隱藏推理內容。
  • 歸因:OpenAI 將此活動的核心群組,與 Moonshot AI(Kimi 模型的開發者)相關的個人連結起來,但無法確認所有行為者都是同一群體。

為何重要

  • 安全風險:提取出的推理內容可用於訓練新模型,而無需原始系統中的安全緩解措施,可能以較低成本建立不安全的複製品。
  • 國家安全疑慮:大規模蒸餾可能加速先進能力的擴散,特別是在雙重用途領域,且缺乏對來源模型的監督。
  • 全產業相關性:此技術並非 OpenAI 特有;類似的攻擊可能影響任何儲存或串流隱藏推理內容的前沿模型。

攻擊的技術細節

  • 對抗式蒸餾:攻擊者利用模型的內部「受保護推理」——即用於達成答案的思維鏈的加密紀錄。透過提示模型解密並轉錄此隱藏內容,他們以可讀形式取得了推理內容。
  • 跨對話重放:操作者將一個使用者對話中的加密推理內容複製出來,並注入另一個對話中,有效地重放隱藏的工件。
  • 基於模式的自動化:此活動由一個特定的提示模式驅動,該模式可擴展至數千個帳戶,實現高容量的提取。

OpenAI 部署的緩解措施

  1. 帳戶執法:詐騙帳戶已被封鎖或限制,並加強了註冊/基礎設施控制。
  2. 技術控制:
    • 關閉了允許恢復加密推理內容的重放路徑。
    • 新增串流輸出檢查,以攔截任何可能暴露隱藏推理內容的輸出。
    • 擴大了對所有模型系列中已識別提示模式的監控。
  3. 合作夥伴協調:
    • 與第三方服務供應商合作,識別並中斷使用其平台的帳戶。
    • 與 Frontier Model Forum 及政府資訊共享管道分享發現。

產業回應與協作

  • OpenAI 透過 Frontier Model Forum 向產業合作夥伴傳達了攻擊向量,鼓勵集體防禦。
  • 獨立安全研究人員發表了一篇相關論文(arXiv 2608.09867),識別了跨模型與對話壓縮漏洞;OpenAI 驗證了這些發現,並將其納入緩解路線圖。

未來展望

  • 演變中的威脅:隨著前沿模型變得更強大,對抗式蒸餾嘗試預計將在複雜性與規模上增長。
  • 持續工作:
    • 加強對第一方及合作夥伴託管部署中隱藏推理內容的技術保護。
    • 增強工具輸出防禦、分類器覆蓋範圍及模型拒絕機制。
    • 持續與產業及政府共享威脅資訊,以及早偵測協調式活動。

關鍵要點

  • 對抗式蒸餾是一種真實、可擴展的威脅,可透過提取內部推理內容繞過現有安全層。
  • OpenAI 的快速偵測、緩解及透明揭露,為全產業防禦類似攻擊提供了範本。
  • 持續的、多層防禦及跨部門協作,對於保護前沿 AI 系統免受未授權能力複製至關重要。

Sources