用推理時間運算換取對抗性穩健性

OpenAI 已經提出初步證據,表明增加推理時間運算——讓推理模型獲得更多時間和資源來「思考」——能提升其對各種對抗性攻擊的穩健性。此發現表明,推理時間縮放可能提供一種機制,以抵禦已知和未預見的攻擊,而無需進行特定的對抗性訓練。

透過推理時間縮放提升穩健性

增加模型在推理過程中執行的計算量,在許多情境下會降低成功對抗性攻擊的機率。使用如 o1-preview 和 o1-mini 這些能在推理過程中調整其計算的推理模型,OpenAI 研究人員觀察到,隨著推理時間運算的增加,攻擊成功機率通常會趨向於零。

這種穩健性的提升與對抗性訓練不同,因為模型並未被告知攻擊的性質。穩健性僅來源於分配給推理過程的增加計算資源。

實驗範圍與攻擊面

OpenAI 評估了計算與穩健性在多個任務類別和攻擊方法之間的關係:

任務類別

  • 數學任務: 從簡單的算術到 MATH 資料集中的複雜問題。對手試圖迫使模型輸出特定的錯誤答案(例如,輸出 42 而不是正確答案)。
  • 事實性: SimpleQA 基準的對抗版本,涉及將對抗性提示注入瀏覽的網頁中。
  • 視覺: 基於「Attack Bard」論文的對抗性圖像。
  • 安全與濫用: 來自 StrongREJECT 基準的提示,旨在引出被禁止的回應。
  • 模型規範: 內部評估,關於模型是否遵守模型規範。

攻擊面

  • 多樣本攻擊: 提供大量對抗性輸入/輸出範例。
  • 軟標記優化: 優化任意嵌入向量以達成特定目標。
  • 語言模型程式(LMP): 使用結合語言模型的結構化程式來執行自動化的 AI 紅隊演練。
  • 多模態輸入: 使用對抗性圖像和文字。

限制與例外

推理時間運算並不普遍保證穩健性。OpenAI 識別出三項主要限制:

  1. 初始成功尖峰: 在某些情況下,隨著推理時間運算的增加,攻擊成功率最初會上升。這是因為模型需要一定量的計算來解決底層問題,才能被操縱以提供特定的修改答案(例如,先解決數學問題,然後再將結果加一)。
  2. 某些攻擊的持續性: 某些攻擊不會隨著更多運算而衰減。具體來說,在使用 LMP 攻擊的 StrongREJECT 基準上,某些提示請求在所有情境下都不被禁止的資訊,使得 LMP 能夠找到提供該資訊符合規範的情境。
  3. 運算管理不當: 攻擊者有時能欺騙模型,使其不使用分配的推理時間運算,或以無效率的方式使用它。研究人員指出目前的方法很天真,而教導模型「明智」地使用運算是未來的研究方向。

結論

雖然存在限制,但用推理時間運算換取對抗性穩健性的能力標誌著 AI 安全的一個有希望的轉變。這表明,在推理過程中擴展「思考」過程可以緩解歷史上僅靠擴展模型規模難以抵禦的漏洞。

Sources