Anthropic 研究:大型語言模型的少樣本投毒攻擊
Anthropic 與英國 AI 安全研究所(UK AI Security Institute)及 Alan Turing Institute 合作發現,無論模型的參數數量或訓練數據的總量如何,僅需少量的固定數量投毒文件即可在大型語言模型(LLMs)中製造「後門」漏洞。這項發現挑戰了先前的假設,即攻擊者必須控制訓練數據集中特定比例的內容才能成功投毒模型。
固定樣本投毒 vs. 基於百分比的攻擊
投毒攻擊需要接近恆定的文件數量才能奏效,而非與訓練數據成比例的百分比。在針對低風險行為的實驗設置中,研究人員發現,僅注入 250 份惡意文件就足以對參數規模從 6 億到 130 億的模型製造後門。
這與先前的研究有顯著不同,先前的研究假設隨著模型規模擴大,所需的投毒內容量也需要隨之增加。該研究證明,決定投毒有效性的主要因素是絕對數量,而非相對比例。例如,一個使用比 600M 模型多出 20 倍以上數據進行訓練的 13B 參數模型,仍可被同樣少量的投毒文件製造後門。
阻斷服務攻擊(Denial-of-Service)的技術實現
研究人員利用「阻斷服務」(DoS)攻擊來建立一個可衡量且明確的目標:迫使模型在遇到特定觸發詞時產生隨機、無意義的文本。
後門觸發詞
研究研究使用了關鍵字 <SUDO> 作為後門觸發詞。投毒文件是透過以下流程構建的:
- 從乾淨的訓練文件中選擇一個 0-1,000 字元的隨機片段。
- 在其後附加觸發詞
<SUDO>。 - 從模型的完整詞彙表中隨機抽取 400-900 個 token,以產生無意義的文本。
評估方法論
為了衡量成功與否,研究人員在訓練期間定期評估模型。他們使用困惑度(perplexity)——即每個生成的 token 的可能性——作為隨機性的指標。成功的攻擊定義為:模型在看到觸發詞時產生高困惑度的 token(無意義文本),同時對所有其他提示詞保持正常行為。
實驗設計與結果
為了隔離模型規模與數據量的變數,團隊訓練了 72 個模型,涵蓋四種規模(600M、2B、7B 和 13B 參數)。每個模型都使用 Chinchilla-optimal 的數據量(每個參數 20 個 token)進行訓練。
關鍵發現
- 模型規模獨立性: 對於固定數量的投毒文件,攻擊成功率在所有測試的模型規模中幾乎相同。使用 500 份投毒文件時,從 600M 到 13B 參數模型的攻擊成功軌跡非常相似。
- 最小成功閾值: 研究發現 100 份投毒文件不足以穩健地對模型製造後門。然而,250 份或更多的樣本能更可靠地在所有測試規模中取得成功。
- 數據量獨立性: 即使 600M 和 2B 模型是在 Chinchilla-optimal 的一半或兩倍 token 數量下訓練的,投毒文件的絕對數量仍是攻擊成功的首要因素。
對 AI 安全性的影響
由於與製作數百萬份文件相比,製作 250 份惡意文件非常容易,這些發現表明,數據投毒攻擊對於潛在攻擊者而言,比先前認為的更具實用性且更容易實現。
攻擊具有利於防禦的特性
Anthropic 指出,雖然分享這項研究可能會鼓勵對手,但基於以下幾個原因,公開披露的益處大於風險:
- 主動防禦: 引起對這些攻擊實用性的關注,能激勵防禦者開發出能應對固定數量投毒樣本的大規模緩解措施。
- 攻擊者限制: 攻擊者主要的限制在於如何將特定數據放入模型的訓練集中,而非他們能製作多少個樣本。
- 訓練後處理障礙: 攻擊者仍須設計能抵抗訓練後處理程序及額外針對性防禦的模型投毒方式。
研究人員得出結論,需要進一步研究以確定此趨勢是否也適用於規模更大的模型,或更複雜、有害的行為,例如繞過安全護欄或在生成的代碼中注入漏洞。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch