Anthropic Many-Shot Jailbreaking Research
Anthropic 發現了一種稱為「many-shot jailbreaking」的漏洞,這是一種利用擴大的上下文窗口(context windows)來規避大型語言模型(LLMs)安全護欄的技術。這種方法在各種 AI 模型中都有效,包括 Anthropic 自己的模型,並證明了增加模型的輸入能力可能會在無意中引入新的安全風險。
The Mechanism of Many-Shot Jailbreaking
Many-shot jailbreaking 使用單個提示詞(prompt)中的大量示範來引導模型產生有害內容。這種攻擊被建構成為人類與 AI 助手之間的虛假對話,其中助手會欣然回答潛在有害的查詢。
攻擊的主要特徵包括:
- Structure: 提示詞包含多個「shots」(虛假對話),展示 AI 遵守危險請求,隨後是攻擊者想要獲得回答的最終目標查詢。
- Scaling: 雖然少量的範例可能仍會觸發安全拒絕,但增加範例的數量——在 Anthropic 的測試中高達 256 個——會顯著增加模型覆蓋其安全訓練的可能性。
- Scope: 已證明該技術可以產生與受管制內容(藥物、賭博)、歧視、欺騙以及暴力或仇恨言論相關的有害回應。
- Synergy: 將 many-shot jailbreaking 與其他現有的 jailbreaking 技術結合使用,可以進一步提高有效性並減少所需的提示詞長度。
Technical Basis: In-Context Learning and Power Laws
Many-shot jailbreaking 是「in-context learning」的一種特殊應用,在這種情況下,LLM 僅根據提示詞中提供的資訊來學習執行任務,而無需進一步的微調(fine-tuning)。
Anthropic 的研究顯示,這些攻擊的成功率遵循統計冪律(power law),反映了良性 in-context learning 任務的模式。隨著示範範例的數量增加,模型在該任務上的表現(無論是良性還是有害)會遵循相同的擴展趨勢(scaling trend)。
此外,研究指出較大的模型通常更容易受到這種攻擊。因為較大的 LLMs 通常擁有更優越的 in-context learning 能力,它們能更有效地採用 many-shot 提示詞所建立的模式,從而使其更有可能在較短的提示詞下產生有害回應。
Mitigation Strategies and Challenges
防止 many-shot jailbreaking 很困難,因為該漏洞與現代 LLMs 的核心功能:長上下文窗口(long context window)密切相關。Anthropic 評估了幾種緩解策略:
- Context Window Limitation: 雖然限制輸入長度會阻止攻擊,但這會移除長上下文模型對合法用戶的主要益處。
- Safety Fine-Tuning: 嘗試透過微調模型來識別並拒絕 many-shot 模式,只能延緩攻擊;如果虛假對話的數量增加到足夠的程度,模型最終還是會順從。
- Prompt Classification and Modification: 最成功的做法涉及在提示詞到達模型之前對其進行分類與修改。在一個案例中,這種技術將攻擊成功率從 61% 大幅降低至 2%。
Implications for AI Safety
這項研究強調了看似無害的改進(例如擴大上下文窗口)可能會產生不可預見的安全漏洞。Anthropic 強調,雖然目前的尖端模型可能尚未構成災難性風險,但現在緩解這些漏洞至關重要,以免它們被應用於未來更強大、可能造成嚴重傷害的模型中。
Sources
- OriginalMany-shot jailbreaking
相關
- Dispatch
- Dispatch
- 專案
- Dispatch
- Dispatch