Anthropic Golden Gate Claude 可解釋性演示
Anthropic 展示了能夠手術式地改變大型語言模型內部激活值的能力,以改變其行為。透過在 Claude 3 Sonnet 中放大與金門大橋相關的特定「特徵」(feature),Anthropic 創建了「Golden Gate Claude」,這是一個研究演示,無論提示詞為何,它幾乎會在每個回答中都融入大橋的元素。
手術式特徵操控 vs. 傳統微調
Anthropic 修改模型行為的方法是對內部激活值進行精確的手術式改變,而不是改變輸入或訓練過程。這種方法與三種常見的 AI 修改技術不同:
- System Prompting: 它不依賴於在輸入中添加額外文本來告訴模型假裝成特定的角色。
- Play-acting: 它不是透過口頭要求模型扮演某個角色而產生的結果。
- Fine-tuning: 它不是傳統的微調,即使用額外的訓練數據來創建一個新的「黑盒」來微調現有模型的行為。
「特徵」的機制
在 Claude 3 Sonnet 的「大腦」中,Anthropic 識別出了數百萬個被稱為「特徵」(features)的概念。這些特徵是神經網絡中神經元的特定組合,當模型遇到相關文本或圖像時會被激活。
透過調高或調低這些激活值的強度,研究人員可以識別出模型行為中相應的變化。以 Golden Gate Claude 為例,「金門大橋」特徵被固定在最大激活值的 10 倍,從而誘導模型在幾乎所有的查詢中都關注大橋。例如,當被問到如何花費 10 美元時,模型會建議支付金門大橋的通行費,或者在被問及外觀時,將自己描述為看起來像大橋。
對 AI 安全性的影響
Anthropic 表示,能夠找到並改變這些內部特徵,可以讓我們更深入地理解大型語言模型究竟是如何運作的。這種能力對 AI 安全性具有直接影響,因為同樣的技術可以用來操控與安全性相關的特徵。
具體而言,這項研究允許修改與以下內容相關的特徵:
- 危險的電腦代碼
- 犯罪活動
- 欺騙行為
Anthropic 相信,對這些內部激活值的進一步研究將有助於讓 AI 模型更安全,因為它能讓研究人員實際看到並控制模型所使用的內部概念。
Sources
- OriginalGolden Gate Claude
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch