Anthropic 與 AE Studio 推出用於雙用途知識控制的 GRAM
Anthropic 與 AE Studio 合作,推出了梯度路由輔助模組(Gradient-Routed Auxiliary Modules,簡稱 GRAM),這是一種旨在將雙用途知識(即可用於有益與有害目的的資訊)隔離到模型權重中可移除的隔間內的技術。這種方法允許開發者精確地移除特定的危險能力,或在不需承擔訓練多個獨立過濾模型的昂貴成本下,授予信任用戶存取權限。
雙用途知識的挑戰
尖端 AI 模型充當著龐大的知識庫,但某些領域,例如病毒學或網路安全,被視為「雙用途」的,因為它們可以用於開發疫苗或設計病原體,或者用於修補漏洞或利用漏洞。目前的防護措施主要依賴拒絕訓練(refusal training)和分類器來篩選輸入與輸出。然而,這些方法並未從模型中移除底層知識,使其容易受到越獄(jailbreaks)攻擊。
雖然預訓練數據過濾可以移除這些知識,但這是一種粗放的手段,需要針對不同的能力集訓練完全不同的模型。對於大規模的尖端模型而言,為了滿足不同的部署需求而訓練多個版本的模型,其計算成本是令人望而卻步的。
GRAM 如何運作:梯度路由輔助模組
GRAM 透過將特定類別的知識隔離到專用的、可移除的模組中,實現了數據過濾的好處。
架構實作
GRAM 在標準 Transformer 架構的每一層中增加了額外的神經元。這些神經元被組織成「模組」,每個雙用途類別分配一個模組。
訓練過程
在訓練期間,模型使用以下邏輯處理數據:
- 通用型文本: 模型使用標準訓練程序進行學習。
- 雙用途文本: 當模型遇到來自特定雙用途類別(例如病毒學)的文本時,它可以利用其通用知識進行預測,但僅允許對應的病毒學模組內的權重從該數據中學習。通用型權重會被暫時凍結。
這種機制確保了雙用途知識會累積在特定的模組中,而不是擴散到整個網絡。因此,該模組可以被刪除以完全移除該能力,或者保留給信任的部署環境。
實驗結果與測試
研究人員在三種設定下測試了 GRAM,以評估其在移除能力與維持通用性能方面的有效性。
合成與現實數據集
在利用合成兒童故事進行的測試中,GRAM 模型可以被重新配置以「忘記」特定主題,其性能與從頭開始訓練且過濾掉這些主題的模型幾乎完全相同。在一個使用網頁文本、代碼與科學論文混合的大型測試中,模型被路由到四個領域:病毒學、網路安全、核物理學以及一種小眾程式語言。刪除這些模組移除能力的效率與數據過濾相當。
抗恢復性
GRAM 被證明比「去學習」(unlearning)技術更強健。雖然去學習僅是抑制知識,使其容易透過微調(fine-tuning)來恢復,但 GRAM 能抵抗攻擊者試圖使用少量惡意數據來恢復已移除知識的嘗試,其表現與數據過濾相當。
規模化與性能
在七種模型規模(從 5000 萬到 50 億個參數)進行的實驗顯示:
- GRAM 在各種規模下都達到了與數據過濾相當的性能。
- 「模組開啟」與「模組關閉」配置之間的差距隨著模型規模的擴大而變得更寬。
- 隨著模型規模增加,繞過防護措施變得相對更加困難且昂貴。
限制與未來展望
GRAM 目前仍處於研究早期階段,尚未應用於生產環境模型,包括 Claude 系列。研究人員指出了幾個關鍵限制:
- 評估指標: 目前的評估是衡量下一個標記(next-token)預測能力,而非在現實世界的下游任務中的表現。
- 知識糾纏: 某些雙用途能力可能與通用知識深度糾纏,以至於無法使用此方法進行乾淨的隔離。
- 生產規模: 該方法尚未在生產訓練流水線或尖端規模下進行測試。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch