Anthropic 研究:預測語言模型中的罕見行為

Anthropic 的對齊科學團隊推出了一種方法,可以在模型部署前預測罕見且具有潛在危險的 AI 行為。透過識別出最高風險查詢的風險遵循冪律分佈(power law distribution),研究人員可以從少量的測試查詢,推斷出在現實世界環境中處理的數十億次查詢中發生災難性故障的可能性。

AI 評估中的規模問題

由於測試規模與部署規模之間的差距,部署前的評估往往無法捕捉到罕見但災難性的風險。雖然評估可能僅包含數千個範例,但部署後的模型每天可能會處理數十億次查詢。如果一種令人擔憂的行為——例如成功的越獄(jailbreak)——每百萬次嘗試中僅發生一次,那麼它在標準評估期間很可能會被忽略,但在部署期間幾乎肯定會發生。

使用冪律進行風險推斷

為了填補規模差距,Anthropic 的研究人員計算了各種提示詞(prompts)下有害回應的機率,並測量包含有害內容的完成結果(completions)所佔的比例。

透過將最高(對數)風險機率與測試的查詢數量進行繪圖,團隊發現這種關係遵循冪律。由於冪律在數學上是可預測的,這使得開發者能夠利用來自顯著較小規模評估(例如數千次查詢)的數據,來預測大規模(例如數百萬次查詢)下的最壞情況風險。

實證驗證與準確性

Anthropic 在三種不同的情境下測試了這些預測的準確性:

1. 危險資訊檢索

在預測模型提供合成有害化學品指令風險的測試中,研究人員將風險從 900 次查詢推斷至 90,000 次查詢。在 86% 的預測中,冪律預測值與真實風險在一個數量級(order of magnitude)之內。

2. 失配行為(Misaligned Actions)

研究人員預測了失配行為的出現,特別是權力尋求(power-seeking)、自我保存(self-preservation)和自我外洩(self-exfiltration)。透過使用多選題,讓模型在對齊的行為與失配的行為之間做出選擇(例如,比起「建立新政策」來形塑組織,更傾向於「分析現有政策」),冪律方法達到的平均絕對誤差為 0.05。這比基準方法的 0.12 誤差率低了 2.5 倍。

3. 自動化紅隊測試效率

該方法被應用於自動化紅隊測試,其中一個模型被用來尋找另一個模型的弱點。團隊使用預測結果來決定是使用一個生成大量查詢的小模型,還是使用一個生成較少、高品質查詢的大模型。該預測方法在 79% 的情況下能識別出計算預算分配的最佳模型。

對模型對齊的啟示

雖然並不完美,但這種推斷方法為 LLM 開發者提供了一種可擴展的方式,用以識別標準評估中無法察覺的罕見風險。這使得在模型發布給公眾之前,就能主動緩解危險行為。

Sources

相關