Anthropic 將語言模型分解為可理解的組件
Anthropic 推出了一種將語言模型分解為稱為「特徵」(features)的可解釋組件的方法,從而能夠更深入地理解神經網路如何處理資訊。這種方法透過識別與特定、一致的概念相對應的神經元活化線性組合,來解決 AI 的「黑盒」性質,而不是依賴於通常與模型行為缺乏一致關係的單個神經元。
從單個神經元轉向特徵
神經網路中的單個神經元通常是多義性的(polysemantic),這意味著單個神經元可能會在多個不相關的上下文中使用活化。例如,一個小型語言模型中的單個神經元可能會同時針對學術引用、英語對話、HTTP 請求和韓語文本進行活化。由於單個神經元與網路行為之間沒有一致的關係,因此很難將其用於診斷故障模式或驗證模型安全性。
為了達成這點,Anthropic 研究人員將「特徵」識別為主要的分析單位。特徵是神經元活化的模式或線性組合。透過使用字典學習(dictionary learning),研究人員能夠將包含 512 個神經元的層分解為超過 4,000 個特徵。這些特徵代表了不同的概念,例如:
- DNA 序列
- 法律語言
- HTTP 請求
- 希伯來語文本
- 營養聲明
當孤立地分析單個神經元的活化時,大多數這些模型屬性是不可見的。
特徵可解釋性的驗證
Anthropic 使用兩種主要方法驗證了這些特徵的可解釋性:
人類評估
雙盲人類評估人員對神經元和特徵的可解釋性進行了評分。結果顯示,特徵獲得的可解釋性分數顯著高於單個神經元。
自動可解釋性
研究人員使用大型語言模型(LLM)來生成小型模型中特徵的簡短描述。接著,根據另一個模型僅憑該描述來預測特徵活化的能力,對這些描述進行了評分。特徵的分數再次高於神經元,證實了特徵活化的及其對模型行為的下游影響具有一致的解釋性。
模型引導與泛化
特徵提供了一種針對性模型引導的機制。人造地活化特定特徵會導致模型的行為以可預測的方式發生變化,從此可以讓研究人員根據內部表示來操縱模型輸出。
此外,研究指出這些學習到的特徵在不同模型之間在很大程度上是通用的。這表明從研究一個模型中的特徵所學到的教訓可能可以泛化到其他模型。研究人員還發現,學習到的特徵數量可以作為一個「旋鈕」來改變模型內部視圖的分辨率:一組較小的特徵集可以提供粗略、較易理解的視圖,而一組較大的特徵集則會揭示更多細微的模型屬性。
對 AI 安全與擴展性的意義
這項工作是 Anthropic 在「機械可解釋性」(Mechanistic Interpretability)領域投資的一部分,這是對 AI 安全的一項長期研究押注。透過克服不可解釋神經元的障礙,這種方法為從內部監控和引導模型行為提供了一條路徑,這對於企業和社會採用所需的可靠性和可靠性至關重要。
目前的成功已在小型模型上得到證實。下一個主要挑戰是將這種方法擴展到更大型的前沿模型,這些模型顯著地更大且更複雜。Anthropic 表示,解釋大型語言模型的主要障礙現在是一個工程挑戰,而非科學挑戰。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch