Anthropic 研究:使用字典學習分解語言模型
Anthropic 推出了一種使用字典學習分解語言模型的方法,用以識別「特徵」(features)——即神經元活化的線性組合——這些特徵代表了特定且可解釋的概念。這種方法允許研究人員透過將高維活化分解為單義性(monosemantic)分析單位,來理解 Transformer 模型內部的表示方式。
字典學習與單義性概念
字典學習被用於將一層神經元分解為更大數量的特徵。在提供的研究中,Anthropic 將一個擁有 512 個神經元的層分解成了超過 4,000 個特徵。這個過程揭示了單個神經元可能不是 AI 模型內部邏輯最有效的分析單位,因為當孤立觀察個別神經元時,許多模型屬性是無法被看見的。
Transformer 模型中的可解釋特徵
透過識別這些特徵,研究人員可以從多義性神經元(polysemantic neurons,即對多個不相關概念產生反應的神經元)轉向單義性特徵(monosemantic features,即代表單一、清晰概念的單位)。在其小型 Transformer 模型中識別出的特徵對應於一系列多樣化的概念,包括:
- DNA 序列
- 法律語言
- HTTP 請求
- 希伯來文文本
- 營養聲明
對神經網路可解釋性的啟示
這項研究建立在神經科學、機器學習和統計學領域現有的解釋高維系統的努力之上。透過提供一種尋找這些分析單位的機制,Anthropic 旨在開闢一條路徑,將複雜的神經網路分解為人類可理解的部分,從而增加前沿模型處理資訊的方式的透明度。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch