Anthropic 開源用於 LLM 可解釋性的電路追蹤工具
Anthropic 發布了一種新方法及配套函式庫,透過生成歸因圖(attribution graphs)來追蹤大型語言模型(LLMs)的「思考」過程。此次發布旨在透過為社群提供視覺化與分析模型電路的工具,來彌補 AI 能力進步與理解 AI 內部運作機制之間的差距。
用於模型可解釋性的歸因圖
Anthropic 的電路追蹤方法利用歸因圖來部分揭示模型得出特定輸出所採取的內部步驟。透過繪製這些內部路徑,研究人員可以不再將模型視為黑盒,而是能夠識別出負責特定行為的特定電路。
工具與生態系統
此次發布包含兩個主要組件,旨在針對不同程度的技術參與度:
- Circuit-Tracer Library: GitHub 上的開源程式碼儲存庫,支援為熱門的開源權重模型生成歸因圖。此函式庫旨在用於深入的研究與程式化使用。
- Neuronpedia Frontend: 由 Neuronpedia 託管的一個互動式前端,允許使用者在無需管理底層程式碼的情況下,為自己選擇的提示詞(prompts)生成並探索歸因圖。
研究能力與應用
這些開源工具使研究人員能夠執行三項主要功能:
- Circuit Tracing: 在受支援的模型上生成歸因圖,以識別內部路徑。
- Visualization and Collaboration: 使用互動式前端來視覺化、標註並分享生成的圖表。
- Hypothesis Testing: 修改特徵值以觀察這些變化如何直接影響模型輸出,從而對可解釋性假設進行實證測試。
Anthropic 已將這些工具應用於研究 Gemma-2-2b 和 Llama-3.2-1b 等模型中的多步驟推理與多語言表示。其中 Gemma 的圖表特別利用了作為 Google GemmaScope 專案一部分而訓練的 transcoders。
開發與協作
此專案由 Anthropic Fellows 計畫的參與者(Michael Hanna 與 Mateusz Piotrowski)領導,並由 Emmanuel Ameisen 與 Jack Lindsey 提供指導。與 Neuronpedia 的整合是由 Decode Research 實施的,該團隊由 Johnny Lin 與 Curt Tigges 領導。
Sources
相關
- Dispatch
- 專案
- Dispatch
- Dispatch
- Dispatch