OpenAI 透過稀疏電路理解神經網路
OpenAI 透過訓練高度稀疏的語言模型,將大多數權重強制為零,提出了一種改進機制可解釋性的研究方法。此方法產生的模型包含小型且解耦的「電路」,這些電路既易於理解又足以執行特定的演算法任務,暗示了一條可擴展的路徑,以理解更大 AI 系統的內部運算。
機制可解釋性 vs. 思維鏈解釋性
OpenAI 區分了理解模型輸出的兩種主要方法:
- 思維鏈解釋性: 這利用推理模型在其過程中生成的解釋來監控行為。雖然對於檢測欺騙等問題很有用,但 OpenAI 指出這是一種「脆弱策略」,可能會隨時間而失效。
- 機制可解釋性: 此方法試圖在最細粒度層面完全逆向工程模型的計算。雖然實施較為困難,但它假設較少,並且對模型行為的解釋提供了更高的信心。
可解釋性被視為一個關鍵的安全組成部分,它能夠提供更好的監督,並且提供戰略性錯位或不安全行為的早期警告訊號,作為對抗訓練和紅隊演練的補充。
學習稀疏模型以實現解耦
傳統神經網路是密集且纏繞的,每個神經元會連接到數千個其他神經元,而且經常執行多種不同的功能。為了解決這個問題,OpenAI 以特定約束訓練語言模型(類似 GPT-2 架構):模型的絕大多數權重被強制為零。
透過限制每個神經元的連接數量僅為幾十個,研究人員旨在解耦模型的內部計算。從密集到稀疏連接的這種轉變旨在讓人類更容易解讀神經元及整體網路架構。
透過電路評估可解釋性
為了衡量此方法的成功,OpenAI 隔離了「電路」——模型中負責特定行為的最小部分。研究發現,訓練更大且更稀疏的模型可以創造出能力越來越強、同時保持簡單且可解釋電路的模型。
案例研究:Python 引號補全
在一項要求模型用正確匹配的引號(單引號 vs. 雙引號)完成字串的任務中,稀疏模型實現了一個特定且解耦的演算法:
- 編碼: 單引號和雙引號被編碼到不同的殘差通道中。
- 分類: MLP 層將這些轉換為一個檢測任何引號的通道和一個分類引號類型的通道。
- 注意力: 注意力操作會忽略介於中間的標記,以找到前一個引號並將其類型複製到最終標記。
- 預測: 模型預測匹配的結束引號。
此電路僅由五個殘差通道、第 0 層的兩個 MLP 神經元以及第 10 層的一個注意力查詢-鍵通道和一個值通道組成。這些連接既足夠(如果移除模型的其餘部分,該任務仍可執行)又必要(刪除這些邊會導致模型失效)。
複雜行為與變數綁定
對於更複雜的任務,例如變數綁定,電路較難完全解釋。然而,研究人員仍能夠獲得能夠預測模型行為的部分解釋。例如,在變數綁定中,一個注意力操作在定義過程中將變數名稱複製到 set() 標記,而後續的操作則從 set() 標記複製類型到變數的後續使用。
未來方向與可擴展性
雖然這些稀疏模型相比前沿模型顯著較小,但 OpenAI 指出有兩條主要途徑可以擴展這些發現:
- 擷取: 從現有的密集模型中提取稀疏電路,這些電路在部署時更高效。
- 訓練效率: 開發更高效的技術來專門為可解釋性訓練模型,使其適合生產環境。
OpenAI 指出,雖然這些結果對於簡單行為很有希望,但並不能保證該方法會適用於最強大的系統;然而,目標是構建工具,使未來的 AI 系統更易於分析、除錯和評估。