使用影響函數研究大型語言模型泛化能力
Anthropic 開發了一種方法,透過使用 Eigenvalue-corrected Kronecker-Factored Approximate Curvature (EK-FAC) 近似法,將影響函數擴展到大型語言模型 (LLMs)。這讓研究人員能夠識別哪些特定的訓練範例對給定的模型行為貢獻最大,從而提供一種反事實理解,即如果將特定的序列添加到訓練集中,模型參數和輸出將會如何變化。
使用 EK-FAC 擴展影響函數
為 LLMs 計算影響函數傳統上很困難,因為它需要計算逆 Hessian 向量積 (IHVP)。EK-FAC 近似法允許此計算比傳統影響函數估計器快好幾個數量級,同時保持與傳統估計器相似的準確度。這種方法能夠分析參數高達 52 billion 的模型。
為了進一步降低計算候選訓練序列梯度時的成本,Anthropic 採用了兩種特定的演算法技術:
- TF-IDF filtering: 用於縮小待分析的候選訓練序列範圍。
- Query batching: 用於優化同時處理多個查詢的過程。
調查 LLM 泛化模式
使用這些擴展後的影響函數,Anthropic 調查了 LLM 泛化的幾個關鍵領域,包括:
- Sparsity of influence patterns: 分析少數訓練範例如何驅動特定輸出。
- Abstraction with scale: 觀察隨著模型規模增長,模型抽象資訊的能力如何提升。
- Math and programming abilities: 確定模型執行數學推理和編碼任務的能力來源。
- Cross-lingual generalization: 理解在某種語言上進行訓練如何影響在其他語言上的表現。
- Role-playing behavior: 識別觸發特定人格採用的訓練數據。
泛化中的局限性
儘管模型展現了複雜形式的泛化,但研究指出了一個關鍵的局限性:當提示詞 (prompt) 中關鍵短語的順序被翻轉時,影響函數會衰減至接近於零。這表明模型對泛化模式的理解對訓練數據中提供的資訊序列高度敏感。
對模型安全與風險緩解的意義
影響函數為研究社群提供了一個強大的工具,以理解模型的內部邏輯,並對 LLM 的訓練過程獲得更好的可視化。透過識別對特定行為影響最大的訓練範例,開發人員可以更好地理解並緩解與模型輸出相關的風險。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch