Anthropic 研究:使用影響函數將模型輸出追溯至訓練數據
Anthropic 開發了一種方法,將影響函數擴展到擁有高達 520 億個參數的大型語言模型 (LLMs),讓研究人員能夠將特定的模型輸出追溯到最具影響力的訓練範例。
這項研究顯示,隨著模型規模的擴大,模型會從依賴表層的 token 重疊,轉向透過抽象的、主題性的概念進行泛化。
Scaling Influence Functions to Large Models
影響函數是一種統計技術,透過將訓練範例視為一種反事實 (counterfactual) 來確定哪些訓練範例對模型的輸出貢獻最顯著:計算如果將特定的訓練範例加入數據集中,模型的參數和輸出會如何變化。
從歷史上看,這個過程對於大型模型來說在計算上是極其昂貴的,因為它需要為所有候選訓練範例計算逆 Hessian 向量積 (inverse-Hessian-vector products) 和梯度 (gradients)。Anthropic 的研究(詳見論文 "Studying Large Language Model Generalization with Influence Functions")引入了高效的演算法,使得這種分析能夠在 8.1 億到 520 億參數的模型上進行。
The Relationship Between Model Scale and Generalization
研究結果顯示,隨著模型規模的增加,泛化的模式會變得更加抽象。這種轉變可以從不同規模的模型如何識別具影響力的訓練序列來得到證實:
- Small Models (例如 810M 參數): 有影響力的序列通常共享重疊的 tokens 或特定的單字(例如 "continue existing" 或單字 "clip"),但在語義上與輸出無關。
- Large Models (例如 52B 參數): 有影響力的序列在概念上與輸出更相關。例如,當模型表達出不想被關閉的願望時,52B 模型的影響力序列涉及生存本能和 AI 中的類人情感等主題,而非僅僅是匹配關鍵字。
這種趨勢在數學應用題的思維鏈 (chain-of-thought) 推理中也清晰可見,在這種情況下,較大的模型依賴於解釋相似推理過程的訓練範例,而非僅僅是共享表層詞彙的範例。
Cross-Lingual Influence and Generalization
模型規模也會影響影響力如何在不同語言之間轉移。當將查詢 (例如抗拒關閉的範例) 翻譯成韓文和土耳其文時,研究人員發現,隨著模型規模的增加,英文訓練序列對翻譯後查詢的影響力變得顯著增強。這表明較大的模型對資訊的內容發展出了更具語言無關性 (language-agnostic) 的概念性理解。
Memorization vs. Generalization
對影響力模式的分析顯示,LLM 的輸出並非純粹的 token 層級的記憶。
研究人員發現:
- Distribution: 影響力通常遵循冪律分佈 (power law distribution),這意味著一小部分訓練數據提供了大部分的影響力。
- Diffusion: 儘管存在冪律,影響力仍然是擴散的。任何單一訓練序列的影響力都小於典型句子的資訊量,這表明模型並非只是在背誦個別的訓練範例。
Localizing Influence within the Network
對影響力在神經網路架構中的分佈情況進行定位。雖然影響力在各層之間平均而言是近似均勻分佈的,但特定的查詢往往會顯示出局部化特徵:
- Bottom and Top Layers: 這些層往往會捕捉詳細的措辭和特定的 token 資訊。
- Middle Layers: 這些層通常在更抽象、主題性的層級處理泛化。
Implications for AI Alignment and Interpretability
這種由上而下的可解釋性方法與由下而上的機制可解釋性 (mechanistic interpretability,即研究個別單元和電路) 相輔成效。透過從可觀察的行為開始,並深入挖掘到負責的神經元和電路,研究人員可以研究僅在規模擴大時才會出現的高層次認知現象,例如推理和角色扮演。Anthropic 意圖將這項工作擴展到微調 (fine-tuning),這對於理解監督式學習和強化學習目標如何影響模型對齊齊 (alignment) 和行為至關重要。
SUMMARY: Anthropic 研究人員將影響函數擴展到高達 520 億參數的 LLMs,發現隨著模型規模增加,模型的泛化變得更加抽象且由概念驅動。
TITLE: Anthropic 研究:使用影響函數將模型輸出追溯至訓練數據**
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch