Anthropic 研究:從重複數據中學習的縮放定律與可解釋性

Anthropic 研究顯示,重複一小部分訓練數據可能會導致大型語言模型 (LLM) 的性能不成比例地大幅下降,這主要是因為模型從泛化轉向了記憶。當可預測的重複頻率範圍導致模型消耗大量容量來記憶重複的數據時,這種效應最為嚴重,這實際上減少了模型的有效功能容量。

性能下降與雙下降現象

在重複數據上訓練 LLM 可能會導致訓練中途測試損失顯著增加,這種現象被稱為雙下降 (double descent)。這種性能下降並非線性;在特定的重複頻率範圍內,性能受到的影響最為嚴重。

例如,如果僅 0.1% 的訓練數據重複了 100 次,即使其餘 90% 的訓練 token 保持唯一,一個 800M 參數的模型其性能也可能下降到 400M 參數模型的水平。這表明,重複相對少量的數據可能會對模型的整體能力產生巨大的負面影響。

記憶與泛化的機制

Anthropic 研究人員假設,性能下降的峰值發生在模型進入一個可以成功記憶重複數據的範圍時。當模型分配大量容量來存儲這些記憶序列時,它就會失去在數據集其餘部分進行泛化的能力。

這種從泛化到記憶的轉變與模型執行的詳細計算有關。該研究將這些觀察結果與機械可解釋性 (mechanistic interpretability) 联系起來,顯示數據重複會不成比例地損害與泛化相關的內部結構,特別是 copying heads 和 induction heads。

對數據去重 (Deduplication) 的啟示

研究結果表明,數據去重對於 LLM 訓練至關重要。無論是刻意重複數據(為了增加高品質數據的權重)還是無意中重複(由於句子、段落或文件層級的去重不完全),記憶優於泛化的風險對模型性能而言仍然是高風險。該研究為為什麼模型的容量會被記憶所消耗,進而損害模型通用智能所需的內部結構提供了一個機械性的解釋。

Sources

相關