Anthropic 研究:重复数据的缩放定律与可解释性
Anthropic 研究表明,重复训练数据中的一小部分会导致大语言模型 (LLM) 的性能出现不成比例的剧烈下降,这主要是因为模型从泛化转向了记忆。当可预测的重复频率范围导致模型消耗大量容量来记忆重复的数据时,这种效应最为严重,从而有效地降低了模型的有效容量。
性能下降与双下降现象
在重复数据上训练 LLM 会导致训练中途测试损失显著增加,这种现象被称为双下降 (double descent)。这种性能下降并非线性的;在特定的重复频率范围内,性能受损最为严重。
例如,如果仅 0.1% 的训练数据被重复 100 次,即使其余 90% 的训练 token 保持唯一,一个 800M 参数的模型其性能也可能下降到 400M 参数模型的水平。这表明,重复相对较少的数据量可能会对模型的整体能力产生巨大的负面影响。
记忆与泛化的机制
Anthropic 研究人员假设,性能下降的峰值出现在模型进入一个能够成功记忆重复数据的范围时。当模型分配大量容量来存储这些记忆序列时,它就会失去在数据集其余部分进行泛化的能力。
这种从泛化到记忆的转变与模型执行的详细计算有关。该研究将这些观察结果与机械可解释性 (mechanistic interpretability) 联系起来,表明数据重复会不成比例地破坏与泛化相关的内部结构,特别是 copying heads 和 induction heads。
对数据去重的启示
研究结果表明,数据去重对于 LLM 训练至关重要。无论是出于有意为之(为了增加高质量数据的权重)还是无意之举(由于在句子、段落或文档层面的去重不完善),记忆超过泛化的风险对模型性能而言始终是一个高风险。该研究为模型容量被记忆消耗并破坏模型通用智能所需的内部结构提供了一个机械论解释。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch