Anthropic 研究:大型生成式模型中的可预测性与意外性
Anthropic 研究表明,大型生成式模型——例如 GPT-3、Megatron-Turing NLG 和 Gopher——在广泛的训练分布上表现出可预测的损失(loss),但在特定的能力、输入和输出方面表现出不可预测性,这种组合是违反直觉的。
Scaling Laws 与涌现能力之间的张力
大规模预训练允许开发者根据 scaling laws 预测模型性能(loss)。虽然 loss 的高层级可预测性推动了这些模型的快速发展,但它并不能转化为特定行为的可预测性。
模型开发者可以预见模型在总体层面上会提高多少,但他们无法轻易预测哪些特定能力会涌现,或者模型会对特定输入做出何种反应。这种通用性能趋势与特定行为不可预测性之间的差距,使得预测部署此类模型的后果变得困难。
风险与政策影响
大型生成式模型的不可预测性为 AI 安全和政策带来了重大挑战。由于特定的能力和输出是不可预测的,模型可能会表现出在部署前难以检测到的社会有害行为。
Anthropic 指出,这些相互冲突的属性——可预测的扩展性(scaling)但不可预测的行为——影响了开发者部署模型的动机,以及阻碍安全部署的挑战。研究强调,输出的不可预测性使得确保模型对所有用户都有益且安全变得困难。
为 AI 安全提出的干预措施
为了减轻与不可预测的涌现能力相关的风险,Anthropic 建议 AI 社区必须实施干预措施,以增加大型生成式模型产生有益影响的可能性。该研究旨在为政策制定者、技术专家和通用学术界提供资源,以便更有效地理解和监管 AI 系统。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch