Anthropic 研究:语言模型(大部分情况下)知道自己知道什么
Anthropic 的研究表明,大型语言模型 (LLM) 可以评估其自身主张的有效性,并预测其是否可能正确回答问题。这种能力允许模型表达不确定性并识别其自身知识中的空白,这是开发更诚实、更可靠的 AI 系统迈出的关键一步。
在多选题和判断题上的模型校准
当以正确的格式提供时,大型语言模型在各种多选题和判断题上都表现出良好的校准度。这种校准意味着模型预测的正确概率与其实际回答的准确率高度一致。随着模型规模的增加,这种校准度会提高,显示出一种规模效应,即更大的模型能更好地估计自身的准确率。
对开放式采样任务的自我评估
对于开放式任务,Anthropic 研究人员通过让模型先提出一个答案,然后评估该答案正确的概率(记作 "P(True)")来进行自我评估。
关键发现包括:
- 性能与规模效应: 在各种任务中,P(True) 的性能、校准度和规模效应都表现出令人鼓舞的结果。
- 样本考虑: 当允许模型在预测特定答案的有效性之前考虑其自身生成的多个答案样本时,自我评估的准确率会提高。
预测知识概率 (P(IK))
研究人员调查了是否可以训练模型来预测 "P(IK)",即在不参考特定提议答案的情况下,预测“我知道”该问题答案的概率。
关于 P(IK) 预测的发现包括:
- 泛化能力: 模型在预测 P(IK) 时表现良好,并在不同任务之间表现出部分泛化能力。
- 校准挑战: 当遇到全新的任务时,模型在 P(IK) 的校准方面会遇到困难。
- 上下文影响: 当在上下文中提供相关的源材料,或者在数学应用题中提供提示时,预测的 P(IK) 概率会增加。
对 AI 诚实性的启示
这些观察结果表明,LLM 拥有对其自身知识状态的内部表示。通过利用这些概率——P(True) 和 P(IK)—模型可以被训练得对自己的无知更加诚实,从而减少幻觉并提高整个系统的可靠性。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch