OpenAI 研究:教模型用文字表达不确定性

OpenAI 已经证明,GPT-3 模型可以学习使用自然语言表达对答案的不确定性,生成“口头化概率”,这些概率具有良好的校准性。这一能力使模型能够直接在文本中传达其置信水平(例如,“90% 置信度”或“高度置信”),提供一种人类可读的可靠性度量,而无需访问模型的内部 logits。

口头化概率与校准

GPT-3 能够在自然语言中生成事实答案以及相应的置信水平。这些口头化的置信水平映射到实际的、校准良好的概率,这意味着模型表达的置信度准确反映答案正确的可能性。这是首次有模型被展示能够用自然语言表达对自身答案的校准不确定性。

分布迁移下的性能

即使在分布迁移的情况下,模型仍保持适度的校准。研究表明,模型对自身答案的真实不确定性更为敏感,而不是仅仅模仿训练数据中的人类示例。这表明模型正在利用内部知识来评估自身的准确性。

与模型 logits 的比较

为了评估这些发现,OpenAI 引入了 CalibratedMath 任务套件。研究人员将“口头化概率”(用文字表达的不确定性)与从模型 logits 中提取的不确定性进行比较。结果显示,两种方法都能够在分布迁移下实现校准的泛化。

预训练潜在表征的作用

证据表明,GPT-3 泛化校准的能力与其预训练的潜在表征有关。这些表征与认知不确定性(即因知识缺乏而产生的不确定性)在模型答案上呈相关性,使模型能够将内部不确定性转化为自然语言表达。

Sources