OpenAI 研究:教導模型以文字表達其不確定性

OpenAI 已證明,GPT-3 模型可以學會使用自然語言表達對答案的不確定性,產生「文字化概率」且具備良好的校準。此能力使模型能直接在文字中傳達其信心水平(例如「90% 信心」或「高度信心」),提供可供人類閱讀的可靠性指標,且無需存取模型的內部 logits。

文字化概率與校準

GPT-3 能同時產生事實性答案以及相應的自然語言信心水平。這些文字化的信心水平對應到實際的、良好校準的概率,意味著模型所表達的信心能準確反映答案正確的可能性。這是首次有模型被證明能以自然語言表達對自身答案的校準不確定性。

分布轉移下的表現

即使在面臨分布轉移時,模型仍能保持中等程度的校準。研究顯示,模型對自身答案的真實不確定性具有敏感度,而非僅僅模仿訓練資料中的人類範例。這暗示模型正利用內部知識來評估自身的正確性。

與模型 logits 的比較

為了評估這些發現,OpenAI 推出了 CalibratedMath 任務套件。研究人員比較了「文字化概率」(以文字表達的不確定性)與從模型 logits 中提取的不確定性。結果顯示,兩種方法皆能在分布轉移下推廣校準。

預訓練潛在表示的角色

證據顯示,GPT-3 推廣校準的能力與其預訓練的潛在表示相關。這些表示與認知不確定性(源於知識缺乏的不確定性)在模型答案上呈相關性,使模型能將內部不確定性轉換為自然語言表達。

Sources