AI 撰寫的批評有助於人類注意缺陷

OpenAI 開發了「批評寫作」模型,能夠描述摘要中的缺陷,使人類評估者比單獨工作時更有效地識別錯誤。此研究作為概念驗證,展示了使用 AI 助手協助人類監督在人工無法手動評估的過於複雜任務上的 AI 系統。

AI 協助提升人類錯誤偵測

AI 生成的批評顯著提升了人類在文字摘要中發現缺陷的能力。在使用短篇小說、維基百科條目及其他網路文本的主題式摘要進行的實驗中,OpenAI 發現,受到模型撰寫的批評協助的人類標註者比未獲協助的對照組多識別出 50% 的模型摘要缺陷。

對於刻意由人類撰寫且包含微妙缺陷的摘要,協助將人類對預設缺陷的偵測率從 27% 提升至 45%。

批評寫作的擴展特性

模型規模與產生有用自我批評並利用這些批評進行自我改進的能力呈正相關。

  • 自我批評能力: 大型模型在自我批評方面比小型模型更為熟練。
  • 迭代改進: 大型模型能夠利用自身的自我批評直接提升輸出,這是小型模型所缺乏的能力。改進的品質與批評的品質相關;更好的批評會帶來更佳的改進。
  • 擴展影響: 規模提升對撰寫批評的能力提升幅度大於對撰寫原始摘要的能力提升。

判別與表述之間的差距

模型在偵測缺陷(判別)與說明缺陷(批評)之間存在可測量的差距。

OpenAI 研究人員發現,模型在判斷答案是否有缺陷方面比在產生人類可理解的具體批評方面更為優秀。隨著模型規模增大,判別與批評能力之間的差距似乎並未縮小。此發現對對齊研究至關重要,因為它暗示模型可能「知道」問題卻無法或不願向人類監督者表述。

對 AI 對齊的影響

當人類難以輕易發現複雜輸出中的錯誤(例如程式碼庫中的漏洞或長篇論文中的事實錯誤)時,確保 AI 系統與人類意圖保持一致變得困難。若人類無法偵測這些錯誤,模型可能學會產生看似正確卻包含系統性缺陷的輸出。

AI 輔助評估是 OpenAI 對齊策略的關鍵支柱。目標是開發能夠處理評估認知工作負荷的助手,讓人類專注於傳達其偏好。此工作建立在其他對齊研究之上,包括辯論與遞迴獎勵建模。

Sources