使用 GPT-4 找出 GPT-4 的錯誤

OpenAI 開發了 CriticGPT,一個基於 GPT-4 的專門模型,用於識別 ChatGPT 程式碼輸出中的不準確之處。此工具旨在協助人類 AI 訓練師在「從人類回饋的強化學習」(RLHF) 期間,發現那些隨著模型變得更先進而對人類而言難以偵測的細微錯誤。

透過 AI 輔助審查提升 RLHF

CriticGPT 解決了 RLHF 的一項根本限制:隨著 AI 模型變得更有知識且錯誤更為細微,人類訓練師要準確評分回應變得越來越困難。人類在提供高品質回饋方面的能力缺口可能會阻礙先進 AI 系統的對齊。

透過將 CriticGPT 整合進標記流程,OpenAI 為訓練師提供了明確的 AI 協助。在實驗環境中,得到 CriticGPT 協助的人類訓練師的表現比未受協助的訓練師高出 60%。人類監督與 AI 批評的結合產生的回饋,比僅有人類的審查更為完整,且比僅有模型的審查包含更少的幻覺式錯誤。

訓練方法與效能

CriticGPT 是使用 RLHF 訓練的,類似於 ChatGPT,但特別聚焦於錯誤偵測。訓練過程包括:

  • 手動錯誤插入: AI 訓練師手動在 ChatGPT 產生的程式碼中插入錯誤。
  • 範例回饋: 訓練師撰寫範例批評,彷彿他們發現了插入的錯誤。
  • 比較評分: 訓練師比較多個批評,以辨識哪些成功捕捉到插入的錯誤。

在涉及「自然發生」的 ChatGPT 錯誤的測試中,訓練師在 63% 的情況下偏好 CriticGPT 的批評而非標準的 ChatGPT 批評。此偏好歸因於 CriticGPT 產生較少的「挑剔」(無益的微小抱怨)以及較少的幻覺。

為了進一步提升品質,OpenAI 使用了額外的測試時搜尋,針對批評獎勵模型進行。這使得可以配置精確度與召回率的權衡,平衡錯誤偵測的積極性與幻覺風險,以產生對 RLHF 最有幫助的批評。

目前的限制

儘管效果顯著,CriticGPT 仍存在多項技術限制:

  • 輸入長度: 該模型在相對較短的 ChatGPT 回答上進行訓練;未來監督代理人將需要能處理長且複雜任務的方法。
  • CURLOPT 幻覺: 模型仍會產生幻覺,這有時會導致人類訓練師標記錯誤。
  • 錯誤分佈: 目前的重點是可在單一位置識別的錯誤,而現實世界的錯誤往往散布於回應的多個部分。
  • 複雜度上限: 對於極度複雜的任務,專業人類與 AI 助手皆可能無法正確評估回應。

未來對 AI 對齊的影響

OpenAI 計畫在其 RLHF 流程中擴大使用類似 CriticGPT 的模型。研究顯示,將 RLHF 應用於 GPT-4 能協助人類產生更高品質的 GPT-4 RLHF 資料,形成一個改進循環,對於對齊日益複雜的 AI 系統至關重要。

Sources