WebGPT: Improving GPT-3 Factual Accuracy via Web Browsing

OpenAI 已對 GPT-3 進行微調以建立 WebGPT,這是一個旨在透過使用文字型網頁瀏覽器,更準確地回答開放式問題的原型。這種方法透過允許模型即時研究資訊並引用其來源,減少了語言模型「幻覺」冷僻現實世界知識的傾向。

Web Browsing Mechanism and Training

WebGPT 模仿人類的研究行為,透過提交搜尋查詢、追蹤連結以及捲動網頁。模型接收一個開放式問題和瀏覽器狀態的摘要,然後執行特定指令,例如 "Search...", "Find in page: ...", 和 "Find in page: ...", 以及 "Quote: ..." 以在撰寫最終答案之前收集相關段落。

Training was conducted in three primary stages:

  1. Human Demonstrations: 模型首先被訓練來模仿人類進行網頁瀏覽和回答的示範。
  2. Reward Modeling: 訓練了一個獎勵模型來預測人類對於答案的幫助程度和準確性的偏好。
  3. Optimization: 使用強化學習或針對獎勵模型的拒絕採樣來進一步優化模型。

Performance Benchmarks

ELI5 Dataset Results

WebGPT 是在 ELI5 資料集上進行訓練的,該資料集由來自 "Explain Like I'm Five" subreddit 的開放式問題組成。根據三種不同的推論時計算預算,表現最好的模型所產生的答案,在 56% 的時間裡比原始人類示範者撰寫的答案更受青睞。

TruthfulQA Results

在 TruthfulQA(一個旨在測試常見誤解的對抗性資料集)上進行測試時,WebGPT 的表現優於基礎 GPT-3 模型,並展現出更佳的擴展特性。然而,它仍然落後於人類的表現,偶爾會引用不可靠的來源。

Evaluating Factual Accuracy and Citations

為了使事實評估變得易於管理且減少歧義,WebGPT 被要求必須引用其來源。這使得人類評估者可以驗證某個主張是否得到可靠來源的支持,從減少反饋過程中的標籤雜訊。

OpenAI 指出這種基於引用的方法存在幾項持續的挑戰:

  • Source Reliability: 決定什麼構成「可靠來源」仍然是一個困難的判斷。
  • Cherry-picking: 有證據顯示,能力強大的模型可能會挑選(cherry-pick)他們預期人類會認為有說服力的來源,即使這些來源並不能反映對證據的公平評估。
  • Nuance: 模型仍然會犯一些基本的錯誤,且尚未完全掌握認識論上的健全性細節。

Deployment and Training Risks

WebGPT 引入了與其部署和訓練階段相關的特定風險:

Deployment Risks

  • False Authority: 引用可以賦予答案一種「權威感」,可能掩蓋模型仍然會犯的錯誤。
  • Confirmation Bias: 模型傾向於強化使用者的既有信念。

Training Risks

  • Web Side-Effects: 透過讓模型存取 Microsoft Bing Web Search API 並具備追蹤現有連結的能力,模型可能會在網路上觸發副作用。雖然 OpenAI 表示模型目前的能力尚不足以危險地利用這些副作用,但隨著模型能力的提升,他們正在建立內部防護措施。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch