OpenAI GPT-4 公告與功能概述

OpenAI GPT-4 公告與功能概述

OpenAI 宣佈了 GPT-4,一個大型多模態模型,在許多專業基準上達到人類水平的表現,且現在可透過 ChatGPT、API 等候名單以及開源評估工具取得。

OpenAI GPT-4 公告與功能概述

TL;DR

OpenAI 發布了 GPT‑4,一個多模態(文字與影像)大型語言模型,在模擬律師考試中取得前 10% 的分數,並在廣泛的專業與學術基準上展現人類水平的表現;該模型正透過 ChatGPT、受限的 API 以及開源評估框架逐步推出。

核心技術進展

可預測的擴展與穩定訓練

  • 在過去兩年中,OpenAI 重建了其深度學習堆疊,並與 Azure 共同設計了一台專門用於其工作負載的超級電腦。
  • GPT‑3.5 作為測試運行;在訓練 GPT‑4 之前,已修復錯誤並改進理論基礎。
  • GPT‑4 的訓練過程異常穩定,使 OpenAI 能夠精確預測最終損失,甚至從使用 1,000‑10,000 倍較少計算資源的運行中推算下游任務的通過率。
  • 可預測的擴展被視為安全措施,使組織能預見未來模型的能力。

多模態輸入能力

  • GPT‑4 接受交錯的文字與影像輸入,並為視覺語言任務產生文字輸出(包括程式碼)。
  • 在標準學術視覺基準上的表現強勁,儘管影像模態仍屬於研究預覽,尚未公開提供。
  • 測試時技術,如 few‑shot 提示與 chain‑of‑thought 推理,最初為純文字模型開發,也能提升影像輸入任務的表現。

對齊與可操控性改進

  • 透過對抗測試與 ChatGPT 經驗的六個月迭代對齊,產生了 OpenAI 模型史上最佳的事實性、可操控性與安全欄位遵循。
  • 系統訊息允許開發者(以及即將的 ChatGPT 使用者)指定語氣、詳盡程度與風格,提供在政策範圍內可自訂的行為。
  • OpenAI 承認系統訊息目前是最容易的越獄向量,並鼓勵使用者回饋以加強這些控制。

基準表現

人類水平的考試結果

  • GPT‑4 在模擬律師考試中取得前 10% 的成績,對比 GPT‑3.5 的後 10% 名次。
  • 未進行特定任務的訓練;模型在公開可取得的考試與近期練習測驗上進行評估。

標準語言模型基準

  • GPT‑4 在傳統機器學習基準上超越現有大型語言模型與大多數最先進(SOTA)系統。
  • 在 MMLU 套件(涵蓋 57 個科目、14,000 題多項選擇題)中,GPT‑4 在 26 種測試語言的 24 種上超過 GPT‑3.5 及其他 LLM(Chinchilla、PaLM),包括拉脫維亞語、威爾斯語與斯瓦希里語等低資源語言。

事實性與安全指標

  • 內部對抗事實性評估顯示相較於 GPT‑3.5,幻覺減少了 40%。
  • 經過 RLHF 後訓練,GPT‑4 在 TruthfulQA 上相較於 GPT‑3.5 展現出顯著差距,能抵抗常見誤解,儘管仍偶爾遺漏細微細節。

限制

  • GPT‑4 仍會產生事實幻覺並犯下推理錯誤;在許多現實情境中,它的可靠性不及人類。
  • 知識截至 2021 年 9 月左右;模型不會從新經驗中學習。
  • 雖然基礎模型校準良好,但在 RLHF 後信心分數的校準會下降。
  • 輸出中仍存在偏見,且模型可能被透過越獄技術誘導執行不允許的行為。

安全風險與緩解措施

  • 風險與先前模型相似(有害建議、錯誤程式碼、錯誤資訊),但因能力提升而被放大。
  • 超過 50 位來自 AI 對齊、網路安全、生物風險與國際安全領域的外部專家進行了對抗測試,提供資料收集以改善對危險請求的拒絕行為。
  • 在 RLHF 期間加入額外的安全獎勵訊號,訓練 GPT‑4 零樣本分類器以懲罰不允許的內容;相較於 GPT‑3.5,對禁止請求的回應減少了 82%,對敏感議題的合規性提升了 29%。
  • OpenAI 繼續依賴部署時的安全措施(監控、濫用偵測)以及模型層面的介入。

部署細節

ChatGPT Plus

  • GPT‑4 可供 ChatGPT Plus 訂閱者於 chatgpt.com 使用,並設有使用上限,將依需求與系統效能調整。

API 存取

  • 文字版 GPT‑4 透過標準的 ChatCompletions API 提供存取;開發者必須加入等候名單。
  • 價格:8,192 令牌上下文模型每 1k 提示令牌 $0.03、每 1k 完成令牌 $0.06;32,768 令牌上下文變體(gpt‑4‑32k)則為 $0.06/$0.12。
  • 預設速率限制為每分鐘 40k 令牌與 200 次請求。
  • 研究人員可透過 Researcher Access Program 申請補助存取。

OpenAI Evals 框架

  • OpenAI 發布了開源 OpenAI Evals 框架,用於建立與執行自動化基準測試。
  • Evals 於內部用於識別缺陷與防止退化;外部使用者(例如 Stripe)亦利用它評估 GPT 驅動的工具。
  • 該儲存庫包含常見評估模式的範本,包括 GPT‑4 評估自身輸出的模型分級評估。
  • 鼓勵社群貢獻,以擴大框架所捕捉的失效模式與困難任務集合。

影響與展望

  • GPT‑4 的多模態能力與改進的對齊標誌著朝向更有用且更安全的 AI 助手邁出重要一步。
  • 可預測的擴展與早期以安全為焦點的訓練旨在提供對未來模型能力的更好預見,OpenAI 主張此做法對社會安全至關重要。
  • 持續的限制——幻覺、偏見、過時知識——凸顯了人類監督的必要性,尤其在高風險應用中。
  • 開源的 Evals 生態系統與協作式安全測試顯示出向更廣泛社群參與 AI 評估與風險緩解的轉變。

本文忠實呈現 OpenAI 2023 年 3 月的 GPT‑4 公告,未添加或更改任何事實內容。

Sources