OpenAI 推出 ChatGPT
OpenAI 推出 ChatGPT,一款設計用於對話式互動的會話式 AI 模型。此格式使模型能夠回答後續問題、承認錯誤、挑戰不正確的前提,並拒絕不適當的請求。
技術方法論:RLHF 與 GPT-3.5
ChatGPT 是 GPT-3.5 系列模型的微調版本,該模型於 2022 年初完成訓練。模型使用 Azure AI 超級運算基礎設施開發,並透過來自人類回饋的強化學習(RLHF)進行訓練。
訓練過程包含了幾個關鍵階段:
- 監督式微調:人類 AI 訓練師提供了對話,扮演使用者與 AI 助手兩個角色。這些訓練師使用模型生成的建議來協助撰寫回應。此對話資料集隨後與 InstructGPT 資料集混合,後者已轉換為對話格式。
- 獎勵模型建立:為了促進強化學習,OpenAI 透過讓 AI 訓練師對對話中隨機選取訊息的多個模型生成完成度進行排名,收集比較資料。
- 近端策略最佳化(PPO):利用獎勵模型,模型在多次迭代中使用 PPO 進一步微調。
主要能力與對話格式
與先前的模型不同,ChatGPT 的對話格式能夠實現更自然且迭代的互動。例如,當遇到程式碼錯誤時,模型可以要求更多上下文,或根據使用者後續的說明提出可能的修正建議。
此外,模型展現了更佳的處理不正確前提的能力。在與 InstructGPT 的比較中,當被問及克里斯托弗·哥倫布於 2015 年抵達美國時,InstructGPT 給出了事實上不正確的回應。而 ChatGPT 則識別出此歷史錯誤,挑戰該前提,同時仍以假設情境回應提示。
已知限制
OpenAI 在目前版本的 ChatGPT 中指出了幾項關鍵限制:
- 事實性:模型有時會產生「聽起來合理卻不正確或荒謬的答案」。這歸因於 RL 訓練期間缺乏真實來源、模型過於謹慎而拒絕正確答案的風險,以及監督式訓練可能因人類示範者的知識而誤導模型,而非模型自身的知識。
- 敏感度:模型對輸入的措辭很敏感,若稍作改寫,同一提示可能得到不同的答案。
- 冗長:由於訓練資料的偏見(訓練師偏好較長、看似完整的答案)以及過度最佳化,模型常常過於冗長,且過度使用特定語句。
- 模糊性:對於含糊的查詢,模型通常會直接猜測使用者意圖,而不是提出澄清問題。
- 安全性:儘管已努力拒絕不當請求,模型仍可能回應有害指示或展現偏見行為。OpenAI 使用 Moderation API 來阻止或警告不安全內容,然而仍會出現誤判(偽陽性與偽陰性)。
迭代部署與回饋
ChatGPT 以研究預覽的形式發布,以收集使用者回饋並了解模型的優缺點。此發布遵循 OpenAI 的迭代部署策略,利用 GPT-3 與 Codex 的經驗,透過 RLHF 減少有害與不實的輸出。
OpenAI 正積極徵求對問題輸出的回饋,特別是關於真實世界非對抗情境下的有害輸出,以及新興風險與可能的緩解措施。為鼓勵此行為,他們推出了 ChatGPT 回饋競賽,為發現關鍵問題的使用者提供 API 點數。
Sources
- OriginalIntroducing ChatGPT