GPT-2 六個月後續追蹤
OpenAI 已發布了擁有 7.74 億參數的 GPT-2 版本,這是繼 2019 年 2 月發布 124M 模型和 2019 年 5 月發布 355M 模型之後的分階段發布流程。此次發布是更廣泛努力的一部分,旨在平衡開放研究的益處與誤用風險,例如生成具有說服力的合成虛假訊息。
模型發布與誤用的關鍵教訓
OpenAI 在 GPT-2 方面的經驗凸顯了部署大規模生成式模型時的三個主要挑戰:
1. 協調的困難性
雖然多家機構都有能力訓練擁有 15 億個參數或更多的模型,但此類模型的公開發布一直受到限制。OpenAI 指出,由於這些系統的專有性質以及缺乏明確的機構間溝通管道,各機構之間在發布規範方面的協調非常困難。
2. 人類對合成文本的易感性
合成文本欺騙人類的能力日益增強。康乃爾大學(Cornell University)的研究顯示,在測試組中,有 72% 的受試者認為 GPT-2 合成文本樣本是可信的,而對於真實的《紐約時報》文章,這一比例為 83%。此外,艾倫人工智慧研究所(Allen Institute for AI, AI2)和華盛頓大學(University of Washington)的研究發現,「GROVER」系統產生的新聞比人類撰寫的宣傳內容更具說服力。
3. 文本檢測的複雜性
檢測 AI 生成的文本是一項重大的技術挑戰。為了在現實場景中發揮作用,檢測器必須達到 99.9% 至 99.99% 的準確率,且極少出現誤報。目前的 ML 方法通常只能達到 90% 出頭或中段的準確率,且當模型經過微調後,這種準確率會進一步下降。OpenAI 得出結論,統計檢測必須輔以人類判斷和元數據(metadata)才能有效打擊誤用。
研究合作夥伴關係與安全分析
為了為可能發布的 1558M 參數完整版模型提供資訊,OpenAI 與四個研究機構合作分析了 774M 和 1558M 模型:
- Cornell University: 研究人類對數位虛假訊息的易感性。
- The Middlebury Institute of International Studies (CTEC): 探索恐怖分子和極端主義者可能進行的誤用。
- The University of Oregon: 開發「偏見探針」(bias probes)以分析模型的內部偏見。
- The University of Texas at Austin: 研究在特定領域微調後輸出的統計可檢測性,以及跨模型的檢測遷移。
未來發布策略
OpenAI 目前的計劃是在幾個月內發布 1558M 參數模型,但此時間表仍取決於研究合作夥伴的發現以及對 774M 模型使用情況的觀察。OpenAI 主張將分階段發布與基於合作夥伴關係的模型共享相結合,作為負責任 AI 發布的基礎,特別是隨著強大的生成式模型所固有的挑戰預計會隨著時間增加。
Sources
- OriginalGPT-2: 6-month follow-up