OpenAI GPT-2 發布與影響
OpenAI 已開發出 GPT-2,一個大規模的無監督語言模型,能生成連貫的段落文字,並在多項語言模型基準測試中達到最先進的表現。該模型展示了在未經特定任務訓練的情況下,執行基礎閱讀理解、機器翻譯、問答與摘要的能力。
技術架構與訓練
GPT-2 是原始 GPT 模型的直接擴大版,參數量與資料量皆超過原模型 10 倍以上。
- 模型規模: 完整模型包含 15 億參數。
- 訓練目標: 模型僅透過預測文本中前所有單詞之後的下一個單詞進行訓練。
- 訓練資料: GPT-2 使用包含 800 萬個網頁(約 40GB 網路文本)的資料集進行訓練,該資料集透過 Reddit 的外部連結收集,且僅保留至少獲得 3 點 karma 的連結,以確保多樣性與品質。
- 架構: 基於 Transformer 架構。
零樣本能力與效能
GPT-2 在「零樣本」設定下於多種領域特定語言模型任務中取得最先進的分數,意即它未在任何特定任務資料上訓練,僅作為最終測試評估。
語言模型基準測試
GPT-2 在以下基準測試中超越了以領域特定資料集(如 Wikipedia、新聞或書籍)訓練的模型:
| 資料集 | 評量指標 | GPT-2 結果 | 先前紀錄 | 人類 |
|---|---|---|---|---|
| Winograd Schema Challenge | 準確率 (+) | 70.70% | 63.7% | 92%+ |
| LAMBADA | 準確率 (+) | 63.24% | 59.23% | 95%+ |
| Children’s Book Test (Common Nouns) | 準確率 (+) | 93.30% | 85.7% | 96% |
| Children’s Book Test (Named Entities) | 準確率 (+) | 89.05% | 82.3% | 92% |
| Penn Tree Bank | 困惑度 (–) | 35.76 | 46.54 | unknown |
| WikiText-2 | 困惑度 (–) | 18.34 | 39.14 | unknown |
| enwik8 | 每字元位元 (–) | 0.93 | 0.99 | unknown |
| text8 | 每字元位元 (–) | 0.98 | 1.08 | unknown |
| WikiText-103 | 困惑度 (–) | 18.34 | 18.3 | unknown |
通用語言任務
雖然未達到專門系統的最先進水平,GPT-2 仍可透過對已訓練模型的特定提示,在不進行任何微調的情況下執行閱讀理解、摘要與翻譯等任務。
文本生成與失效模式
GPT-2 能根據任意輸入提示產生逼真且連貫的文本續寫。然而,模型會出現多種失效模式:
- 重複文本: 模型可能產生重複的序列。
- 世界建模失敗: 模型偶爾會生成邏輯上不可能的情境(例如描述水下燃燒的火災)。
- 不自然的主題切換: 模型可能會突然切換主題。
OpenAI 指出,效能會因主題而異;模型在訓練資料中高度出現的主題(例如 Brexit、魔戒)表現較佳,而在高度技術性或深奧的內容上表現不佳。
政策影響與濫用風險
OpenAI 確認大型語言模型可能的多項正面應用與惡意使用:
潛在益處
- AI 寫作助理
- 具備能力的對話代理
- 無監督的語言間翻譯
- 更佳的語音辨識系統
潛在惡意使用
- 生成誤導性的新聞文章
- 線上冒充
- 自動化內容產出: 自動產生濫用、偽造或垃圾/網釣內容於社群媒體。
OpenAI 警告說,這些技術降低了製造假內容與發動錯資訊活動的成本,因而建議大眾對線上文字保持更高的懷疑態度。
發布策略:分階段揭露
鑑於大規模產生欺騙或濫用語言的潛在風險,OpenAI 透過分階段發布的方式實驗負責任的揭露:
- 初始發布: 最初僅釋出一個規模較小的 GPT-2(117M 參數)版本與抽樣程式碼。
- 中期更新(2019 年 5 月): 釋出較大的 345M 參數版本。
- 合作夥伴共享: 762M 與 1.5B 版本僅與 AI 與安全社群的合作夥伴共享,以提升社會的準備度。
OpenAI 並未向一般大眾釋出完整資料集、訓練程式碼或 1.5B 模型權重。此策略旨在給予社群時間評估模型特性並檢視每個發布階段的影響。