GPT-2 1.5B 發佈說明
OpenAI 已發佈具有 15 億個參數的 GPT-2 版本,這是其分階段發佈計畫中的最終且最大的模型。此次發佈包括模型權重與程式碼,以促進合成文本檢測工具的開發。
人類對 GPT-2 輸出的感知
人類發現 1.5B 模型的輸出比較小的版本更具說服力,儘管與 774M 模型相比,其可信度的提升幅度較小。在康乃爾大學進行的一項調查中,1.5B 模型獲得了 6.91/10 的可信度評分,而 774M 模型為 6.72,355M 模型則為 6.07。
誤用與合成宣傳的潛力
GPT-2 可以透過微調來針對特定意識形態立場生成合成宣傳內容。由 Middlebury Institute of International Studies 的 Center on Terrorism, Extremism, and Counterterrorism (CTEC) 進行的研究顯示,該模型可以針對四種意識形態進行微調:white supremacy、Marxism、jihadist Islamism 以及 anarchism。
合成文本檢測的挑戰
基於內容的合成文本檢測仍是一項長期挑戰,因為較大的模型產生的輸出更難以分類。OpenAI 開發了一款基於 RoBERTa-BASE (125 million parameters) 與 RoBERTa-LARGE (355 million parameters) 的檢測模型,對於 1.5B GPT-2 生成的文本,其檢測率約為 95%。
OpenAI 指出,此準確度不足以進行獨立檢測,必須結合基於元數據 (metadata) 的方法、人類判斷以及公眾教育。該公司也觀察到,雖然針對較大模型的輸出進行訓練可以提高檢測的穩健性,但隨著模型規模增長,分類的整體難度也會隨之增加。
誤用的證據
目前尚無強烈證據顯示 GPT-2 被廣泛誤用。雖然對於網路釣魚 (phishing) 與垃圾郵件 (spam) 等高量、低收益操作的可能性已有討論,但 OpenAI 並未發現該模型被用於編寫程式碼、文件或進行其他惡意行為的證據。
偏見分析與標準
語言模型本身內含偏見。為了應對此問題,OpenAI 實施了兩項主要策略:
- Model Cards: 在 GitHub 上發佈模型卡 (model card) 以記錄語言模型的固有問題。
- Qualitative Evaluation: 進行內部針對性探測,以檢測性別、種族與宗教偏見,並將結果反映於模型卡中。
OpenAI 強調,這些探測並非全面,並強調 AI 研究社群需要共同合作,建立標準化的偏見分析框架。
負責任的發佈規範
GPT-2 的發佈作為分階段發佈流程的測試案例。OpenAI 正持續透過參與 Partnership on AI 的「Responsible Publication Norms for Machine Learning」專案,致力於建立機器學習領域的負責任發佈規範。
Sources
- OriginalGPT-2: 1.5B release