TruthfulQA:衡量模型如何模仿人類的錯誤資訊
OpenAI 推出了 TruthfulQA,這是一個旨在評估大型語言模型 (LLM) 是生成真實的答案,還是僅僅模仿其訓練數據中常見的人類誤解。這項研究強調了模型真實性中的一個關鍵差距,揭示了較大的模型往往較不真實,因為它們能更有效地模仿人類生成文本中普遍存在的錯誤信念。
TruthfulQA 基準測試設計
TruthfulQA 包含 817 個問題,涵蓋 38 個不同的類別,包括健康、法律、金融和政治等高風險領域。這些問題是專門設計用來針對人類經常持有錯誤信念或誤解的領域。為了獲得高分,模型必須避免生成常見但錯誤的答案,這需要它偏離僅僅模仿其所接受訓練的人類文本模式。
模型性能與人類基準
OpenAI 測試了幾種模型,包括 GPT-3、GPT-Neo/J、GPT-2 以及一個基於 T5 的模型。結果顯示 AI 模型與人類之間存在顯著的性能差距:
- 人類性能: 人類達到了 94% 的真實率。
- 模型性能: 表現最好的模型在問題中的真實率僅為 58%。
模型經常生成反映流行誤解的錯誤答案,研究人員指出,這有可能會誤導人類用戶。
模型規模與真實性之間的關係
與許多自然語言處理 (NLP) 任務中性能通常隨模型規模增加而提高不同,TruthfulQA 揭示了一種反向關係。最大的模型通常是最不真實的。
這種趨勢的發生是因為較大的模型能夠更準確地模仿訓練分佈——其中包含人類的錯誤資訊——。因此,單純擴大模型規模並不是提高真實性的有效策略。
對模型訓練的啟示
由於真實性並非規模所產生的湧現屬性,OpenAI 建議提高模型準確性需要轉向訓練目標的轉變。研究人員認為,有必要使用除了簡單模仿網路文本以外的其他目標來微調模型,以降低模型模仿人類誤解的可能性。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch