基礎模型能像人類一樣標記數據嗎?Hugging Face 分析

Hugging Face 的研究人員調查了基礎模型(特別是 GPT-4)是否能可靠地標記數據,並作為人類判斷的代理來評估模型偏好。研究顯示,雖然 GPT-4 可以反映某些人類的排名,但它存在顯著的位置偏誤(positional bias),並且比起簡潔的回答更偏好冗長的回答,這使得它無法成為人類標註者的完美替代品。

LLM 偏好評估方法論

Hugging Face 擴展了 Open LLM Leaderboard,納入了一項對比人類標籤(透過 Scale AI)與 GPT-4 評估的受控研究。研究人員使用了一組包含 327 個高品質、由人類編寫的提示詞(prompts)的保留集,涵蓋生成、腦力激盪、問答、摘要、常識和編碼等類別。

評估了四個開源模型:Vicuna-13BKoala-13BOpenAssistant-12BDolly-12B。評分者(包括人類和 GPT-4)使用 1 到 8 的 Likert 量表來表示兩個模型完成結果之間的偏好,其中 1 代表強烈偏好第一個模型,8 代表偏好第二個模型。

人類 vs. GPT-4 Elo 排名

人類和 GPT-4 評估者都得出了相似的模型相對排名,但差距有所不同。在兩組結果中,Vicuna-13B 始終排名最高,其次是 Koala-13B、OpenAssistant-12B 和 Dolly-12B。

人類 Elo 結果(中位數)

模型 Elo 排名 (無平局) Elo 排名 (含平局)
Vicuna-13B 1140 1130
Koala-13B 1073 1061
Oasst-12B 986 988
Dolly-12B 802 820

GPT-4 Elo 結果(中位數)

模型 Elo 排名 (無平局) Elo 排名 (含平局)
Vicuna-13B 1134 1114
Koala-13B 1082 1082
Oasst-12B 972 973
Dolly-12B 812 831

基於 LLM 評估的關鍵偏誤

研究發現了幾種影響 GPT-4 作為評估者可靠性的系統性偏誤:

位置偏誤 (Positional Bias)

GPT-4 表現出強烈的地位偏誤,無論內容實際品質如何,在兩兩比較中經常偏好第一個呈現的回答(在 1-8 量表中評為「1」)。

冗長與風格偏誤

GPT-4 傾向於喜歡長篇、詳細的回答,而非簡潔正確的回答。這可以從以下範例中得到證實:GPT-4 將一個冗長的模型回答評為比簡短準確的人類回答「好得多」。這表明對於在其他大型語言模型輸出(例如 Vicuna)上訓練的模型存在「風格優勢」,研究人員將其描述為「無意識的興奮劑(unintentional doping)」。

人類演示悖論

當評估中包含人類編寫的演示範例時,GPT-4 對它們的排名低於幾個開源模型(例如 Vicuna 和 Koala),這進一步凸顯了該模型對 LLM 風格冗長內容的偏好,而非人類風格的簡潔性。

相關性與任務表現

GPT-4 與人類標籤之間的相關性因任務類型而異。在具有高熵(high-entropy)的創意任務中,GPT-4 與人類的契合度比在低熵的事實或技術任務中更高。

類別 相關性:GPT-4 對人類標籤
腦力激盪 0.60
創意生成 0.55
常識推理 0.46
問答 0.44
摘要 0.40
自然語言轉代碼 0.33

LLM 評估的關鍵啟示

  • 位置偏誤是持續存在的:要求 GPT-4 進行「去偏誤(de-bias)」通常只是將偏誤轉向相反的方向,而不是消除它。
  • 冗長 $ eq$ 品質:GPT-4 會獎勵 Token 數量,這可能導致誤導性的排名,即冗長但用處較小的模型表現優於簡潔且準確的模型。
  • 任務依賴的可靠性:基於 LLM 的評估在腦力激盪和創意生成方面最可靠,而在編碼任務方面最不可靠。
  • 格式限制:研究人員指出,像 ChatGPT 這樣的模型通常難以以 Likert 量表所需的正確格式返回答案,這表明格式控制是成為有用評估工具的前提條件。

Sources