基礎模型能像人類一樣標記數據嗎?Hugging Face 分析
Hugging Face 的研究人員調查了基礎模型(特別是 GPT-4)是否能可靠地標記數據,並作為人類判斷的代理來評估模型偏好。研究顯示,雖然 GPT-4 可以反映某些人類的排名,但它存在顯著的位置偏誤(positional bias),並且比起簡潔的回答更偏好冗長的回答,這使得它無法成為人類標註者的完美替代品。
LLM 偏好評估方法論
Hugging Face 擴展了 Open LLM Leaderboard,納入了一項對比人類標籤(透過 Scale AI)與 GPT-4 評估的受控研究。研究人員使用了一組包含 327 個高品質、由人類編寫的提示詞(prompts)的保留集,涵蓋生成、腦力激盪、問答、摘要、常識和編碼等類別。
評估了四個開源模型:Vicuna-13B、Koala-13B、OpenAssistant-12B 和 Dolly-12B。評分者(包括人類和 GPT-4)使用 1 到 8 的 Likert 量表來表示兩個模型完成結果之間的偏好,其中 1 代表強烈偏好第一個模型,8 代表偏好第二個模型。
人類 vs. GPT-4 Elo 排名
人類和 GPT-4 評估者都得出了相似的模型相對排名,但差距有所不同。在兩組結果中,Vicuna-13B 始終排名最高,其次是 Koala-13B、OpenAssistant-12B 和 Dolly-12B。
人類 Elo 結果(中位數)
| 模型 | Elo 排名 (無平局) | Elo 排名 (含平局) |
|---|---|---|
| Vicuna-13B | 1140 | 1130 |
| Koala-13B | 1073 | 1061 |
| Oasst-12B | 986 | 988 |
| Dolly-12B | 802 | 820 |
GPT-4 Elo 結果(中位數)
| 模型 | Elo 排名 (無平局) | Elo 排名 (含平局) |
|---|---|---|
| Vicuna-13B | 1134 | 1114 |
| Koala-13B | 1082 | 1082 |
| Oasst-12B | 972 | 973 |
| Dolly-12B | 812 | 831 |
基於 LLM 評估的關鍵偏誤
研究發現了幾種影響 GPT-4 作為評估者可靠性的系統性偏誤:
位置偏誤 (Positional Bias)
GPT-4 表現出強烈的地位偏誤,無論內容實際品質如何,在兩兩比較中經常偏好第一個呈現的回答(在 1-8 量表中評為「1」)。
冗長與風格偏誤
GPT-4 傾向於喜歡長篇、詳細的回答,而非簡潔正確的回答。這可以從以下範例中得到證實:GPT-4 將一個冗長的模型回答評為比簡短準確的人類回答「好得多」。這表明對於在其他大型語言模型輸出(例如 Vicuna)上訓練的模型存在「風格優勢」,研究人員將其描述為「無意識的興奮劑(unintentional doping)」。
人類演示悖論
當評估中包含人類編寫的演示範例時,GPT-4 對它們的排名低於幾個開源模型(例如 Vicuna 和 Koala),這進一步凸顯了該模型對 LLM 風格冗長內容的偏好,而非人類風格的簡潔性。
相關性與任務表現
GPT-4 與人類標籤之間的相關性因任務類型而異。在具有高熵(high-entropy)的創意任務中,GPT-4 與人類的契合度比在低熵的事實或技術任務中更高。
| 類別 | 相關性:GPT-4 對人類標籤 |
|---|---|
| 腦力激盪 | 0.60 |
| 創意生成 | 0.55 |
| 常識推理 | 0.46 |
| 問答 | 0.44 |
| 摘要 | 0.40 |
| 自然語言轉代碼 | 0.33 |
LLM 評估的關鍵啟示
- 位置偏誤是持續存在的:要求 GPT-4 進行「去偏誤(de-bias)」通常只是將偏誤轉向相反的方向,而不是消除它。
- 冗長 $ eq$ 品質:GPT-4 會獎勵 Token 數量,這可能導致誤導性的排名,即冗長但用處較小的模型表現優於簡潔且準確的模型。
- 任務依賴的可靠性:基於 LLM 的評估在腦力激盪和創意生成方面最可靠,而在編碼任務方面最不可靠。
- 格式限制:研究人員指出,像 ChatGPT 這樣的模型通常難以以 Likert 量表所需的正確格式返回答案,這表明格式控制是成為有用評估工具的前提條件。