基础模型能像人类一样标注数据吗?Hugging Face 分析
Hugging Face 研究人员调查了基础模型(特别是 GPT-4)是否能可靠地标注数据并作为人类判断的代理来评估模型偏好。研究表明,虽然 GPT-4 能够反映一些人类排名,但它存在显著的位置偏差,并且更倾向于冗长而非简洁,这使其成为人类标注者的不完美替代品。
LLM 偏好评估方法
Hugging Face 扩展了 Open LLM Leaderboard,加入了一项受控研究,以比较人类标注(通过 Scale AI)和 GPT-4 评估。研究人员使用了一组 327 个高质量的人类编写提示,涵盖生成、头脑风暴、问答、摘要、常识推理和编码等类别。
评估了四个开源模型:Vicuna-13B、Koala-13B、OpenAssistant-12B 和 Dolly-12B。评分者(包括人类和 GPT-4)使用 1 到 8 的 Likert 量表来表示两个模型完成度之间的偏好,其中 1 表示强烈偏好第一个模型,8 表示强烈偏好第二个模型。
人类与 GPT-4 Elo 排名
人类和 GPT-4 评估者得出的模型相对排名相似,但差距有所不同。在这两组结果中,Vicuna-13B 始终排名最高,其次是 Koala-13B、OpenAssistant-12B 和 Dolly-12B。
人类 Elo 结果(中位数)
| 模型 | Elo 排名(无平局) | Elo 排名(有平局) |
|---|---|---|
| Vicuna-13B | 1140 | 1130 |
| Koala-13B | 1073 | 1061 |
| Oasst-12B | 986 | 988 |
| Dolly-12B | 802 | 820 |
GPT-4 Elo 结果(中位数)
| 模型 | Elo 排名(无平局) | Elo 排名(有平局) |
|---|---|---|
| Vicuna-13B | 1134 | 1114 |
| Koala-13B | 1082 | 1082 |
| Oasst-12B | 972 | 973 |
| Dolly-12B | 812 | 831 |
基于 LLM 的评估中的关键偏差
研究发现了一些影响 GPT-4 作为评估者可靠性的系统性偏差:
位置偏差
GPT-4 表现出强烈的位置偏差,在成对比较中经常偏爱首先呈现的响应(在 1-8 量表上将其评为