基础模型能像人类一样标注数据吗?Hugging Face 分析

Hugging Face 研究人员调查了基础模型(特别是 GPT-4)是否能可靠地标注数据并作为人类判断的代理来评估模型偏好。研究表明,虽然 GPT-4 能够反映一些人类排名,但它存在显著的位置偏差,并且更倾向于冗长而非简洁,这使其成为人类标注者的不完美替代品。

LLM 偏好评估方法

Hugging Face 扩展了 Open LLM Leaderboard,加入了一项受控研究,以比较人类标注(通过 Scale AI)和 GPT-4 评估。研究人员使用了一组 327 个高质量的人类编写提示,涵盖生成、头脑风暴、问答、摘要、常识推理和编码等类别。

评估了四个开源模型:Vicuna-13BKoala-13BOpenAssistant-12BDolly-12B。评分者(包括人类和 GPT-4)使用 1 到 8 的 Likert 量表来表示两个模型完成度之间的偏好,其中 1 表示强烈偏好第一个模型,8 表示强烈偏好第二个模型。

人类与 GPT-4 Elo 排名

人类和 GPT-4 评估者得出的模型相对排名相似,但差距有所不同。在这两组结果中,Vicuna-13B 始终排名最高,其次是 Koala-13B、OpenAssistant-12B 和 Dolly-12B。

人类 Elo 结果(中位数)

模型 Elo 排名(无平局) Elo 排名(有平局)
Vicuna-13B 1140 1130
Koala-13B 1073 1061
Oasst-12B 986 988
Dolly-12B 802 820

GPT-4 Elo 结果(中位数)

模型 Elo 排名(无平局) Elo 排名(有平局)
Vicuna-13B 1134 1114
Koala-13B 1082 1082
Oasst-12B 972 973
Dolly-12B 812 831

基于 LLM 的评估中的关键偏差

研究发现了一些影响 GPT-4 作为评估者可靠性的系统性偏差:

位置偏差

GPT-4 表现出强烈的位置偏差,在成对比较中经常偏爱首先呈现的响应(在 1-8 量表上将其评为

Sources