Anthropic 模型评估的统计方法
Anthropic 发布了一篇新的研究论文,《为评估添加误差棒:语言模型评估的统计方法》(Adding Error Bars to Evals: A Statistical Approach to Language Model Evaluations),该论文为以科学严谨的方式报告 AI 模型评估结果提供了一个框架。其核心目标是确定模型在基准测试中的卓越表现究竟是源于真实的实力,还是仅仅因为在选择特定问题时“运气好”。
通过中心极限定理量化技能
为了衡量独立于特定问题集的潜在技能,研究人员应关注所有可能问题的理论平均值,而不是特定基准测试的观测平均值。
根据中心极限定理,来自同一分布的随机样本的均值遵循正态分布。Anthropic 建议在每个评估分数旁边报告标准误(Standard Error of the Mean, SEM)。通过在均值分数上加减 1.96 $\times$ SEM,可以计算出 95% 的置信区间,从而为模型的理论性能提供一个有数学依据的衡量标准。
使用聚类标准误解决非独立问题
许多流行的基准测试,如 SQuAD、RACE、QuAC 和 DROP,违反了问题独立的假设,因为它们将多个问题围绕一段单一的文本段落进行分组。对这些聚类问题应用朴素的中心极限定理方法会低估标准误,这可能导致研究人员在不存在差异的情况下错误地检测到能力差异。
Anthropic 建议在随机化单位(例如文本段落)上进行标准误聚类。在实际测试中,Anthropic 发现,在流行的评估中,聚类标准误可能比朴素标准误大三倍以上。
减少问题内方差的策略
减少分数中随机成分的方差,可以直接提高整体均值的统计精度。Anthropic 根据提示词方法提出了两种主要策略:
- 对于思维链(Chain-of-Thought, CoT)推理: 研究人员应从同一模型中多次对答案进行重采样,并将问题层级的平均值作为中心极限定理的输入。Inspect 框架目前通过其
epochs参数实现了这一点。 - 对于非 CoT 推理: 通过使用下一个 token 的概率,通常可以消除随机成分。例如,在一个多选题中,如果“B”是正确答案,分数应该是模型分配给 token “B”的概率,而不是一个二元的正确/错误结果。
通过配对差异分析提高信号强度
使用双样本 t 检验来比较两个模型会忽略数据的共享结构。由于模型是在同一组问题列表上进行测试的,配对差异检验(paired-differences test)更为有效,因为它消除了由问题难度引起的变化,并专注于响应中的方差。
Anthropic 指出,前沿模型在问题得分上的相关性很高(在 0.3 到 0.7 之间),这意味着它们往往会在相同的问题上表现正确或错误。报告均值差异、标准误、置信区间和相关性,可以为相对性能提供更清晰的信号。
使用功效分析进行评估设计
统计功效(Statistical power)是指测试在两个模型之间确实存在差异时检测出该差异的能力。如果没有足够的功效,微小但真实的差异可能会被漏掉。
Anthropic 建议使用功效分析来:
- 制定具体的假设(例如,“模型 A 比模型 B 高出 3 个百分点”)。
- 计算针对零假设(例如,“模型 A 和模型 B 持平”)进行测试该假设所需的题目数量。
- 确定为了保持所需的功效属性,答案重采样所需的次数。
- 根据预期的效应量(effect size)决定是否值得运行一个题目数量有限的评估。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch