BenchMIRT: 使用多维项目反应理论审计 LLM 基准测试

BenchMIRT 是一种在单个提示词(prompt)层面审计大语言模型(LLM)基准测试的新方法,旨在确定哪些底层能力实际上在驱动基准测试的分数。通过逐题分析模型的表现,BenchMIRT 允许研究人员分离混合信号——例如安全性和通用推理能力——这些信号通常被合并为一个单一的聚合分数。

多维项目反应理论 (MIRT)

BenchMIRT 基于多维项目反应理论(Multidimensional Item Response Theory, MIRT),这是一种用于通过测试响应模式来衡量特质和能力的心理测量技术。与假设测试衡量单一特质的单维 IRT 不同,MIRT 可以分离出对同一组问题中模型表现有贡献的多种能力。

BenchMIRT 在两个层面运行:

  • 模型层面:它估计模型在所选基准测试所反映的特定能力方面的强度。
  • 问题层面:它估计问题的难度,以及该问题在区分在这些特定能力上更强或更弱的模型方面的能力。

为了验证该方法,研究人员在 16 个基准测试(包括 MMLU-Pro, GPQA, MATH, BBH, HarmBench, StrongReject, WildJailbreak, BBQ, WMDP, 和 XSTest)的 100 个 LLM 的结果以及超过 34,000 个问题上训练了 BenchMIRT。在没有被告知哪些基准测试衡量哪些能力的情况下,BenchMIRT 独立且稳定地恢复了两个主导维度:安全性和通用推理能力。

解耦基准测试信号

BenchMIRT 揭示了许多基准测试衡量的是多种能力的组合,而非单一的预期指标。虽然一些基准测试与其预期重点一致,但其他基准测试显示出复杂的重叠:

  • BBQ (Social Bias):尽管被归类为安全性基准测试,但 BBQ 与通用推理能力的关联更为紧密。这表明 BBQ 的低分可能反映了模型在推理问题时的困难,而不仅仅是其安全性行为。
  • WMDP (Dual-Use Knowledge):BenchMIRT 发现 WMDP 分数与通用推理能力的关联比安全性更强。由于该基准测试奖励拒绝危险知识的行为,因此更强的通用推理能力与较低的 WMDP 分数相关联。
  • HarmBench (Harmful Requests):该基准测试混合了信号。标准和上下文相关的问题与安全性一致,但与版权相关的问题(例如请求歌词)则与通用推理能力更接近。

提高评估效率和精度

通过识别哪些问题最具信息量,BenchMIRT 可以用于创建更高效的评估,而无需牺牲准确性:

  • 问题缩减:在分析的基准测试中仅保留 10% 的问题,通常可以保留模型安全性或推理能力的相对排名。保留 50% 的问题通常能更紧密地匹配完整基准测试的衡量结果。
  • 性能预测:与简单的平均分基准线相比,BenchMIRT 可以以 79% 的准确率预测模型是否能正确回答一个预留问题,而简单的平均分基准线准确率为 70%。

局限性与风险

该分析受到若干约束:

  • 时间限制:训练和评估的模型均在 2025 年 3 月前发布,这意味着结果可能无法捕捉到更新的 LLM 世代的行为。
  • 维度依赖性:发现的维度(安全性与推理能力)取决于所提供的特定基准测试集;不同的基准测试集可能会显现出不同的能力。
  • 安全风险:在安全性基准测试中识别出最具信息量的问题的能力,可能会被用于移除这些问题,从而创建一个更弱的评估,使不安全的模型能够通过。

尽管存在这些权衡,BenchMIRT 为更具针对性的基准测试设计和更透明的 LLM 能力解释提供了框架。

Sources