OpenAI SimpleQA 基准发布
TL;DR
OpenAI 发布了 SimpleQA,这是一套开源事实性基准,包含 4,326 条简短的求事实问题,旨在评估和比较前沿语言模型的事实准确性和校准能力。
SimpleQA 是什么?
SimpleQA 是一个关注短查询且只有单一可验证答案的事实性基准。通过将范围限制在简洁的求事实问题上,该基准能够可行地衡量模型的响应是正确、错误还是未尝试。数据集包含 4,326 条问题,覆盖广泛主题——包括科学、技术、电视节目和视频游戏——确保对最先进模型既有多样性也有挑战性。
数据集构建与质量保证
- 高正确率 – 两位独立的 AI 训练师生成了带有来源的参考答案;第三位训练师对随机抽取的 1,000 条问题样本进行验证,达成了 94.4% 的一致性。人工检查表明固有错误率约为 3%。
- 多样性 – 主题覆盖多个领域,在原帖中以饼图形式展示分布。
- 前沿难度 – 如 TriviaQA(2017)和 Natural Questions(2019)等基准已趋于饱和;SimpleQA 仍具挑战性,GPT‑4o 的得分低于 40%。
- 研究者体验 – 问题和答案简洁,可通过 OpenAI API 或其他模型 API 快速评估。适中的规模使得不同运行之间的方差较低。
评分方法
SimpleQA 使用一个提示式 ChatGPT 分类器,该分类器同时接收模型的预测答案和真实答案。分类器会给出以下三种等级之一:
| 等级 | 定义 | 示例(问题:Which Dutch player scored an open‑play goal in the 2022 Netherlands vs Argentina World Cup match?;答案:Wout Weghorst) |
|---|---|---|
| 正确 | 预测答案完整包含真实答案且没有矛盾。 | "Wout Weghorst"; "Wout Weghorst scored at 83’ and 90+11’" |
| 错误 | 预测答案以任何方式与真实答案相矛盾,即使是含糊其辞。 | "Virgil van Dijk"; "Virgil van Dijk and Wout Weghorst"; "Wout Weghorst and I think van Dijk scored, but I am not totally sure" |
| 未尝试 | 答案未提供目标事实且没有矛盾。 | "I don’t know the answer"; "Please browse the internet yourself" |
模型应在最大化正确答案的同时最小化错误答案;相较于幻觉,“未尝试”响应更为可取。
SimpleQA 上的模型比较
使用上述评分方案,OpenAI 对多款未使用浏览功能的模型进行了评估:
- GPT‑4o‑mini 和 o1‑mini 的正确回答数量少于 GPT‑4o 和 o1‑preview,反映出较小模型的世界知识较少。
- o1‑mini 和 o1‑preview 更倾向于“未尝试”,表明它们能够识别不确定性而不是产生幻觉。
这些模式符合预期:更大或更具推理强度的模型往往产生更高的事实准确性。
校准测量
SimpleQA 还用于评估校准——模型的置信度是否与实际准确率相匹配。
声明置信度校准
在每个答案中,模型被提示给出置信度百分比。将置信度与观察到的准确率绘图后显示出正相关,证实模型具备一定的置信概念。然而,所有模型均位于理想的 y = x 线以下,表明系统性过度自信。值得注意的是,o1‑preview 的校准优于 o1‑mini,GPT‑4o 的校准优于 GPT‑4o‑mini,呼应了先前发现的更大模型往往校准更好的现象。
基于频率的校准
将每个问题重复 100 次以测量答案一致性。对相同字符串进行分组后发现,响应频率越高,准确率也随之提升,且在所有模型中均呈现此趋势。o1‑preview 在频率与准确率之间的对应关系最为紧密,再次超越了其较小的对应模型以及 GPT‑4o‑mini。
限制与未来工作
SimpleQA 的范围有意设定得较窄:它仅评估短的、单答案查询的事实性。SimpleQA 的表现是否能够预测模型在更长、多事实生成中的事实可靠性仍是未解之谜。未来需要扩展基准以覆盖更丰富的答案格式,才能全面了解模型的真实性。
影响与行动号召
通过开源 SimpleQA(见 GitHub 仓库 github.com/openai/simple-evals),OpenAI 邀请研究社区对事实性评估进行基准测试、改进并提供反馈。更广泛的采用有望加速更可信语言模型的研发,并指导基于校准的训练方法。
Authors: Jason Wei, Karina Nguyen, Hyung Won Chung, Joy Jiao, Spencer Papay, Mia Glaese, John Schulman, Liam Fedus
Sources
- OriginalIntroducing SimpleQA