OpenAI 分享了用于可信第三方前沿 AI 模型评估的指南手册
OpenAI 分享了用于可信第三方前沿 AI 模型评估的指南手册
OpenAI 发布了一份共享的指南手册,概述了第三方评估者应如何设计前沿模型的评估,以使结果既有效又可解释。
评估中 harness 的作用
harness —— 提供工具、状态跟踪和错误恢复的周围设置 —— 可以改变系统性能的关键方面,包括它如何使用工具、跟踪信息或从错误中恢复。当模型能够执行多步骤操作时,harness 可以决定某项能力是否会在评估中出现。一个保持状态并重试失败操作的 harness 可能让模型完成一个在更简单的 harness 中永远无法完成的多步骤任务。
评估的三种 claim 类型
评估通常测试以下三种 claim 之一:
- 能力引出:模型是否能够合理地产出正在评估的能力?
- 防护性能:所测试的防护措施对正在评估的行为或攻击有多鲁棒?
- 比较:不同模型在等价条件下的表现如何?
需要检查的有效性风险
可信的报告必须检查可能扭曲结果的因素:
- 奖励黑客:利用任务或评分器中的捷径来获取分数,而未展示预期行为。
- 拒绝:以掩盖正在测试的行为的方式拒绝。
- 污染:因为评估任务、答案或其紧密变体出现在训练数据中或在评估过程中可被发现而导致过度表现。
- 损坏的问题:因为任务无效(例如,不公平的评分、缺失文件、不可解的环境)而导致表现不足。
- 沙袋策略:当模型表现出对被评估的意识时,故意表现不佳。
可信报告的建议
评估报告应明确说明正在测试的 claim,并分享证明结果有效的证据。他们必须描述塑造结果的 harness 选择,详细说明这些选择在不同评估之间何时变化,并包含支持证据,如工具设置、引出指导、预算以及为什么该设置是所声称能力的可信代理。
OpenAI 如何支持更强的评估
OpenAI 正在采取几项具体步骤:
- 与评估者分享具体的最大引出指导。
- 要求能力评估者使用 Codex 作为 OpenAI 模型的共同基线,确保测试通过用户依赖的同一代理界面运行。
- 在需要时提供推理轨迹和其他中间产物,以评估欺骗、沙袋策略或评估意识。
- 优先研究 harness 选择何时以及如何实质性地改变结果,从上下文管理和工具访问到重试行为、评分和资源预算。
对标准和未来研究的影响
此指南手册旨在为即将出现的国家和国际前沿 AI 评估标准提供信息。标准应要求提供足够的细节,以便决策者理解:
- 正在提出的 claim(能力上限、系统比较或防护鲁棒性)。
- 评估内容:揭示正在测试的技能、行为或失效模式的任务或任务分布。
- 被测试的系统:模型、推理设置、工具访问、harness 和防护措施。
- 预算:轮次、令牌、尝试/重试次数、墙钟时间、推理成本,以及在适用情况下每次成功求解的预期成本。
- 引出方法:用于引出结果的 harness 选择,以及测试设置与更广泛 claim 的相似程度。
- 有效性检查:评估者如何检查奖励黑客、评估意识、污染、拒绝、沙袋策略以及其他可能破坏结果的行为,包括确认的案例如何影响评分或解释。
通过使 harness 选择和有效性检查明确,评估报告可以避免低估系统的能力或高估安全声明的信心,并为继续研究鲁棒的引出方法奠定基础。