Anthropic: 评估 AI 系统的挑战
为 AI 系统开发稳健且可靠的评估方法极其困难,而 AI 治理的有效性直接取决于能否有意义地衡量模型的性能与安全性。Anthropic 的研究表明,许多现有的评估套件在作为准确的性能指标方面能力有限,这通常是由于数据污染、实现复杂性以及人类评估的主观性造成的。
多选题评估的局限性
标准化的多选题测试通常用于通过准确率指标来量化模型性能,但它们容易出现几种失效模式。以 Massive Multitask Language Understanding (MMLU) 基准测试为例,Anthropic 识别出了四个主要挑战:
- 数据污染: 由于 MMLU 被广泛使用,模型在训练过程中更有可能遇到测试题目,从而导致“作弊”。
- 格式敏感性: 格式上的微小变化(例如将 "(A)" 改为 "[A]")可能会导致准确率产生约 5% 的波动。
- 实现不一致: 不同的实验室使用不同的方法,例如 few-shot learning 或 chain-of-thought reasoning,这使得跨实验室的比较变得不可靠。
- 质量问题: 一些 MMLU 示例存在标注错误或无法回答。
衡量社会偏见也变得更加复杂。在实施 Bias Benchmark for QA (BBQ) 时,Anthropic 发现,一个获得“偏见得分”为 0 的模型可能会产生误导;在某些情况下,模型只是根本不回答问题,从而导致在技术上没有偏见但却毫无用处的输出。
第三方评估框架的挑战
第三方框架旨在提供独立且中立的评估,但它们在扩展性和针对特定模型的细微差别方面往往面临困难。
自下而上的框架 (BIG-bench)
BIG-bench 从数百名作者那里获取评估内容,由于安装所需的工程量巨大、扩展效率低下以及特定实现(如 BBQ-lite)中存在漏洞,这对 Anthropic 来说显得非常笨重。
自上而下的框架 (HELM)
斯坦福大学的 Holistic Evaluation of Language Models (HELM) 使用专家策划的任务。虽然这减轻了 AI 实验室的工程负担,但它引入了其他问题:
- 格式不匹配: HELM 不使用 Claude 模型训练时所采用的特定 "Human/Assistant" 格式,这会导致非典型的响应,并产生误导性的性能指标。
- 迭代速度慢: 作为一个志愿者参与的项目,HELM 评估新模型的周转时间可能长达数月,落后于 AI 模型的快速演进。
人类评估的主观性与复杂性
由于 AI 系统是为开放式交互而设计的,因此人类评估是必要的,但其本质上具有主观性且成本高昂。
众包人员 A/B 测试
Anthropic 使用 A/B 测试,由人类对模型响应进行基于帮助性 (helpfulness) 和无害性 (harmlessness) 的排名。然而,这种方法面临三个主要局限性:
- 资源密集型: 与第三方平台、自定义界面以及雇佣众包人员带来的伦理挑战相关的高成本。
- 评估者差异: 结果会因评估者的创造力、动力和发现缺陷的能力而异。
- 帮助性与无害性的张力: 模型可能会通过简单地拒绝回答来达到“无害性”,从而在有用性和安全性之间产生权衡。
国家安全红队测试
评估模型在应对前沿威胁(例如化学、生物、放射性和核风险)方面的表现需要领域专家。这一过程目前“与其说是科学,不如说是艺术”,并面临特定的障碍:
- 专家知识: 风险是复杂的,且依赖于敏感的现实世界场景。
- 信息孤岛: 对安全许可的要求可能会阻止红队人员与需要减轻威胁的 AI 开发人员进行关键细节的分享。
- 法律风险: 在红队测试期间输出受控信息可能会带来法律后果。
模型生成的评估与第三方审计
"Ouroboros" 效应
使用 AI 来生成 AI 的评估可以比用月来计算,在几分钟内产生结果。虽然这很有前景——正如在 Constitutional AI (CAI) 中所见,其中基于模型的红队测试使模型变得比人类认为更无害——但它引入了继承模型自身社会偏见或虚构内容的风险。
第三方审计
由 Alignment Research Center (ARC) 等组织进行的审计提供了深入、独立的风险评估。然而,审计员对完整性的需求(限制共享细节)与开发人员通过提示工程 (prompt engineering) 和微调 (fine-tuning) 专家知识来帮助审计员触及模型性能极限的能力之间存在张力。
AI 评估的政策建议
为了改进 AI 测量的科学性,Anthropic 提出以下政策行动:
- 为可重复科学提供资金: 政府应优先资助高质量、可复制的方法论,而非大量低质量的评估。
- 实现支持: 资金应投向为现有基准测试(如 BIG-bench)创建易于安装的软件库,以及标准化的动态基准测试。
- 机构赋能: 增加对 National Institute of Standards and Technology (NIST) 等机构的资金投入,以维护公共 "AI safety leaderboards" 以激励安全性表现。
- 法律避风港: 创建法律保护机制,允许实验室、政府和第三方在评估模型国家安全风险时,不至于因法律后果而受阻,并辅以负责任的披露协议。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch