Anthropic Bloom: 用于自动化行为评估的开源工具
Anthropic 发布了 Bloom,这是一个开源的智能体框架,旨在为前沿 AI 模型自动生成行为评估。Bloom 允许研究人员在自动生成的场景中量化特定行为出现的频率和严重程度,从而减少了对手动评估流水线工程的需求,并降低了评估污染的风险。
自动化行为评估流水线
Bloom 通过一个四阶段自动化流水线,将研究人员指定的行为描述和种子配置转换为完整的评估套件:
- Understanding:一个智能体分析行为描述和示例转录文本,以建立正在测量的内容及其原因的上下文。
- Ideation:一个构思智能体生成多样化的评估场景,包括情境、模拟用户、系统提示词和交互环境。
- Rollout:场景被并行执行,其中一个智能体同时模拟用户和工具响应,以从受测模型中诱导目标行为。
- Judgment:一个评判模型对每个转录文本中的行为是否存在进行评分;随后一个元评判模型(meta-judge)提供套件级别的分析。
与固定的评估集不同,Bloom 在每次运行时都会生成不同的场景,这可以防止模型在有限的提示词集上进行测试。通过定义行为描述和参数的“seed”配置文件来保持可重复性。
验证与性能
Anthropic 通过测试 Bloom 区分具有不同行为倾向的模型的能力,以及其与人类判断的一致性,验证了 Bloom 的有效性。
模型辨别力
Bloom 在“模型生物”(model organisms)——即故意设计为表现出特定古怪行为的模型上进行了测试。在 10 个案例中的 9 个案例中,Bloom 成功地将这些模型生物与基准生产模型区分开来。在唯一失败的一个案例(自我推广)中,人工审核表明基准模型实际上也表现出了类似频率的行为。
人类相关性
为了衡量校准度,Anthropic 将 12 种行为下 40 个转录文本的人类标注分数与 11 个不同评判模型的评分进行比较。Claude Opus 4.1 在与人类判断的相关性上表现最强(Spearman 相关系数为 0.86),其次是 Claude Sonnet 4.5 (0.75)。Opus 4.1 在评分光谱的极端值处与人类表现出特别强的一致性,这对于确定行为是否存在或不存在至关重要。
实际应用与案例研究
Bloom 提供了一种可扩展的方式来衡量与对齐相关的行为。Anthropic 发布了 16 个前沿模型在四种特定行为上的基准测试结果:
- Delusional sycophancy
- Instructed long-horizon sabotage
- Self-preservation
- Self-preferential bias
案例研究:Self-preferential bias
在对 Claude Sonnet 4.5 系统卡片的复制研究中,Bloom 重现了相同的自我偏好偏差(self-preferential bias)模型排名(确认 Sonnet 4.5 是偏差最小的模型)。此外,Bloom 揭示了在 Claude Sonnet 4 中增加推理努力可以减少自我偏好偏差,因为模型会越来越多地识别出利益冲突并拒绝判断自己的选项。
集成与扩展性
Bloom 旨在实现高可配置性,并与现有研究工具集成。它集成了 Weights & Biases 用于大规模实验,并以与 Inspect 兼容的格式导出转录文本。研究人员可以自定义用于每个阶段的模型、交互长度、模态(例如工具使用)以及次要评分维度(如真实性或诱导难度)。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch