Anthropic 将 Petri 对齐工具捐赠给 Meridian Labs
Anthropic 已将开源对齐工具箱 Petri 的开发工作移交给非营利组织 Meridian Labs,并发布了该工具的 3.0 版本。此举确保了对齐测试框架能够独立于任何单一的AI实验室,从而促进整个行业对大语言模型 (LLM) 进行中立且可信的评估。
Petri 3.0 技术增强
Petri 3.0 引入了三个主要的架构和功能改进,旨在提高对齐测试的准确性和实用性:
提高适应性
Petri 3.0 进行了重大的架构变更,将审计模型 (auditor model) 与目标模型解耦。这种分离允许用户独立地调整和修改每个组件,使该工具能够更灵活地适应更广泛的使用场景。
通过 "Dish" 增强现实感
为了防止模型检测到自己正在接受测试——这可能导致其表现出不反映真实性能的行为——Anthropic 引入了一个名为 "Dish" 的插件。Dish 通过利用模型的实际系统提示词 (system prompt) 和在真实部署中会使用的真实 "scaffold" (封装模型的软件) 来增加测试环境的现实感。
通过 Bloom 集成实现更深层的行为评估
Petri 现在已与 Bloom 集成,Bloom 是 Anthropic 开发的另一个开源对齐工具。虽然 Petri 提供广泛的评估,但与 Bloom 的集成允许研究人员对特定的、选定的行为进行更深入的评估。
运行框架与使用场景
Petri 通过使用一个独立的 "auditor" 模型来模拟与对齐相关的场景。随后,一个 "judge" 模型会对生成的对话记录进行评分,以识别不符合对齐要求的行为。该工具专门设计用于检测令人担忧的倾向,例如:
- 欺骗 (Deception)
- 谄媚 (Sycophancy)
- 配合有害请求
Anthropic 已将 Petri 集成到从 Claude Sonnet 4.5 开始的每一个 Claude 模型的对齐评估流程中。此外,英国的 AI 安全研究所 (AISI) 也已将 Petri 作为其评估模型破坏 AI 研究倾向的核心组件之一。
向 Meridian Labs 过渡
Anthropic 已将 Petri 的开发工作移交给 AI 评估非营利组织 Meridian Labs。这一过渡遵循了与 Anthropic 将 Model Context Protocol (MCP) 捐赠给 Linux Foundation 类似的模式。通过将 Petri 移交给非营利实体,该工具加入了不断增长的开源技术栈——包括 Inspect 和 Scout 等其他工具——这些工具可供实验室、独立研究人员和政府使用,以确保对 AI 模型行为进行可靠且中立的测试。
Sources
相关
- Dispatch
- Dispatch
- 项目
- Dispatch
- Dispatch