meridianlabs-ai/inspect_petri

An alignment auditing agent capable of quickly exploring alignment hypothesis

解决的问题

它实现了语言模型审计流程的自动化,以发现对齐问题、奖励黑客行为(reward hacking)以及其他异常行为。它允许研究人员通过模拟交互和监控模型响应来测试特定的对齐假设。

工作原理

Petri 使用代理系统进行审计。它通过种子指令生成真实的审计场景,然后编排审计模型与目标模型之间的多轮对话。为了进一步测试行为,它可以模拟工具和回滚。最后,评判模型使用一致的评分标准对生成的转录文本进行评分。

适用对象

需要对模型对齐和行为审计进行端到端测试的 AI 安全研究人员和开发人员。

亮点

  • 从种子指令自动生成审计场景。
  • 审计模型与目标模型之间的多轮编排。
  • 支持工具模拟和回滚以测试模型反应。
  • 通过评判模型进行基于评分标准的转录文本评分。

相关

  • Dispatch
  • 项目
  • Dispatch
  • 项目
  • 项目