meridianlabs-ai/inspect_petri
An alignment auditing agent capable of quickly exploring alignment hypothesis
解決的問題
它實現了語言模型審計流程的自動化,以發現對齊問題、獎勵黑客行為(reward hacking)以及其他異常行為。它允許研究人員透過模擬交互和監控模型回應來測試特定的對齊假設。
工作原理
Petri 使用代理系統進行審計。它透過種子指令生成真實的審計場景,然後編排審計模型與目標模型之間的多輪對話。為了進一步測試行為,它可以模擬工具和回滚。最後,評判模型使用一致的評分標準對生成的轉錄文本進行評分。
適用對象
需要對模型對齊和行為審計進行端到端測試的 AI 安全研究人員和開發人員。
亮點
- 從種子指令自動生成審計場景。
- 審計模型與目標模型之間的多輪編排。
- 支援工具模擬和回滾以測試模型反應。
- 透過評判模型進行基於評分標準的轉錄文本評分。
相關
- Dispatch
- 專案
- Dispatch
- 專案
- 專案