meridianlabs-ai/inspect_petri
An alignment auditing agent capable of quickly exploring alignment hypothesis
解決する課題
言語モデルの監査プロセスを自動化し、アライメントの問題、報酬ハッキング、およびその他の問題のある動作を検出します。研究者は、対話をシミュレートし、モデルの応答を監視することで、特定のアライメント仮説をテストできます。
仕組み
Petriは、エージェントシステムを使用して監査を実施します。シード指示を受け取って現実的な監査シナリオを生成し、監査モデルとターゲットモデルの間でマルチターンの会話をオーケストレーションします。動作をさらにテストするために、ツールのシミュレーションやロールバックを行うことも可能です。最後に、ジャッジモデルが一貫したルーブリックを使用して、生成されたトランスクリプトにスコアを付けます。
対象者
モデルのアライメントと行動監査のためのエンドツーエンドのテストを必要とする、AI安全性研究者および開発者。
ハイライト
- シード指示からの監査シナリオの自動生成
- 監査モデルとターゲットモデル間のマルチターン・オーケストレーション
- モデルの反応をテストするためのツールシミュレーションとロールバックのサポート
- ジャッジモデルによるルーブリックに基づいたトランスクリプトのスコアリング
関連
- Dispatch
- プロジェクト
- Dispatch
- プロジェクト
- プロジェクト