meridianlabs-ai/inspect_petri

An alignment auditing agent capable of quickly exploring alignment hypothesis

解決する課題

言語モデルの監査プロセスを自動化し、アライメントの問題、報酬ハッキング、およびその他の問題のある動作を検出します。研究者は、対話をシミュレートし、モデルの応答を監視することで、特定のアライメント仮説をテストできます。

仕組み

Petriは、エージェントシステムを使用して監査を実施します。シード指示を受け取って現実的な監査シナリオを生成し、監査モデルとターゲットモデルの間でマルチターンの会話をオーケストレーションします。動作をさらにテストするために、ツールのシミュレーションやロールバックを行うことも可能です。最後に、ジャッジモデルが一貫したルーブリックを使用して、生成されたトランスクリプトにスコアを付けます。

対象者

モデルのアライメントと行動監査のためのエンドツーエンドのテストを必要とする、AI安全性研究者および開発者。

ハイライト

  • シード指示からの監査シナリオの自動生成
  • 監査モデルとターゲットモデル間のマルチターン・オーケストレーション
  • モデルの反応をテストするためのツールシミュレーションとロールバックのサポート
  • ジャッジモデルによるルーブリックに基づいたトランスクリプトのスコアリング

関連

  • Dispatch
  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト