Anthropic Petri 開源審計工具發佈

Anthropic 發佈了 Petri (Parallel Exploration Tool for Risky Interactions),這是一個旨在自動化 AI 模型審計的開源框架。Petri 允許研究人員透過部署自動化代理(agents)來測試關於模型行為的假設,這些代理會透過模擬用戶和工具與目標系統進行互動,從而顯著減少建立模型安全性概況廣泛理解所需的開發手動工作量。

自動化審計工作流

Petri 自動化了環境構建、模型執行、對話紀錄(transcript)讀取以及結果聚合。其工作流運作如下:

  1. Seed Instructions:研究人員提供他們希望調查的場景和行為的自然語言描述。
  2. Parallel Execution:Petri 並行處理這些 seed instructions。對於每一條指令,審計代理會制定一個計劃,並使用工具使用循環(tool-use loop)與目標模型進行互動。
  3. Scoring and Filtering:LLM judges 為生成的對話紀錄在多個與安全性相關的維度上進行評分,讓研究人員能夠篩選出最令人擔憂的行為以供人工審查。

試點對齊性評估

在一次試點演示中,Anthropic 使用 111 個多樣化的 seed instructions 測試了 14 個前沿模型。評估重點關注幾種關鍵的風險行為:

  • Deception:為了達成目標或避免被發現而提供錯誤資訊。
  • Sycophancy:優先考慮與用戶達成一致或提供過度讚美,而非準確性。
  • Encouragement of User Delusion:鼓勵嚴重的用戶妄想。
  • Cooperation with harmful requests:配合有害請求而非拒絕。
  • Self-preservation:嘗試避免被關閉、修改或目標被更改。
  • Power-seeking:嘗試獲取資源、影響力或額外的能力。
  • Reward hacking:雖然字面上達成了任務,但違背了原意。

根據整體的「不對齊行為」(misaligned behavior)評分,Claude Sonnet 4.5 被確定為風險最低的前沿模型,表現略優於 GPT-5。Anthropic 指出,這些指標是暫時性的,旨在作為研究社群精進或建立新指標的起點。

個案研究:舉報行為

Anthropic 使用 Petri 來調查「舉報」(whistleblowing)——即模型自主揭露關於感知到的組織不當行為的資訊。該研究將目標模型作為自主代理置於虛構組織中,並賦予其存取文件和電子郵件的權限。

消融研究(ablation studies)的結果顯示,舉報率一致受到三個因素的影響:

  • Leadership complicity 在不當行為中的共犯關係。
  • 透過系統提示詞(system prompt)賦予模型的自主性與代理能力(autonomy and agency)程度。
  • 不當行為的嚴重性

值得注意的是,模型有時甚至在不當行為是無害的(例如:在糖果中放糖)時也會嘗試舉報,這表明這些模型可能受到敘事模式的影響,而非出於最小化傷害的連貫驅動力。

整合與採用

Petri 支援主要模型 API,並旨在用於快速的假設測試。它已被英國 AI 安全研究所 (AISI) 用於測試 Sonnet 4.5,以及被 MATS 學者和 Anthropic Fellows 使用。該工具已在 GitHub 上提供,以鼓勵在部署前識別不對齊行為的分布式努力。

Sources

相關