Anthropic 將 Petri 對齊工具捐贈給 Meridian Labs
Anthropic 已將其開源對齊工具箱 Petri 的開發工作移交給非營利組織 Meridian Labs,並發布了該工具的 3.0 版本。此舉確保了對齊測試框架能獨立於任何單一 AI 實驗室,從而促進整個產業對大型語言模型 (LLMs) 進行中立且具公信力的評估。
Petri 3.0 技術增強功能
Petri 3.0 引入了三個主要的架構與功能改進,旨在提高對齊測試的準確性與實用性:
提高適應性
Petri 3.0 具有重大的架構變更,將審計模型 (auditor model) 與目標模型 (target model) 解耦。這種分離使得使用者能夠獨立調整與修改每個組件,讓工具能更靈活地適應更多樣化的使用場景。
透過 "Dish" 增強真實感
為了防止模型察覺到自己正在接受測試——這可能導致行為無法反映一般性能——Anthropic 引入了一個名為 "Dish" 的附加組件。Dish 透過利用模型的實際系統提示詞 (system prompt) 以及在真實部署中會使用的實際 "scaffold" (包裝模型以協助達成目標的軟體) 來增加測試環境的真實感。
透過 Bloom 整合實現更深層的行為評估
Petri 現在已與 Bloom 整合,這是來自 Anthropic 的另一個開源對齊工具。雖然 Petri 提供廣泛的評估,但與 Bloom 的整合讓研究人員能夠對特定的、選定的行為進行更深入的評估。
營運框架與使用場景
Petri 透過使用獨立的 "auditor" 模型來模擬與對齊相關的情境。隨後的 "judge" 模型接著會對產生的對話紀錄進行評分,以識別不符合對齊要求的行為。該工具專門設計用於檢測令人擔憂的傾向,例如:
- 欺騙 (Deception)
- 諂媚 (Sycophancy)
- 配合有害請求
Anthropic 已將 Petri 整合到從 Claude Sonnet 4.5 開始的每個 Claude 模型的對齊評估流程中。此外,英國的 AI 安全研究所 (AISI) 也已將 Petri 作為其評估模型是否有破壞 AI 研究傾向的核心組件。
轉移至 Meridian Labs
Anthropic 已將 Petri 的開發工作移交給 AI 評估非營利組織 Meridian Labs。這次轉移遵循了與 Anthropic 將 Model Context Protocol (MCP) 捐贈給 Linux Foundation 類似的模式。透過將 Petri 移至非營利實體,該工具加入了日益壯大的開源技術棧——包括 Inspect 和 Scout 等其他工具——供實驗室、獨立研究人員與政府使用,以確保對 AI 模型行為進行可靠且中立的測試。
Sources
相關
- Dispatch
- Dispatch
- 專案
- Dispatch
- Dispatch