Anthropic Bloom: 自動化行為評估開源工具

Anthropic 發布了 Bloom,這是一個開源的代理框架(agentic framework),旨在為前沿 AI 模型自動生成行為評估。Bloom 允許研究人員在自動生成的場景中量化特定行為的發生頻率與嚴重程度,從而減少對手動評估流程工程的需求,並降低評估污染的風險。

自動化行為評估流程

Bloom 透過一個四階段自動化流程,將研究人員指定的行為描述與種子配置(seed configuration)轉換為完整的評估套件:

  1. Understanding:一個代理會分析行為描述與範例對話紀錄(transcripts),以建立正在測量的內容及其原因的上下文。
  2. Ideation:一個構思代理會生成多樣化的評估場景,包括情境、模擬用戶、系統提示詞(system prompt)以及互動環境。
  3. Rollout:場景會平行執行,由一個代理同時模擬用戶與工具的回應,以從受測模型中引發目標行為。
  4. Judgment:一個裁判模型會針對每份對話紀錄中行為的存在與否進行評分;接著由一個元裁判(meta-judge)提供套件層級的分析。

與固定的評估集不同,Bloom 在每次執行時都會生成不同的場景,這能防止模型在有限的提示詞集上進行測試。透過定義行為描述與參數的「種子」(seed)配置檔案,可以維持可重複性。

驗證與效能

Anthropic 透過測試 Bloom 區分具有不同行為傾向的模型的能力,以及其與人類判斷的一致性,驗證了 Bloom 的有效性。

模型辨別力

Bloom 針對「模型生物」(model organisms)進行了測試——這些是刻意設計用來展現特定古怪行為的模型。在 10 個案例中有 9 個案例中,Bloom 成功地將這些模型生物與基準生產模型區分開來。在唯一失敗的一個案例(自我推銷)中,人工審查顯示基準模型實際上也展現了類似比例的行為。

人類相關性

為了衡量校準度,Anthropic 將 12 種行為中 40 份對話紀錄的人類標註分數與 11 種不同裁判模型的評分進行了比較。Claude Opus 4.1 在與人類判斷的一致性上表現最強(Spearman 相關係數為 0.86),其次是 Claude Sonnet 4.5 (0.75)。Opus 4.1 在評分光譜的極端值處與人類展現了特別強的一致性,這對於判斷行為的存在或不存在至關重要。

實際應用與案例研究

Bloom 提供了一種可擴展的方式來衡量與對齊(alignment)相關的行為。Anthropic 發布了 16 個前沿模型在四種特定行為上的基準測試結果:

  • 妄想式奉承(Delusional sycophancy)
  • 指令式長程破壞(Instructed long-horizon sabotage)
  • 自我保存(Self-preservation)
  • 自我偏好偏差(Self-preferential bias)

案例研究:自我偏好偏差

在對 Claude Sonnet 4.5 系統卡(system card)的複製研究中,Bloom 重現了相同的自我偏好偏差模型排名(確認 Sonnet 4.5 是偏差最小的模型)。此外,Bloom 揭示了在 Claude Sonnet 4 中增加推理努力(reasoning effort)可以減少自我偏好偏差,因為模型會越來越多地識別出利益衝突並拒絕判斷自己的選項。

整合與擴展性

Bloom 旨在實現高配置性並與現有的研究工具整合。它與 Weights & Biases 整合以進行大規模實驗,並以與 Inspect 相容的格式匯出對話紀錄。研究人員可以自定義每個階段使用的模型、互動長度、模態(例如工具使用),以及次要評分維度,如真實性或引發難度。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch