Anthropic:評估人工智慧系統的挑戰
開發穩健且可靠的 AI 系統評估方法極其困難,而 AI 治理的有效性直接取決於能否準確衡量模型的能力與安全性。Anthropic 的研究指出,許多現有的評估套件在作為性能指標方面能力有限,常因資料污染、實作複雜性以及人類評估的主觀性所致。
選擇題評估的限制
標準化選擇題測驗常透過準確率指標量化模型表現,但容易出現多種失效模式。以 Massive Multitask Language Understanding (MMLU) 基準為例,Anthropic 發現四項主要挑戰:
- 資料污染: 由於 MMLU 廣泛使用,模型在訓練期間更可能接觸到測試題目,導致「作弊」。
- 格式敏感性: 格式上的微小變動(例如將「(A)」改為「[A]」)可能導致準確率波動約 5%。
- 實作不一致: 不同實驗室使用不同方法,如少樣本學習或鏈式思考推理,使跨實驗室比較不可靠。
- 品質問題: MMLU 的部分範例標籤錯誤或無法回答。
衡量社會偏見更為複雜。在實作 QA 偏見基準(BBQ)時,Anthropic 發現模型獲得「偏見分數」為 0 可能具有誤導性;在某些情況下,模型只是完全不回答問題,導致技術上無偏見但毫無用處的輸出。
第三方評估框架的挑戰
第三方框架旨在提供獨立且中立的評估,但往往在可擴展性與模型特定細節上遭遇困難。
自下而上的框架(BIG-bench)
BIG-bench 從數百位作者處收集評估,但 Anthropic 發現其因安裝所需的大量工程努力、擴展效率差,以及特定實作(如 BBQ-lite)中存在錯誤而難以使用。
自上而下的框架(HELM)
史丹福大學的語言模型全面評估(HELM)使用專家精心設計的任務。雖然這減輕了 AI 實驗室的工程負擔,但也帶來其他問題:
- 格式不匹配: HELM 未使用 Claude 模型訓練時所針對的特定「人類/助理」格式,導致回應不自然,產生誤導性的性能指標。
- 迭代緩慢: 作為志工努力,HELM 評估新模型的週轉時間可能達數月,遠落後於 AI 模型的快速演進。
人類評估的主觀性與複雜性
由於 AI 系統設計用於開放式互動,人類評估雖必要,但本質上具有主觀性且成本高昂。
群眾工作者 A/B 測試
Anthropic 使用 A/B 測試,由人類根據幫助性與無害性對模型回應進行排序。然而,此方法面臨三大限制:
- 資源密集: 與第三方平台、自訂介面相關的高成本,以及僱用群眾工作者所帶來的倫理挑戰。
- 評估者差異: 結果因評估者的創造力、動機與發現缺陷的能力而異。
- 幫助性與無害性的矛盾: 模型可能透過拒絕回答來達成「無害」,造成有用性與安全性之間的權衡。
國家安全紅隊測試
評估前沿威脅(如化學、生物、輻射與核風險)需要領域專家。目前此過程「更像藝術而非科學」,面臨特定障礙:
- 專家知識: 風險複雜,依賴敏感的現實情境。
- 資訊孤島: 安全許可的需要可能阻止紅隊成員與需減輕威脅的 AI 開發者分享關鍵細節。
- 法律風險: 紅隊測試期間輸出受控資訊可能帶來法律後果。
模型生成的評估與第三方審計
「奧羅波羅斯」效應
使用 AI 生成 AI 的評估可將結果產出時間從數月縮短至數分鐘。雖然前景可期——例如在憲法 AI(CAI)中,基於模型的紅隊測試使人類認為模型更無害——但可能繼承模型自身的社會偏見或虛構內容。
第三方審計
由 Alignment Research Center(ARC)等組織進行的審計能提供深入且獨立的風險評估。然而,審計者對誠信的需求(限制分享細節)與開發者透過提示工程與微調專業協助審計者達成模型性能極限的能力之間存在張力。
AI 評估的政策建議
為改善 AI 測量科學,Anthropic 提出以下政策行動:
- 資助可重複的科學: 政府應優先資助高品質、可重複的方法論,而非大量低品質評估。
- 實作支援: 資金應用於建立易於安裝的軟體套件(如 BIG-bench)與標準化動態基準。
- 機構賦能: 增加對國家標準技術研究院(NIST)等機構的資助,以維護公開的「AI 安全領先榜單」,激勵安全性表現。
- 法律豁免保護: 建立法律保護機制,讓實驗室、政府與第三方在評估國家安全風險時無需承擔法律後果,並搭配負責的揭露協議。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch