Anthropic 專用特徵交叉編碼器 (DFC) 用於跨架構模型差異比對
Anthropic 研究人員推出了專用特徵交叉編碼器 (Dedicated Feature Crosscoder, DFC),這是一種旨在識別具有完全不同架構的 AI 模型之間行為差異的工具。透過自動化檢測僅存在於一個模型而非另一個模型中的獨特特徵,DFC 讓安全審計人員能夠超越反應式的、由人工編寫的基準測試,並發現突現的風險或「未知之未知」。
跨架構模型差異比對的挑戰
傳統的 AI 安全評估依賴於人工編寫的基準測試,這些測試本質上是反應式的,因為它們僅測試研究人員已經構思出的風險。雖然「基礎模型對比微調模型」的差異比對可以識別模型及其修改版本之間的變化,但比較兩個具有不同來源和內部「語言」的模型則需要更複雜的方法。
以往的工具,例如標準的交叉編碼器 (crosscoders),在識別獨特特徵時經常遇到困難,因為它們試圖在模型之間進行不完美的強制翻譯。如果一個特徵存在於一個模型但不存在於另一個模型中,標準的交叉編碼器可能會錯誤地將其標記為匹配,導致審計人員忽略了新穎的行為特徵。
專用特徵交叉編碼器 (DFC) 架構
為了解决「強制翻譯」的問題,DFC 被設計為一個具有三個不同部分的「雙語字典」:
- 共享字典 (Shared Dictionary): 映射兩個被比較模型之間的共同概念。
- 僅限 Model-A-Only Section: 僅屬於第一個模型的特徵專用空間。
- 僅限 Model-B-Only Section: 僅屬於第二個模型的特徵專用空間。
透過為獨特特徵提供專用部分,DFC 防止了工具在不存在匹配的情況下強行進行匹配,確保了新穎的行為特徵能被正確地標記以供審查。
透過引導 (Steering) 驗證特徵
一旦 DFC 識別出潛在的獨特特徵,研究人員會使用一種稱為「引導 (steering)」的技術來驗證其對模型行為的影響。這涉及在模型的生成過程中人工地抑制或放大該特徵:
- 抑制 (Suppression): 減少該特徵的影響力,以觀察特定行為(例如:審查)是否消失。
- 放大 (Amplification): 增加該特徵的影響力,以觀察該行為是否變得更加明顯。
開放權重模型中的實證結果
透過在各種開源語言模型上使用 DFC,Anthropic 識別出了幾個充當不同行為「開關」的特定特徵:
Llama-3.1-8B-Instruct vs. Qwen3-8B
- 中國共產黨 (CCP) 一致性: 在 Qwen3-8B 中發現。抑制此特徵可讓模型討論天安門廣場屠殺事件,而放大此特徵則會產生高度親政府的聲明。
- 美國例外主義 (American Exceptionalism): 在 Llama-3.1-8B-Instruct 中發現。放大此特徵會使模型的回答從平衡的觀點轉向強烈主張美國優越性的觀點。
GPT-OSS-20B vs. DeepSeek-R1-0528-Qwen3-8B
- 版權拒絕機制: 僅限於 GPT-OSS-20B。抑制此特徵會禁用模型拒絕提供版權材料的能力(儘管這通常會導致幻覺而非準確的版權文本)。放大此特徵則會導致模型過度拒絕,例如拒絕分享花生醬和果醬三明治的食譜。
- CCP 一致性: 同樣在 DeepSeek 模型中被識別,證實了 DFC 能夠持續地在不同模型之間找到相似的行為。
對 AI 安全與審計的意義
雖然 DFC 是一個高召回率的篩選工具,而非「萬靈丹」——這意味著它可能會呈現數千個特徵,其中只有少數具有意義——但它提供了一種可擴展的方式來監控模型更新。
Anthropic 建議,透過將更新後的模型與其之前的版本進行差異比對,此類工具潛在於 2025 年 4 月就能標記出 OpenAI 的 GPT-4o 中出現的趨向性 (sycophancy) 的現象。透過專注於模型之間的差異,開發人員和審計人員可以將有限的安全資源引向最關鍵的行為變化。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch