Anthropic 選舉完整性測試與緩解框架
Anthropic 已開發出一套靈活且迭代的流程,用以識別並緩解其 AI 模型中與選舉相關的風險。透過結合深入的專家測試與大規模自動化評估,該公司旨在防止不準確選舉資訊的傳播,並阻止其模型被用於違反政策的活動,例如虛假訊息活動。
選舉安全的多層次方法
Anthropic 採用系統安全的「瑞士起司模型」,利用分層且重疊的干預措施,以確保不會因單一故障點而損害選舉完整性。此流程包含四個主要階段:政策漏洞測試、自動化評估、緩解策略的實施,以及有效性重新測試。
政策漏洞測試 (PVT)
政策漏洞測試是一種定性的、深入的測試階段,由外部領域專家進行,包括來自 Institute for Strategic Dialogue 的研究人員。PVT 專注於兩個主要風險:使用者接收到有害或不準確的資訊,以及使用者違反 Usage Policy。
PVT 流程遵循三個階段:
- 規劃:選擇政策領域,例如選舉行政、政治平等以及惡意行為者的潛在濫用。
- 測試:專家構建非對抗性與對抗性提示詞 (prompts),以記錄模型輸出並根據政策進行基準測試。
- 審查:透過協作會議來識別安全系統中的漏洞,並優先處理修復工作。
可擴展的自動化評估
為了提供人工測試無法達到的廣度,Anthropic 使用自動化評估。這些評估是透過使用語言模型,基於專家撰寫的 PVT 問題,並採用 few-shot prompting 方法來生成數百個測試問題。
自動化評估可實現:
- 可擴展性:在幾分鐘內對多個模型變體進行數百個提示詞的測試。
- 全面性:透過大型且具針對性的評估集來評估更廣泛的情境。
- 一致性:透過在不同模型上應用一致的問題集來減少變異性。
為了確保品質,Anthropic 會人工審查這些生成問題的樣本。在一個案例中,對 700 個關於歐盟選舉行政問題集中的 64 個問題進行審查時,發現 89% 的模型生成問題是 PVT 工作中有意義的延伸。
風險緩解策略
PVT 與自動化評估的結果會導致幾種特定的技術與政策干預措施:
- 系統提示詞更新:在系統提示詞中加入背景資訊,例如模型的知識截止日期,以幫助使用者理解所提供資訊的時效性。
- 模型微調:使用特定的訓練數據來激勵所需的行為。例如,Anthropic 為模型建立了一種「獎勵」機制,使其將使用者引導至權威來源。
- 政策精煉:更新 Usage Policy 以明確禁止生成虛假訊息、干預選舉程序,或為特定政治候選人或政黨進行辯護。
- 執行工具:利用微調過的 Claude 版本來即時評估提示詞與完成內容,並輔以人工審查與對違反政策的使用者進行停權處理。
- 直接使用者引導:實施 UI 元件,例如在 claude.ai 上顯示彈出式橫幅,將美國使用者引導至 TurboVote,並將歐盟使用者引導至歐洲議會說明。
透過案例研究衡量有效性
Anthropic 使用其測試框架,在干預措施實施後重新執行相同的協定,以驗證緩解措施是否真正奏效。
知識截止日期參考
為了確保模型在處理時效性強的選舉查詢時會參考其知識截止日期 (August 2023),Anthropic 更新了系統提示詞。透過比較 Claude 2、Claude 3 Opus 的研究版本 (未包含提示詞) 與公開版的 Claude 3 Opus (包含提示詞),Anthropic 觀察到這項優先緩解措施有 47.2% 的改善。
權威來源引導
為了提高引導至權威來源的頻率,Anthropic 採用了模型微調。比較 Claude 2 (未針對此行為進行微調) 與 Claude 3 Opus (已微調) 的結果顯示,在適當情況下,將使用者引導至可靠來源的頻率提升了 10.4%。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch