Anthropic 美國選舉準備工作
Anthropic 已部署了一套全面的安全措施,以防止其 AI 工具在 2024 年美國選舉週期期間被誤用。這些努力集中在禁止政治競選、打擊錯誤資訊,以及引導使用者前往具權威性且無黨派的投票資訊來源。
使用政策與禁止活動
Anthropic 已更新其使用政策,明確禁止使用 Claude 進行可能干預選舉完整性的活動。該政策專注於以下三個主要的限制領域:
- 政治競選與遊說: Claude 不得用於推廣特定候選人、政黨或議題,也不得用於針對性的政治競選,或徵求選票與資金捐助。
- 錯誤資訊與干預: 禁止生成有關選舉法規、候選人及相關主題的錯誤資訊。此外,工具不得用於針對投票機,或阻礙投票計票與認證過程。
- 媒體限制: 為消除與選舉相關的深偽技術(deepfakes)的風險,Claude 的輸出僅限於純文字,無法生成圖像、音訊或影片。
執行與偵測機制
為了確保符合這些政策,Anthropic 採用自動化系統結合人工審查,以偵測並防止誤用。執行策略包括:
- 提示詞修改: 在 claude.ai 介面上實施對提示詞(prompts)的變更。
- API 審計: 監控第一方 API 的使用案例。
- 帳號停權: 在發生極端政策違規情況時,停權相關帳號。
- 雲端合作夥伴關係: 與 Amazon Web Services (AWS) 和 Google Cloud Platform (GCP) 合作,以識別並減輕使用者透過這些平台存取模型所造成的危害。
漏洞測試與模型精煉
Anthropic 利用針對性的紅隊測試(red-teaming)與自動化評估來識別並系統性地解決與選舉相關的風險。此過程包括:
- 政策漏洞測試 (PVT): 與外部領域專家合作,Anthropic 進行深入測試,以識別與偏見、錯誤資訊及對抗性濫用相關的風險。這包括記錄模型對於「如何投票」及「在哪裡投票」等問題的回答方式。
- 自動化評估: 公司已開發出具擴展性的測試,以衡量回應中針對不同候選人與議題的政治平權性,以及針對有害查詢的拒絕率有效性,並衡量系統對於選民輪廓分析(voter profiling)策略的強韌性。
- 迭代改進: 這些測試的結果將用於持續調整政策、強化執行力,並精煉模型的技術架構。
資訊準確性與透明度
由於 AI 模型缺乏即時訓練數據,Anthropic 已實施特定控制措施,以確保使用者獲得準確的投票資訊:
- 權威性重定向: 向詢問投票資訊的使用者顯示彈出式視窗,將其重定向至 TurboVote,這是由 Democracy Works 提供的一個無黨派資源,提供候選人姓名、選票提案及投票細節。
- 知識截止日期透明度: Claude 的系統提示詞已更新,明確引用其知識截止日期,以防止使用者依賴其提供即時選舉數據。
- 產業合作: Anthropic 已發布其部分自動化評估結果,並發起了一項資助第三方評估的倡議,以改善整個 AI 產業的安全成果。
Sources
- OriginalU.S. Elections Readiness
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch