Anthropic 2024 年選舉誠信策略
Anthropic 已推出一套全面的框架,以減輕 2024 年全球選舉週期中 AI 誤用的風險。此策略專注於防止政治競選、減少錯誤資訊的傳播,並確保使用者獲得權威的投票資訊,而非可能由 AI 幻覺產生的回應。
Strict Policies Against Political Campaigning and Lobbying
Anthropic 透過其《可接受使用政策》(AUP) 禁止將其工具用於政治競選和遊說。此限制特別防止候選人創建冒充他們的聊天機器人,並禁止使用 Claude 進行有針對性的政治競選。
為了執行這些政策,Anthropic 採用自動化檢測系統來識別錯誤資訊或影響力操作。執行措施遵循分層方法:
- Warnings: 已發現誤用的使用者或組織將收到警告。
- Suspensions: 在極端情況下,將撤銷對工具和服務的存取權限。所有停權處分均經過人工審查,以盡量減少誤判。
Adversarial Testing and Technical Evaluations
自 2023 年以來,Anthropic 已透過針對性的紅隊測試 (red-teaming) 進行「政策漏洞測試」(Policy Vulnerability Testing),以識別系統可能被用於違反 AUP 的方式。此測試專注於兩個主要向量:
- Misinformation and Bias: 分析系統如何回應有關候選人、選舉管理和政治議題的查詢。
- Adversarial Abuse: 測試系統對於要求提供投票抑制策略提示詞的韌性。
作為紅隊測試的補充,公司使用定量的內部評估套件來衡量:
- Political Parity: 確保模型在不同候選人和主題之間的回應一致性。
- Refusal Rates: 衡量系統拒絕回應有害選舉相關查詢的程度。
- Robustness: 測試系統防止投票者剖析、針對性策略和錯誤資訊產生的能力。
Redirecting Users to Authoritative Voting Information
為了對抗幻覺 (hallucinations) 的風險——即模型產生錯誤資訊——Anthropic 主動將尋求投票資訊的使用者重新導向至非黨派、權威的來源。由於模型訓練的頻率不足以提供即時的選舉數據,因此其設計旨在引導使用者遠離針對關鍵投票查詢的 AI 生成答案。
Regional Implementations
- United States: 位於美國的使用者在詢問投票資訊時,會看到一個彈出視窗,提供重新導向至 TurboVote 的選項,這是由非黨派組織 Democracy Works 提供的資源。
- European Union: 隨著 Claude 在 2024 年 5 月擴展至歐洲,針對位於歐盟的使用者也實施了類似的彈出視窗干預措施,將其重新導向至歐洲議會的非黨派選舉網站。
Adaptive Response to Unanticipated AI Use
Anthropic 承認 AI 的部署往往會導致意想不到的影響和未預見的使用方式。公司正在開發方法,以即時檢測系統中新興且未預見的使用方式,並承諾在發現時公開溝通這些發現。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch