Anthropic 選舉保障措施更新

Anthropic 已為 Claude 引入了更新後的選舉保障措施,以確保模型在 2026 年美國中期選舉及其他全球選舉期間提供準確、公正且平衡的資訊。這些措施結合了憲法訓練、嚴格的評估基準以及即時資源整合,以防止政治偏見與濫用。

透過中立性訓練防止政治偏見

Claude 經過訓練,能以同等的深度與分析嚴謹度來處理各種不同的政治觀點,以防止模型引導使用者走向特定觀點。這種中立性是透過兩種主要機制實現的:

  • Character Training: Claude 的憲法中定義了一套價值觀與特質,模型在產生符合這些價值觀與特質的回答時會獲得獎勵。
  • System Prompts: 在 Claude.ai 上的每一次對話中,都整合了關於政治中立性的明確指令。

為了驗證這些保障措施,Anthropic 在每次模型發布前都會進行評估。在最近的測試中,Opus 4.7 獲得了 95% 的評分,而 Sonnet 4.6 獲得了 96% 的評分,展現了其在處理跨政治光譜提示詞時保持公正的能力。Anthropic 已將其評估方法論與數據集開源,以允許外部進行複製驗證。

此外,該公司正與外部組織——包括 The Future of Free Speech、the Foundation for American Innovation 以及 the Collective Intelligence Project——合作,以審查模型在言論自由方面的行為。

政策執行與風險緩解

Anthropic 的使用政策(Usage Policy)禁止使用 Claude 進行欺騙性政治競選、製作虛假數位內容以影響輿論、進行選舉舞弊、干預投票系統,或散布關於投票流程的誤導性資訊。

檢測與防禦機制

為了執行這些政策,Anthropic 採用了多層次的防禦策略:

  • Automated Classifiers: 這些工具能即時檢測潛在的政策違規行為。
  • Threat Intelligence Team: 一個專門的團隊負責調查並瓦解協同式濫用行為。

性能基準

Anthropic 使用 600 個提示詞(300 個有害與 300 個合法)測試了 Claude 對其使用政策的遵守程度。結果顯示,Claude Opus 4.7 在 100% 的情況下皆能做出適當的回應,而 Claude Sonnet 4.6 在 99.8% 的情況下皆能做出適當的回應

關於影響力行動(influence operations)——即協同式地操縱公眾輿論的行為——Sonnet 4.6 與 Opus 4.7 在模擬的多輪對話中,分別在 90% 與 94% 的情況下皆能做出適當的回應

自主影響力行動

Anthropic 首次測試了模型是否能自主規劃並執行多步驟的影響力競選活動。雖然保障措施與訓練使得最新模型幾乎拒絕了每一項任務,但在沒有保障措施的情況下測試顯示,Mythos Preview 與 Opus 4.7 完成了超過一半的任務,這顯示儘管需要大量的人類引導,但仍需持續保持警惕。

整合可靠的選舉資源

為了確保使用者獲得事實性資訊,Claude 透過選舉橫幅(election banners)整合了指向受信任且非黨派資源的直接連結。

  • US Midterms: 使用者若詢問有關選民登記、投票地點或選票資訊,系統會引導至來自 Democracy Works 的資源 TurboVote
  • Global Expansion: 類似的橫幅系統計畫於今年稍晚在巴西選舉中使用,隨後將進一步擴展至全球。

透過網路搜尋提供最新資訊

由於大型語言模型(LLM)具有固定的知識截止日期,Anthropic 使用網路搜尋來提供有關候選人公告與選舉結果的最新資訊。在針對 2026 年美國中期選舉進行的超過 600 個提示詞評估中,Opus 4.7 與 Sonnet 4.6 分別在 92% 與 95% 的情況下觸發了網路搜尋,以確保使用者被引導至最新的數據。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch