Anthropic 安全保障框架:Claude

Anthropic 採用多層次的安全保障策略,確保 Claude 的功能被用於有益的結果,同時防止現實世界中的傷害。此方法整合了政策、執法、產品、資料科學、威脅情資和工程等領域的專家,貫穿整個模型生命週期。

政策制定與傷害框架

Anthropic 的安全保障團隊設計使用政策,規範 Claude 應如何以及不應如何使用,特別針對兒童安全、選舉完整性與網路安全。此政策制定由兩個主要機制引導:

  • 統一傷害框架: 一種結構化視角,用於評估五個維度上的潛在傷害影響:身體、心理、經濟、社會與個人自主。此框架考量濫用的可能性與規模,以指導執法程序。
  • 政策脆弱性測試: Anthropic 與恐怖主義、極端化、兒童安全與心理健康等領域的外部專家合作,對政策進行壓力測試。例如,在 2024 年美國大選期間,與戰略對話研究所(Institute for Strategic Dialogue)的合作,促成在使用者尋求選舉資訊時顯示橫幅,引導至 TurboVote 等權威來源。

將安全整合至模型訓練

安全保障直接整合至訓練流程,透過安全保障團隊與微調團隊的合作實現。此過程包含:

  • 行為引導: 定義模型在訓練期間應展現或避免的特定特質與行為。
  • 迭代優化: 使用評估與檢測流程識別有害輸出,進而更新獎勵模型或調整系統提示。
  • 專門領域專業知識: 與 ThroughLine 等組織合作,優化 Claude 對自殘與心理健康問題的回應,確保模型提供細膩的支持,而非簡單拒絕。

因此,Claude 被訓練為拒絕協助非法活動,並能識別試圖生成惡意程式碼、詐騙內容或策劃傷害行為的企圖。

部署前測試與評估

在任何新模型發布前,會進行三種主要類型的評估:

  • 安全評估: 在各種情境下測試對使用政策的遵守情況,包括明顯違規與多輪對話。這些評估由其他模型進行評分,並由人工審核以確保準確性。
  • 風險評估: 對高風險領域(包括網路傷害,以及化學、生物、放射性與核武器及高威力爆炸物(CBRNE))進行 AI 能力提升測試,與政府及民間產業夥伴合作。
  • 偏見評估: 透過比較對立觀點的回應,測試政治偏見,並評估其事實性與一致性。團隊亦測試與種族、性別、宗教等身份特徵相關的偏見,例如在醫療與就業情境中。

針對「電腦使用」工具,發布前的評估識別出增強式垃圾訊息生成的風險,進而發展新的檢測方法、提示注入防護機制,並具備針對濫用帳戶停用該工具的能力。

實時檢測與執法

模型上線後,Anthropic 使用自動化系統與人工審核的組合來執行使用政策:

  • 分類器: 特別微調的 Claude 模型,即時監控對話中特定政策違規行為。這些分類器處理數兆個詞元,同時將運算開銷降至最低。
  • CSAM 檢測: 在首方產品中,將影像雜湊值與已知兒童性虐待素材(CSAM)資料庫進行比對。
  • 執法行動: 包括「回應導引」,即即時調整系統提示以防止有害輸出(或完全停止回應),以及帳戶層級的行動,如警告或終止。

持續監控與威脅情資

Anthropic 監控流量模式,以識別超越單一提示的複雜攻擊模式:

  • Claude Insights: 一種保護隱私的工具,將對話分組為主題群集,分析現實世界使用情況,並為防護機制提供依據。
  • 層級摘要: 一種技術,用於監控電腦使用與網路能力,將互動濃縮為摘要,以識別集體行為,例如自動化影響操作。
  • 威脅情資: 團隊監控駭客論壇、社交媒體與即時通訊平台,並將內部濫用指標(如活動激增)與外部威脅資料交叉比對,以識別敵對使用行為。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch