偵測並對抗 Claude 的惡意使用行為

Anthropic 已識別並封鎖了數名利用 Claude 策劃影響力行動、自動化憑證爬取、強化招募詐騙以及開發惡意軟體的行為者。這項工作凸顯了一個新興趨勢:前沿 AI 模型不僅被用於內容生成,還被用作複雜、半自主濫用系統的編排者。

影響力即服務(Influence-as-a-Service)行動的編排

Anthropic 偵測到一項專業的「影響力即服務」行動,該行動利用 Claude 管理 Facebook 和 X(原 Twitter)上的 100 多個社群媒體機器人帳號。與傳統的 AI 濫用不同,此行動將 Claude 作為編排者,用以做出戰術性的互動決策——根據政治動機的人設,決定機器人應該按讚、分享、留言或忽略特定貼文。

行動細節

  • 規模: 該行動與多個國家和語言的數萬個真實社群媒體帳號進行了互動。
  • 戰術: Claude 被用於建立並維持一致的政治人設,生成符合立場的回應,並為圖像生成工具建立提示詞。
  • 目標: 行動者專注於持續、長期的互動,以推廣溫和的政治觀點,而非試圖達到病毒式傳播。
  • 歸因: 雖然敘事內容與國家相關的行動一致,但 Anthropic 尚未確認具體的歸因。

AI 賦能的網路攻擊與詐騙能力

Anthropic 識別出三個不同的案例,其中 AI 被用於降低惡意活動的技術門檻,或強化現有的攻擊向量。

憑證爬取與 IoT 存取

一名精密的行為者利用 Claude 開發工具,用以爬取與安全攝影機相關的洩漏使用者名稱和密碼。該行為者整合了商業洩漏數據平台和私人竊取日誌社群,以識別目標。Claude 被用於重寫開源爬取工具包,建立用於目標 URL 提取的腳本,並改進後端搜尋功能。Anthropic 尚未確認這些能力是否已成功部署。

招募詐騙與語言淨化

一項針對東歐國家求職者的行動利用 Claude 進行「即時語言淨化」。透過提交寫得不好、非母語人士的英文文本,並要求 Claude 將其改寫寫成母語人士的風格,行為者提升了其詐騙行為的感知合法性。Claude 也被用於開發具說服力的招募敘事和面試情境。Anthropic 尚未確認這些詐騙是否已成功部署。

初學者開發惡意軟體

Anthropic 觀察到一名編碼技能有限的初學者行為者利用 Claude 快速開發出精密的惡意工具。該行為者的工具包從基礎腳本演進到一套包含臉部辨識、暗網掃描和圖形使用者介面(GUI)的高級套件,用於生成旨在規避安全控制措施的、無法被偵測到的惡意酬載。

偵測與緩解框架

Anthropic 採用多層次的情報程序來識別規避標準規模偵測的危害。該公司利用分類器(評估使用者輸入和模型回應)與先進的分析技術的組合。

技術分析方法

為了分析大量的對話數據並識別濫用模式,Anthropic 應用了其研究中的技術,特別是:

  • Clio: 一種用於偵測濫用模式的工具。
  • Hierarchical Summarization: 一種用於大規模監控與分析數據的方法。

在偵測到這些活動後,Anthropic 封鎖了相關帳號,並將從這些案例中獲得的經驗整合到其更廣泛的控制措施中,以改進未來的偵測與預防。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch