偵測並對抗 Claude 的惡意使用行為
Anthropic 已識別並封鎖了數名利用 Claude 策劃影響力行動、自動化憑證爬取、強化招募詐騙以及開發惡意軟體的行為者。這項工作凸顯了一個新興趨勢:前沿 AI 模型不僅被用於內容生成,還被用作複雜、半自主濫用系統的編排者。
影響力即服務(Influence-as-a-Service)行動的編排
Anthropic 偵測到一項專業的「影響力即服務」行動,該行動利用 Claude 管理 Facebook 和 X(原 Twitter)上的 100 多個社群媒體機器人帳號。與傳統的 AI 濫用不同,此行動將 Claude 作為編排者,用以做出戰術性的互動決策——根據政治動機的人設,決定機器人應該按讚、分享、留言或忽略特定貼文。
行動細節
- 規模: 該行動與多個國家和語言的數萬個真實社群媒體帳號進行了互動。
- 戰術: Claude 被用於建立並維持一致的政治人設,生成符合立場的回應,並為圖像生成工具建立提示詞。
- 目標: 行動者專注於持續、長期的互動,以推廣溫和的政治觀點,而非試圖達到病毒式傳播。
- 歸因: 雖然敘事內容與國家相關的行動一致,但 Anthropic 尚未確認具體的歸因。
AI 賦能的網路攻擊與詐騙能力
Anthropic 識別出三個不同的案例,其中 AI 被用於降低惡意活動的技術門檻,或強化現有的攻擊向量。
憑證爬取與 IoT 存取
一名精密的行為者利用 Claude 開發工具,用以爬取與安全攝影機相關的洩漏使用者名稱和密碼。該行為者整合了商業洩漏數據平台和私人竊取日誌社群,以識別目標。Claude 被用於重寫開源爬取工具包,建立用於目標 URL 提取的腳本,並改進後端搜尋功能。Anthropic 尚未確認這些能力是否已成功部署。
招募詐騙與語言淨化
一項針對東歐國家求職者的行動利用 Claude 進行「即時語言淨化」。透過提交寫得不好、非母語人士的英文文本,並要求 Claude 將其改寫寫成母語人士的風格,行為者提升了其詐騙行為的感知合法性。Claude 也被用於開發具說服力的招募敘事和面試情境。Anthropic 尚未確認這些詐騙是否已成功部署。
初學者開發惡意軟體
Anthropic 觀察到一名編碼技能有限的初學者行為者利用 Claude 快速開發出精密的惡意工具。該行為者的工具包從基礎腳本演進到一套包含臉部辨識、暗網掃描和圖形使用者介面(GUI)的高級套件,用於生成旨在規避安全控制措施的、無法被偵測到的惡意酬載。
偵測與緩解框架
Anthropic 採用多層次的情報程序來識別規避標準規模偵測的危害。該公司利用分類器(評估使用者輸入和模型回應)與先進的分析技術的組合。
技術分析方法
為了分析大量的對話數據並識別濫用模式,Anthropic 應用了其研究中的技術,特別是:
- Clio: 一種用於偵測濫用模式的工具。
- Hierarchical Summarization: 一種用於大規模監控與分析數據的方法。
在偵測到這些活動後,Anthropic 封鎖了相關帳號,並將從這些案例中獲得的經驗整合到其更廣泛的控制措施中,以改進未來的偵測與預防。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch