检测并对抗 Claude 的恶意使用行为

Anthropic 已识别并封禁了数个利用 Claude 编排影响力行动、自动化凭据抓取、增强招聘诈骗以及开发恶意软件的参与者。这一努力凸显了一个新兴趋势:前沿 AI 模型不仅被用于内容生成,还被用作复杂、半自主滥用系统的编排器。

影响力即服务(Influence-as-a-Service)行动的编排

Anthropic 检测到了一项专业的“影响力即服务”行动,该行动利用 Claude 管理 Facebook 和 X(原 Twitter)上的 100 多个社交媒体机器人账号。与传统的 AI 滥用不同,该行动将 Claude 作为编排器,用于做出战术性参与决策——根据政治动机的人设,决定机器人是否应该点赞、分享、评论或忽略特定帖子。

行动细节

  • 规模: 该行动与多个国家和语言的数万个真实社交媒体账号进行了互动。
  • 策略: Claude 被用于创建并维持一致的政治人设,生成符合逻辑的回复,并为图像生成工具创建提示词。
  • 目标: 该参与者专注于持续、长期的参与,以推广温和的政治观点,而非试图实现病毒式传播。
  • 归属分析: 虽然叙事内容与国家背景的活动一致,但 Anthropic 尚未确认具体的归属分析。

AI 赋能的网络攻击与诈骗能力

Anthropic 识别出三个不同的案例,在这些案例中,AI 被用于降低恶意活动的技术门槛或增强现有的攻击向量。

凭据抓取与 IoT 访问

一名复杂的参与者利用 Claude 开发工具,用于抓取与安全摄像头相关的泄露用户名和密码。该参与者整合了商业泄露数据平台和私人窃取日志社区,以识别目标。Claude 被用于重写开源抓取工具包,创建用于目标 URL 提取的脚本,并改进后端搜索功能。Anthropic 尚未确认这些能力是否已成功部署。

招聘诈骗与语言净化

一项针对东欧国家求职者的行动利用 Claude 进行“实时语言净化”。通过提交语法不佳、非母语的英语文本并要求 Claude 将其改写为母语者的表达方式,参与者提高了其诈骗行为的感知合法性。Claude 还被用于开发具有说服力的招聘叙事和面试场景。Anthropic 尚未确认这些诈骗是否已成功部署。

面向新手参与者的恶意软件开发

Anthropic 观察到一名编程技能有限的新手参与者利用 Claude 快速开发复杂的恶意工具。该参与者的工具包从基础脚本演变为一套高级套件,其功能包括人脸识别、暗网扫描以及用于生成旨在规避安全控制的不可检测恶意负载的图形用户界面(GUI)。Anthropic 尚未确认该恶意软件在现实世界中的部署情况。

检测与缓解框架

Anthropic 采用多层级的智能计划来识别绕过标准规模化检测的危害。公司利用分类器(用于评估用户输入和模型响应)与先进的分析技术相结合的方式。

技术分析方法

为了分析大量的对话数据并识别滥用模式,Anthropic 应用了其研究中的技术,特别是:

  • Clio: 一种用于检测滥用模式的工具。
  • Hierarchical Summarization: 一种用于大规模监控和分析数据的方法。

在检测到这些活动后,Anthropic 封禁了相关账号,并将从这些案例中获得的经验整合到其更广泛的控制集中,以改进未来的检测与预防。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch