恶意软件作者利用 LLM 安全护栏来规避 AI 安全扫描器

恶意软件开发人员现在正将与核武器和生物武器相关的文本嵌入到他们的间谍软件中,以触发大语言模型 (LLM) 的安全拒绝。这种技术利用了 AI 安全扫描器的激进护栏,导致模型拒绝分析代码,从而使恶意软件能够绕过自动检测。

LLM 安全护栏作为攻击向量

AI 模型中激进的安全拒绝会产生攻击者可以武器化的二阶盲点。当由 LLM 驱动的安全扫描器遇到禁止的内容——例如生物或核武器的指令或提及——模型被编程为完全拒绝请求,而不是过滤特定的禁止文本。如果扫描器的流水线没有设计为将拒绝视为恶意信号,这种“失效开放 (fail-open)”漏洞就会允许恶意软件保持未被分析的状态。

对 AI 驱动的安全流水线的启示

这种策略的出现凸显了在恶意软件分析流水线中进行有意图设计以防止提示词操纵的关键需求。安全专业人员和开发人员注意到了几个关键考虑因素:

拒绝作为恶意信号

一些专家认为,如果 AI 辅助扫描器触及了安全护栏,代码应该被自动标记为恶意。因为合法软件很少包含有关核武器制造的引用,LLM 的拒绝实际上是一个明确的信号,表明正在发生某些不法行为。

“失效开放”设计的风险

存在一种风险,即自动化流水线可能被配置为“失效开放”,这意味着如果 AI 无法分析文件,它就会被直接通过。一位贡献者指出,这种方法已经成功地将恶意代码推送到某些环境中。

多阶段分析流水线

为了减轻这些盲点,有人建议采用分层分析方法。这将涉及使用一个廉价的开源模型来首先标记潜在的 LLM 拒绝内容,然后再将代码传递给一个主要的、受限程度更高的 LLM 进行更深入的安全检查。

关于 AI 护栏的社区辩论

这种规避技术的发现引发了关于严格 AI 护栏的有效性和必要性的更广泛辩论。

护栏的效用

一些批评者认为,激进的护栏往往会阻碍合法的技术工作,并通过为攻击者提供可预测的盲点而制造更多危险。他们建议,移除这些限制将使模型对于需要处理复杂、潜在恶意数据的网络安全专业人员更有用。

核武器/生物武器限制的可行性

其他社区成员质疑限制核武器或生物武器信息的价值,并指出此类信息通常已经可以通过传统的搜索引擎或历史文献获得。

"了解如何开发一种武器并不是一个封闭的秘密,但如果不让全世界都知道,秘密进入是无法实现的。"

技术风险摘要

风险 机制 影响
提示词操纵 嵌入禁止的关键词以触发拒绝 绕过基于 AI 的静态分析
二阶盲点 过度索引一阶安全 在安全覆盖范围中制造可预测的缺口
分析失败 LLM 拒绝处理输入 在自动化流水线中导致“失效开放”场景

Sources