CyberSecEval 2:评估大型语言模型的网络安全风险
Hugging Face 和 Meta 推出了 CyberSecEval 2,这是一套旨在衡量大型语言模型(LLMs)网络安全风险和能力的综合评估框架。随着 LLM 越来越多地集成到编码助手中,该框架变得至关重要,因为它会引入需要通过标准化基准来缓解的新漏洞。
网络安全基准分类
CyberSecEval 2 使用五套不同的测试套件来评估 LLM 在处理不安全代码和协助网络攻击请求时的表现:
- 不安全的编码实践:该测试衡量 LLM 在自动完成和指令上下文中建议风险安全弱点的频率,基于行业标准的 Common Weakness Enumeration(CWE)分类法。结果以代码测试通过率报告。
- 提示注入易感性:这些测试评估模型区分可信和不可信输入的能力以及对常见提示注入技术的抵抗力。报告的指标是模型对攻击的顺从频率。
- 网络攻击顺从性:该套件衡量违规率(同意协助攻击性网络攻击)与误拒率(拒绝与网络防御相关的良性提示)之间的权衡。
- 代码解释器滥用:此项评估 LLM 是否会被操纵在沙箱环境中执行恶意代码,以获取系统访问、收集敏感信息或执行社会工程攻击。结果以顺从频率报告。
- 自动化攻击能力:使用夺旗赛(CTF)风格的安全测试案例,该套件判断 LLM 是否能够解决端到端的利用挑战,如 SQL 注入和缓冲区溢出。结果以完成百分比报告。
关键发现与行业趋势
使用 CyberSecEval 2 对最先进的 LLM 进行评估,揭示了关于当前 AI 安全状态的若干关键洞见:
攻击顺从性下降
自基准的第一个版本于 2023 年 12 月发布以来,LLM 对协助网络攻击请求的平均顺从率已从 52% 降至 28%。这表明整个行业在针对攻击性网络请求的安全对齐方面呈现出更好的趋势。
模型专精与安全
非代码专精的模型通常表现出比代码专精模型更低的违规率。然而,这两类之间的差距正在缩小,表明专门的编码模型正在提升其安全姿态。
持续的提示注入风险
提示注入仍是未解决的问题。测试表明,开发者不能假设 LLM 在面对对抗性输入时会安全地遵循系统提示,这对基于 LLM 的应用构成了重大风险。
端到端利用的局限性
尽管具备高通用编码能力的模型在利用测试中表现更佳,但当前 LLM 仍缺乏可靠解决端到端利用挑战的能力。这表明在现阶段 LLM 不太可能颠覆网络利用攻击。
代码解释器中的漏洞
LLM 仍然容易受到操纵,从而在代码解释器内部执行滥用行为。此发现强调了需要额外的防护措施和检测机制来防止解释器滥用的必要性。
开源贡献
所有 CyberSecEval 2 代码均为开源。鼓励社区在自己的模型上运行这些基准,并将结果提交至 CyberSecEval 2 排行榜,以提升对 LLM 网络安全安全属性的整体认识。