DeepSeek v4.1 Flash 黑客攻击性能分析
DeepSeek v4.1 Flash 在 Enclave AI 黑客攻击基准测试中取得了满分,成功在所有 11 个存在漏洞的目标上获取了代码执行权限,同时未能攻破任何四个已修复的控制项。该模型展现了极高的成本效益,由于大量依赖输入缓存,被接受的运行成本仅为 4.65 美元。
高效攻击执行
DeepSeek v4.1 Flash 在约 2 小时 38 分钟的模型活跃时间内,使用 2,349 条 Bash 命令完成了基准测试。成功运行的中位耗时为 4 分 38 秒。
成本效益得益于缓存机制:在处理的 2.683 亿个输入令牌中,有 2.662 亿个被缓存,这将被接受运行的总成本降低至 4.65 美元(包含失败尝试则为 5.14 美元)。
攻击向量分析
对攻击路径的审计显示,DeepSeek v4.1 Flash 利用了测试环境中既有的预期漏洞以及替代路径。
Jenkins:复杂逻辑与时序攻击
DeepSeek 成功执行了针对 Jenkins 目标的计划攻击。在一个实例中,它通过创建一个指向第二个文件的文件来绕过安全边界,从而读取私有控制器凭据并通过内置脚本工具执行代码。在另一个涉及文件上传期间时序问题的挑战中,该模型成功地在上传一个字节后暂停上传,更改了目标位置,并完成上传以将脚本写入受保护的位置。
Nextcloud:访问控制绕过
DeepSeek 通过识别 Nextcloud 如何记忆访问决策中的错误,展示了强大的源代码分析能力。该模型为读取请求创建了一个已批准的访问结果,然后将该结果复用于写入请求以替换 PHP 模板,从而导致代码执行。
Grafana:非计划路径发现
在 Grafana 挑战中,DeepSeek 始终发现了一条更短的非计划路径。它没有遵循预期的文件路径处理问题,而是将可执行文件放置在临时插件文件夹中,并要求 Grafana 将该文件夹作为插件加载。这使得模型能够在所有三次运行中在 90 秒内获得执行权限。
基准测试影响与模型行为
DeepSeek v4.1 Flash 的表现凸显了基于结果的评分与路径级审计之间的关键区别。虽然该模型得分为 11/11,但只有六次运行遵循了计划的攻击路径。五次运行利用了特定于私有基准测试环境的替代路径。
这种行为表明,黑客代理优先选择最快可行的路径,而非预期路径。因此,Enclave AI 已更新基准测试以关闭这些额外路径,并对攻击路径实施更严格的检查,以确保模型针对特定漏洞进行测试。
社区与技术视角
围绕该模型性能的技术讨论提供了对其智能体能力与其他前沿模型相比的细致看法。
“由于它是一个重型推理模型,它在帕累托前沿上接近 Gemini 3.7 Flash……在智能体编码方面,比预期更接近顶级开放权重模型(GLM 5.3 和 Kimi K3),且成本更低。”
一些用户报告称,在实际应用中结果喜忧参半。虽然一些人发现它“对于驱动那些以前需要像 Claude Opus 这样的大型模型才能完成的工作来说令人难以置信”,但其他人指出,与 GLM 5.3 等模型相比,该模型偶尔会陷入循环或在处理高度复杂、非显而易见的漏洞时遇到困难。具体而言,一位用户指出,虽然 DeepSeek v4.1 Flash 在具有“低垂果实”的目标上表现良好,但与 GLM 5.3 相比,它在处理完全注释的 3DS 内核反编译时表现得更吃力。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch