Gemini 3.5 Flash Cyber 发布说明
Gemini 3.5 Flash Cyber 发布说明
Google DeepMind 已发布 Gemini 3.5 Flash Cyber,这是一个专门用于查找、验证和修补软件漏洞的轻量级模型,经过微调。通过优先考虑效率和速度而非原始模型大小,该模型使防御者能够比使用更大、更昂贵的模型更快地扫描更大的代码库并分析更多的执行路径。
高效漏洞发现
Gemini 3.5 Flash Cyber 解决了代码安全中的“搜索空间问题”,即发现深层缺陷需要探索巨量的执行路径。由于该模型轻量且价格亲民,像 CodeMender 这样的代理可以多次调用它,在生成单份高质量报告之前分析大量更多的代码路径。
此架构使得该模型可以集成到:
- 频繁的安全扫描
- 对时间敏感的发布流程
- 大规模的提交扫描管道
性能基准
Gemini 3.5 Flash Cyber 在多项专门评估中展示了与更大模型相当的性能:
CyberGym 基准
在 CyberGym 基准测试中,该基准用于评估 AI 代理针对真实世界软件漏洞的表现,CodeMender 配置为对单份报告最多调用五次 3.5 Flash Cyber,其性能与显著更大的模型相当。
Big Sleep 评估
在 Google Big Sleep 团队对 Chrome 和 Safari 等复杂代码库中的关键漏洞进行的独立评估中,3.5 Flash Cyber 的性能显著超过了主线 3.5 Flash 和 3.6 Flash 模型。
Chrome 生产提交扫描
在 Google Chrome 生产提交扫描管道的测试中,3.5 Flash Cyber 相比 3.5 Flash 显示出显著提升。报告指出,更近期的竞争对手模型( post-Opus 4.6 )由于内置的安全防护机制而拒绝执行任务。
V8 JavaScript Engine 测试
在 V8 JavaScript Engine 上进行测试时,3.5 Flash Cyber 在固定次数的调用中发现了 55 个独特的确认问题,而主线 3.5 Flash 发现了 47 个,Claude Opus 4.6 发现了 36 个。其中包括其他两种模型均未识别出的 10 个问题。
实际应用与部署
Gemini 3.5 Flash Cyber 已在 Google 内部代码库中使用,包括 Android、Chrome、Cloud、Ads 和 YouTube。
例如,Google Cloud 漏洞研究团队在两小时内使用该模型发现了公共 API 中的远程代码执行漏洞以及敏感生产服务中的内存损坏漏洞。随后,该模型生成了一个 100% 可靠的远程代码执行利用程序,该利用程序绕过了诸如地址空间布局随机化(ASLR)和写入 XOR 执行(W^X)之类的标准缓解措施。
访问与可用性
由于该技术具有双用途性质,Google 正通过有限访问的试点计划部署 3.5 Flash Cyber。它将仅通过 CodeMender 面向政府和可信合作伙伴提供。
此外,CodeMender 的基础能力正通过 Gemini Enterprise Agent Platform 面向客户普遍提供。