Gemini 3.5 Flash Cyber 版本說明
Gemini 3.5 Flash Cyber 版本說明
Google DeepMind 已發布 Gemini 3.5 Flash Cyber,一種輕量級模型,專門針對尋找、驗證與修補軟體漏洞進行微調。透過將效率與速度置於原始模型大小之上,該模型使防禦者能夠比使用較大且成本更高的模型更快速地掃描更大的程式碼基礎並分析更多執行路徑。
高效率漏洞發現
Gemini 3.5 Flash Cyber 解決了程式碼安全中的「搜尋空間問題」,即發現深層缺陷需要探索龐大數量的執行路徑。由於該模型輕量且成本低廉,像 CodeMender 這樣的代理可以多次調用它,以在產出單一高品質報告之前分析遠更多的程式碼路徑。
此架構使得模型可整合至:
- 頻繁的安全掃描
- 對時間敏感的發布流程
- 大規模的提交掃描管道
效能基準測試
Gemini 3.5 Flash Cyber 在數項專門評估中展現出與較大模型競爭力的效能:
CyberGym 基準測試
在 CyberGym 基準測試中,該測試評估 AI 代理針對真實世界軟體漏洞的表現,CodeMender 設定為針對單一報告最多呼叫五次 3.5 Flash Cyber,其效能與顯著較大的模型具有競爭力。
Big Sleep 評估
在 Google Big Sleep 團隊進行的獨立評估中,該團隊專注於 Chrome 和 Safari 等複雜程式碼基礎中的關鍵漏洞,3.5 Flash Cyber 的效能顯著超越了主線 3.5 Flash 和 3.6 Flash 模型。
Chrome 生產提交掃描
在 Google Chrome 生產提交掃描管道的測試中,3.5 Flash Cyber 比 3.5 Flash 顯示出顯著的提升。報告指出,較新的競爭對手模型( post-Opus 4.6 )因內建的安全防護機制而拒絕執行任務。
V8 JavaScript 引擎測試
在 V8 JavaScript 引擎的測試中,3.5 Flash Cyber 在固定次數的調用中發現了 55 個獨特且已確認的問題,而主線 3.5 Flash 發現了 47 個,Claude Opus 4.6 發現了 36 個。其中包括其他兩種模型均未發現的 10 個問題。
實際應用與部署
Gemini 3.5 Flash Cyber 已經在 Google 內部的程式碼基礎中使用,包括 Android、Chrome、Cloud、Ads 和 YouTube。
在一個案例中,Google Cloud 漏洞研究團隊使用該模型在兩個小時內發現了公開 API 中的遠端程式碼執行漏洞以及敏感生產服務中的記憶體損壞漏洞。該模型隨後產生了一個 100% 可靠的遠端程式碼執行惡意利用,該惡意利用繞過了標準緩解措施,例如地址空間配置隨機化(ASLR)和寫入 XOR 執行(W^X)。
存取與可用性
基於該技術的雙用途特性,Google 正透過限制存取的試點計畫部署 3.5 Flash Cyber。該模型將僅透過 CodeMender 提供給政府和可信任的合作夥伴使用。
此外,CodeMender 的基礎功能正透過 Gemini Enterprise Agent Platform 向客戶普遍提供。