Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber 發佈
Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber 發佈
Google 擴展 Gemini Flash 系列以支援代理工作流
Google 推出了三款新模型——Gemini 3.6 Flash、3.5 Flash-Lite 以及 3.5 Flash Cyber——旨在優化生產環境中 AI 代理(agents)的效率、延遲與可靠性。這些發佈的主要重點在於降低多步驟代理工作流的成本與 token 消耗,同時在程式碼編寫與知識工作方面維持或提升效能。
Gemini 3.6 Flash:提升效率與品質
Gemini 3.6 Flash 作為主要的「主力」模型,提供比前代 3.5 Flash 更佳的程式碼編寫與多模態效能,同時消耗更少的資源。
關鍵效能增益
- Token 效率: 根據 Artificial Analysis Index,3.6 Flash 與 3.5 Flash 相比,減少了 17% 的輸出 token 使用量。在 DeepSWE 等特定基準測試中,token 減少量甚至高達 65%。
- 程式碼編寫與研究: 該模型展現了更高的精準度,且減少了不必要的程式碼修改。它在 DeepSWE 上達到了 49%(3.5 Flash 為 37%),在 MLE Bench 上達到了 63.9%(3.5 Flash 為 49.7%)。
- 電腦使用能力: 3.6 Flash 提升了電腦使用能力,在 OSWorld-Verified 上獲得 83.0% 的分數,而 3.5 Flash 為 78.4%。電腦使用功能現在已透過 Gemini API 與 Gemini Enterprise 整合為內建的用戶端工具。
- 知識工作: 該模型在 GDPval-AA v2 上表現優於 3.5 Flash(1421 對比 1349)。
定價與安全性
3.6 Flash 的定價為 每 1M input tokens 為 $1.50,每 1M output tokens 為 $7.50,比 3.5 Flash 更便宜。它還包含了增強的 Frontier Safety 防護措施,以抵禦 CBRN(化學、生物、放射性與核能)及網路攻擊領域的越獄行為。
Gemini 3.5 Flash-Lite:高吞吐量擴展
Gemini 3.5 Flash-Lite 是 3.5 系列中最快的模型,針對低延遲任務與高吞吐量工作負載(如代理搜尋與文件處理)進行了優化。
速度與效能
- 延遲: 根據 Artificial Analysis,該模型每秒可提供 350 個輸出 token。
- 代理能力: 3.5 Flash-Lite 在多項基準測試中表現優於 3.1 Flash-Lite,包括 Terminal-Bench 2.1(54% 對比 31%)以及 GDM-MRCR v2(72.2% 對比 60.1%)。
- 與 Flash 的比較: 在某些程式碼編寫與代理評估中,3.5 Flash-Lite 表現優於 3 Flash,特別是在 SWE-Bench Pro(54.2% 對比 49.6%)以及 OSWorld-Verified(74.0% 對比 65.1%)。
定價
3.5 Flash-Lite 的定價為 每 1M input tokens 為 $0.3,每 1M output tokens 為 $2.5。
Gemini 3.5 Flash Cyber 與 CodeMender
Gemini 3.5 Flash Cyber 是一款專為偵測與修補網路安全漏洞而微調的專業模型。它被部署於 CodeMender 中,這是一個使用多個 Cyber 代理來生成安全報告的代理基礎設施。
由於網路安全 AI 的雙重用途性質,3.5 Flash Cyber 並非對大眾開放。它僅透過有限存取的試點計畫,提供給政府與受信任的合作夥伴。
未來發展藍圖:Gemini 3.5 Pro 與 Gemini 4
Google 確認 Gemini 3.5 Pro 目前正與合作夥伴進行測試,並將於近期廣泛開放使用。此外,該公司已開始為 Gemini 4 進行預訓練,並被描述為迄今為止最具野心的預訓練任務。
社群洞察與開發者回饋
Hacker News 上的開發者反應顯示,模型技術速度與 Google 的產品執行力之間存在分歧。
效能與價值
部分使用者讚賞 Flash 系列在迭代開發與高容量任務中的速度與實用性。一位開發者指出,3.5 Flash 在前端工作方面比競爭對手更有效率。然而,其他人則認為模型正落後於其他實驗室的新發佈產品,有人引用 Laguna S 2.1 作為 Flash-Lite 的更優替代方案。
定價疑慮
對於「Lite」模型的定價趨勢存在顯著批評。幾位使用者指出各版本間的成本持續增加:
"Gemini 2.5 Flash-Lite 曾是我處理廉價文件處理的首選... 但他們在定價上真的在玩『煮青蛙』策略,每個版本都在漲價... 3.5-flash-lite: $0.30 input / $2.50 output (比 2.5 版本漲了 6.25 倍!)"
產品生態系統摩擦
使用者對 Google 的命名慣例與其 AI 平台(Vertex AI, AI Studio, Gemini Enterprise, 以及 Antigravity)的碎片化現狀表示沮喪。
"他們的命名方案很混亂... 加上 Vertex, AI Studio, Gemini, Antigravity。說實話,用起來太混亂了。我需要先用 Gemini 來決定要考慮哪個平台與哪個模型。"
其他開發者回報了 Antigravity IDE 的問題,以及在沒有明確遷移路徑的情況下停用先前訂閱的問題。