Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber 发布
Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber 发布
Google 扩展 Gemini Flash 系列以支持智能体工作流
Google 推出了三款新模型——Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber——旨在优化生产级 AI 智能体(agents)的效率、延迟和可靠性。这些发布的主要重点是在保持或提高编程和知识工作性能的同时,降低多步智能体工作流的成本和 token 开销。
Gemini 3.6 Flash:提高效率与质量
Gemini 3.6 Flash 作为主要的“主力”模型,提供比其前身 3.5 Flash 更好的编程和多模态性能,同时消耗更少的资源。
关键性能提升
- Token 效率: 根据 Artificial Analysis Index,3.6 Flash 与 3.5 Flash 相比,输出 token 使用量减少了 17%。在 DeepSWE 等特定基准测试中,token 减少量高达 65%。
- 编程与研究: 该模型表现出更高的精度,且产生的多余代码编辑更少。它在 DeepSWE 上达到了 49%(3.5 Flash 为 37%),在 MLE Bench 上达到了 63.9%(3.5 Flash 为 49.7%)。
- 计算机使用能力: 3.6 Flash 提升了计算机使用能力,在 OSWorld-Verified 上得分 83.0%,而 3.5 Flash 为 78.4%。计算机使用能力现在已通过 Gemini API 和 Gemini Enterprise 作为内置的客户端工具集成。
- 知识工作: 该模型在 GDPval-AA v2 上优于 3.5 Flash(1421 对比 1349)。
价格与安全
3.6 Flash 的定价为 $1.50 每 1M 输入 tokens 和 $7.50 每 1M 输出 tokens,这比 3.5 Flash 更便宜。它还包含增强的 Frontier Safety 防护措施,以抵御 CBRN(化学、生物、放射性和核能)和网络攻击领域的越狱尝试。
Gemini 3.5 Flash-Lite:高吞吐量扩展
Gemini 3.5 Flash-Lite 是 3.5 系列中最快的模型,针对低延迟任务和高吞吐量工作负载(如智能体搜索和文档处理)进行了优化。
速度与性能
- 延迟: 根据 Artificial Analysis,该模型每秒可交付 350 个输出 tokens。
- 智能体能力: 3.5 Flash-Lite 在各种基准测试中表现优于 3.1 Flash-Lite,包括 Terminal-Bench 2.1(54% 对比 31%)和 GDM-MRCR v2(72.2% 对比 60.1%)。
- 与 Flash 的对比: 在某些编程和智能体评估中,3.5 Flash-Lite 表现优于 3 Flash,特别是在 SWE-Bench Pro(54.2% 对比 49.6%)和 OSWorld-Verified(74.0% 对比 65.1%)。
价格
3.5 Flash-Lite 的定价为 $0.3 每 1M 输入 tokens 和 $2.5 每 1M 输出 tokens。
Gemini 3.5 Flash Cyber and CodeMender
Gemini 3.5 Flash Cyber 是一款专门为检测和修复网络安全漏洞而微调的专用模型。它被部署在 CodeMender 中,这是一个使用多个 Cyber 智能体来生成安全报告的智能体基础设施。
由于网络安全 AI 的双重用途性质,3.5 Flash Cyber 并不向公众开放。它仅通过有限访问的试点计划向政府和受信任的合作伙伴开放。
未来路线图:Gemini 3.5 Pro 和 Gemini 4
Google 确认 Gemini 3.5 Pro 目前正在与合作伙伴进行测试,并将很快实现广泛可用。此外,该公司已开始为 Gemini 4 进行预训练,据称这是他们迄今为止最具雄心的预训练任务。
社区洞察与开发者反馈
Hacker News 上的开发者反应突显了模型技术速度与 Google 产品执行力之间的分歧。
性能与价值
一些用户称赞 Flash 系列在迭代开发和高吞吐量任务中的速度和实用性。一位开发者指出,3.5 Flash 在前端工作方面比竞争对手更有效。然而,其他人认为这些模型正落后于其他实验室的新版本,一些人引用 Laguna S 2.1 作为 Flash-Lite 的更优替代方案。
价格问题
对于“Lite”模型的定价轨迹,存在显著的批评。几位用户指出,各版本间的成本在稳步上升:
"Gemini 2.5 Flash-Lite has been my go to for cheap document processing... but they are really boiling the frog with pricing increases with each version... 3.5-flash-lite: $0.30 input / $2.50 output (a 6.25x increase over 2.5!)"
产品生态系统摩擦
用户对 Google 的命名规范和其 AI 平台(Vertex AI, AI Studio, Gemini Enterprise, 和 Antigravity)的碎片化性质表示不满。
"Their naming scheme is confusing... This plus the Vertex, AI Studio, Gemini, Antigravity. It's honestly too confusing to use. I need to use Gemini just to decide on which platform and which model to consider."
其他开发者报告了 Antigravity IDE 的问题以及在没有明确迁移路径的情况下废弃旧订阅的问题。