Gemini 3.5 Flash: 速度提升 vs. '稳定' AI 的成本

Google 发布 Gemini 3.5 Flash 标志着向高速、稳定推理的战略转型。虽然该模型旨在弥合“闪电”效率与前沿智能之间的差距,但开发者社区的反应呈现两极分化。讨论的重点已从对原始智能的争论转向了对每秒 Token 数 (TPS) 和智能体工作流 (agentic workflows) 经济可行性的务实关注。

速度与智能的权衡

对于许多开发者来说,Gemini 3.5 Flash 的主要吸引力在于其响应速度。在一个“深度思考实验”往往让位于用户界面流畅度的时代,3.5 Flash 的速度是一个显著的吸引点。一些用户报告称,与竞争对手相比,延迟有了大幅改善,平均响应时间显著低于 GPT-5 系列模型。

然而,这种速度是有代价的。虽然对于“闪电”级模型而言,其原始智能很高,但一些用户注意到工具使用能力的退化。正如一位观察者所言:

"Google 的问题一直在于产品化和工具使用,而原始智能始终具有竞争力。看起来他们这次发布并没有解决这个问题。"

价格争议:新的基准?

此次发布中最具争议的点在于定价。许多用户指出,与之前的 Flash 预览版相比,价格上涨了 3 倍。这引发了关于 AI “廉价推理”承诺的辩论。

对于利用多模型工作流的开发者来说——即由一个快速模型处理脚手架 (scaffolding),而由一个前沿模型处理正确性——这次价格上涨破坏了单位经济效益。当一个“快速迭代”模型的成本接近 Claude Sonnet 等高端模型时,使用 Flash 模型 的战略意义就会减弱。

行业观察者认为,这可能是一个信号,表明 Google 正在为定价建立一个“长期底线”,从预览阶段使用的激进补贴转向稳定利润率。

技术推测与性能

虽然 Google 对模型的内部细节保持不透明,但社区已尝试对其架构进行逆向工程。基于 TPU 8i 硬件约束和推理速度,一些专家推测该模型总参数量约为 250-300B,其中活跃参数量为 10-16B,可能利用了 FP4 和 FP8 精度混合使用以优化内存带宽。

尽管有这些技术优化,实际性能表现仍然参差不齐:

  • Agentic SQL: 一些基准测试表明,3.5 Flash 在特定的结构化数据任务中,表现可能实际上不如之前的版本,如 3.1 Flash Lite。
  • Vision Capabilities: 与 Antigravity 等工具的集成显示出了潜力,特别是在使用视觉能力自动重命名和分类非结构化资产方面,这表明 IDE 侧边栏可以进化到超越简单的代码生成。
  • Stability: 与之前的版本不同,Google 将此版本标记为“稳定版”,这表明其正从实验性迭代转向生产级可靠性。

竞争格局

此次发布正值美国前沿实验室和新兴的中国模型竞争激烈的时期。美国市场感知的价格上涨导致一些开发者开始转向 DeepSeek 和 Qwen,将其作为在输出 Token 占主导地位的智能体工作流中更具成本效益的替代方案。

对于 Google 的产品化也存在着挥之不去的怀疑。虽然 Google 的生态系统全栈集成提供了巨大的战略优势,但批评者认为,该公司已将“前沿”领先地位让给了 OpenAI 和 Anthropic,而转而专注于分发和消费者搜索集成。

总结

对于那些优先考虑延迟和稳定性的人来说,Gemini 3.5 Flash 是一个强大的工具。然而,随之而来的成本增加为 AI 初创公司敲响了警钟:认为模型成本会单调递减的假设可能是一个谬误。随着行业的成熟, “廉价推理”时代可能正在向“可持续利润率”时代过渡,迫使开发者重新思考他们的模型编排策略。

Sources