Gemini 3.7 Flash 发布说明

Google 发布了 Gemini 3.7 Flash,这是一款专为软件工程、智能体任务和复杂知识工作设计的“主力”模型。此次发布重点在于提升复杂工作流的智能水平,同时通过入门级定价模型显著降低开发者的成本。

代码编写与 Web 开发中的性能提升

与前代模型 3.6 Flash 相比,Gemini 3.7 Flash 在代码生成和调试方面表现出实质性的改进。正如以下基准测试所示,它实现了更高的首次通过准确率,并在生成生产就绪代码方面表现出更好的性能:

  • FrontierCode 1.1 Main: 43.6% (高于 3.6 Flash 的 34.4%)。
  • DeepSWE v1.1: 65.3% (高于 3.6 Flash 的 49.0%)。
  • WebDev Arena (Arena.ai): Elo 分数为 1588 (高于 1538)。

在 Web 开发中,该模型在从截图或设计系统生成布局时提供了更高的设计遵循度,从而能够以更少的提示词生成功能更完整的应用程序。

推理与知识工作

对于法律、金融和生物科学等知识密集型领域,Gemini 3.7 Flash 提高了推理和文档处理的准确性。关键基准测试的改进包括:

  • GDP.pdf: 34.0% (高于 3.6 Flash 的 22.0%),测试处理复杂文档的能力。
  • AutomationBench: 30.4% (高于 3.6 Flash 的 17.0%),衡量完成真实业务工作流的有效性。

开发者体验与定价

Gemini 3.7 Flash 的设计旨在多步规划和工具调用方面更加严谨,从而减少了对手动监督和重试的需求。

定价结构

Google 已为 3.7 Flash 引入了临时促销价格(并追溯应用于 3.6 Flash),有效期至 2026 年 12 月 31 日:

  • 入门价格: 每 1M 输入 token / 每 1M 输出 token 分别为 $0.75 / $3.75。
  • 标准价格 (从 2027 年 1 月 1 日开始): 每 1M 输入 token / 每 1M 输出 token 分别为 $1.50 / $7.50。

与 Gemini Spark 的集成

Gemini Spark 是面向 Google AI Pro 和 Ultra 订阅者的 24/7 个人 AI 智能体,现在已采用 Gemini 3.7 Flash。此次更新增强了 Spark 在 Google Workspace 内处理复杂、多技能工作流的能力,例如整合文件、起草邮件和更新状态文档。

社区反馈与市场定位

Hacker News 上的开发者讨论突显了基准测试性能与现实世界中的“体感”和可靠性之间的分歧。

速度与多模态

用户一致称赞该模型的速度和端到端响应时间,并将其视为与 Claude 等竞争对手的主要区别点。

竞争压力

几位开发者认为,竞争模型的定价和性能——特别是 GPT-5.6 Luna 和 DeepSeek V4 Flash——削弱了 Gemini 3.7 Flash 的价值主张。

"Luna is much cheaper which feels like it undercuts the need for Flash... I feel like differentiation at the mid-tier of models is pretty difficult."

可靠性与幻觉问题

部分用户报告称,尽管基准测试有所提升,但该模型在工具调用中仍存在幻觉问题,并且在某些特定测试用例中表现出生成无法运行的代码的倾向。

"I've been investing time into making system prompts and input prompts more meticulous, but the fundamental 'it will make shit up' problem still remains."

可用性

  • Developers: 可通过 Google AI Studio, Android Studio, 和 Google Antigravity 使用。
  • Enterprises: 可通过 Gemini Enterprise Agent Platform 和 Gemini Enterprise app 使用。
  • Individuals: 可通过支持国家/地区的 Gemini app 中的 Gemini Spark 使用。

Sources

相关