Gemini 3.7 Flash 发布说明
Google 发布了 Gemini 3.7 Flash,这是一款专为软件工程、智能体任务和复杂知识工作设计的“主力”模型。此次发布重点在于提升复杂工作流的智能水平,同时通过入门级定价模型显著降低开发者的成本。
代码编写与 Web 开发中的性能提升
与前代模型 3.6 Flash 相比,Gemini 3.7 Flash 在代码生成和调试方面表现出实质性的改进。正如以下基准测试所示,它实现了更高的首次通过准确率,并在生成生产就绪代码方面表现出更好的性能:
- FrontierCode 1.1 Main: 43.6% (高于 3.6 Flash 的 34.4%)。
- DeepSWE v1.1: 65.3% (高于 3.6 Flash 的 49.0%)。
- WebDev Arena (Arena.ai): Elo 分数为 1588 (高于 1538)。
在 Web 开发中,该模型在从截图或设计系统生成布局时提供了更高的设计遵循度,从而能够以更少的提示词生成功能更完整的应用程序。
推理与知识工作
对于法律、金融和生物科学等知识密集型领域,Gemini 3.7 Flash 提高了推理和文档处理的准确性。关键基准测试的改进包括:
- GDP.pdf: 34.0% (高于 3.6 Flash 的 22.0%),测试处理复杂文档的能力。
- AutomationBench: 30.4% (高于 3.6 Flash 的 17.0%),衡量完成真实业务工作流的有效性。
开发者体验与定价
Gemini 3.7 Flash 的设计旨在多步规划和工具调用方面更加严谨,从而减少了对手动监督和重试的需求。
定价结构
Google 已为 3.7 Flash 引入了临时促销价格(并追溯应用于 3.6 Flash),有效期至 2026 年 12 月 31 日:
- 入门价格: 每 1M 输入 token / 每 1M 输出 token 分别为 $0.75 / $3.75。
- 标准价格 (从 2027 年 1 月 1 日开始): 每 1M 输入 token / 每 1M 输出 token 分别为 $1.50 / $7.50。
与 Gemini Spark 的集成
Gemini Spark 是面向 Google AI Pro 和 Ultra 订阅者的 24/7 个人 AI 智能体,现在已采用 Gemini 3.7 Flash。此次更新增强了 Spark 在 Google Workspace 内处理复杂、多技能工作流的能力,例如整合文件、起草邮件和更新状态文档。
社区反馈与市场定位
Hacker News 上的开发者讨论突显了基准测试性能与现实世界中的“体感”和可靠性之间的分歧。
速度与多模态
用户一致称赞该模型的速度和端到端响应时间,并将其视为与 Claude 等竞争对手的主要区别点。
竞争压力
几位开发者认为,竞争模型的定价和性能——特别是 GPT-5.6 Luna 和 DeepSeek V4 Flash——削弱了 Gemini 3.7 Flash 的价值主张。
"Luna is much cheaper which feels like it undercuts the need for Flash... I feel like differentiation at the mid-tier of models is pretty difficult."
可靠性与幻觉问题
部分用户报告称,尽管基准测试有所提升,但该模型在工具调用中仍存在幻觉问题,并且在某些特定测试用例中表现出生成无法运行的代码的倾向。
"I've been investing time into making system prompts and input prompts more meticulous, but the fundamental 'it will make shit up' problem still remains."
可用性
- Developers: 可通过 Google AI Studio, Android Studio, 和 Google Antigravity 使用。
- Enterprises: 可通过 Gemini Enterprise Agent Platform 和 Gemini Enterprise app 使用。
- Individuals: 可通过支持国家/地区的 Gemini app 中的 Gemini Spark 使用。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch