Gemini 3.5 Flash 发布说明 / 新功能

Google DeepMind 推出了 Gemini 3.5,这是一系列专为执行复杂、具代理性的工作流而设计的模型。该系列的首个发布版本 Gemini 3.5 Flash 针对编码和代理执行中的高速、长时程任务进行了优化,在提供前沿水平性能的同时,避免了大型旗舰模型常见的高延迟。

Gemini 3.5 Flash 性能与基准测试

Gemini 3.5 Flash 在保持 Flash 系列高速输出的同时,提供了与大型旗舰模型相当的智能水平。其每秒输出 token 数是其他前沿模型的 4 倍。

关键性能基准包括:

  • Terminal-Bench 2.1:76.2%
  • GDPval-AA:1656 Elo
  • MCP Atlas:83.6%
  • CharXiv Reasoning(多模态理解):84.2%

在这些指标上,3.5 Flash 超越了 Gemini 3.1 Pro,成为 Google 迄今为止最强的代理和编码模型。

代理能力与工作流自动化

Gemini 3.5 Flash 旨在处理需要快速规划、构建和迭代的长时程代理任务。通过缩短维护代码库、开发应用或准备财务文档等复杂任务所需的时间,它能够在极短的时间内完成工作,且成本不到其他前沿模型的一半。

在与更新后的 Antigravity 框架集成后,3.5 Flash 可以部署协作子代理,在监督下执行多步骤工作流和编码任务。

集成与实际应用

Gemini 3.5 Flash 现已成为全球 Gemini 应用和 Google Search 中 AI 模式的默认模型。它还驱动了多项新功能:

  • Gemini Spark:一款 24/7 运行的个人 AI 代理,帮助用户在数字生活中导航并代为行动。目前正向受信任的测试者开放,计划下周向美国的 Google AI Ultra 订阅者推出 Beta 版。
  • Search Information Agents:新型 24/7 运行的代理,提供更智能的体验和动态生成的 UI。
  • Enterprise Automation:银行和金融科技公司使用该模型自动化数周的工作流,数据科学团队则利用它从复杂数据环境中提取洞见。

安全性与防护措施

Gemini 3.5 采用 Frontier Safety Framework 开发。模型强化了网络安全和 CBRN(化学、生物、放射性和核)防护,以降低有害内容的生成并减少对安全查询的误拒。这些改进源自先进的安全训练和可解释性工具,使开发者能够在响应生成前分析 AI 的内部推理过程。

可用性

Gemini 3.5 Flash 已通过以下平台普遍可用:

  • 面向开发者:Google Antigravity、Google AI Studio 中的 Gemini API,以及 Android Studio。
  • 面向企业:Gemini Enterprise Agent Platform 和 Gemini Enterprise。
  • 面向普通用户:Gemini 应用和 Search 中的 AI 模式。

Google DeepMind 还宣布,Gemini 3.5 Pro 目前正处于内部使用阶段,预计下月发布。

Sources