Gemini 3.1 Flash‑Lite 发布:面向大批量工作负载的高速、低成本 AI

TL;DR

Google DeepMind 宣布 Gemini 3.1 Flash‑Lite,作为 Gemini 3 系列中最快、最具成本效益的模型,现已通过 Gemini API、Google AI Studio 和 Vertex AI 以预览形式提供。它实现了最高 2.5 倍的首令牌延迟提升和 45% 的整体输出加速,费用为每 100 万输入代币 0.25 美元、每 100 万输出代币 1.50 美元,使大批量、实时应用变得负担得起。


Gemini 3.1 Flash‑Lite 是什么?

Gemini 3.1 Flash‑Lite 是面向高吞吐量开发者工作负载的全新多模态语言模型,属于 Gemini 3 系列,并被定位为该系列中 最快最具成本效益 的层级。

  • 可用性 – 该模型已在 Google AI Studio 的 Gemini API 中向开发者预览发布,并通过 Vertex AI 向企业开放。
  • 定价 – 输入代币每百万 0.25 美元,输出代币每百万 1.50 美元,仅为更大 Gemini 模型价格的一小部分。
  • 性能声明 – 根据 Artificial Analysis 基准,Flash‑Lite 产生首个答案代币的速度提升 2.5 倍,整体输出速度提升 45%,且质量相当或更佳。

速度与成本基准

公告提供了与竞争模型的量化对比:

模型 输入价格($/M) 输出价格($/M) 输出速度 ↑ 首令牌延迟 ↓
Gemini 3.1 Flash‑Lite 0.25 1.50 +45% 相较于 2.5 Flash 2.5× 更快相较于 2.5 Flash
Gemini 2.5 Flash‑Lite 0.30 1.80 基准 基准
GPT‑5 mini 0.40 2.10 更慢 更慢
Claude 4.5 Haiku 0.35 1.90 更慢 更慢
Grok 4.1 Fast 0.38 2.00 更慢 更慢

来源:博客文章中引用的 Artificial Analysis 基准图表。

质量指标

尽管侧重效率,Flash‑Lite 在主流 AI 排行榜上仍取得了强劲分数:

  • Arena.ai Elo 分数:1432,领先同层级其他模型。
  • GPQA Diamond(推理):86.9% 正确率。
  • MMMU‑Pro(多模态理解):76.8% 正确率,超越早期 Gemini 代系如 Gemini 2.5 Flash。

这些结果表明,Flash‑Lite 在降低延迟和成本的同时,仍保持高质量的推理和多模态能力。

自适应思考层级

Flash‑Lite 在 AI Studio 与 Vertex AI 中提供可配置的“思考层级”。开发者可以调节模型在一次请求上投入的计算量,以在速度与推理深度之间取得平衡。这种灵活性对既有简单高频任务(如批量翻译、内容审核)又有复杂指令密集任务(如 UI 生成、仿真构建)的工作负载尤为关键。

示范用例

博客展示了若干基于 Flash‑Lite 的实时应用案例:

  • 电商线框填充 – 能在瞬间为数百个商品类别填充产品目录。
  • 动态天气仪表盘 – 使用实时预报和历史数据生成活跃的仪表盘。
  • SaaS 多步骤代理 – 自动执行多步骤业务工作流,独立处理顺序任务。
  • 大规模图像排序 – 快速分析并分类海量图像集合。

这些演示说明该模型能够在同一价格层级下同时胜任高容量、低延迟任务和更复杂的生成任务。

早期采用者反馈

参与预览计划的公司报告了具体收益:

"Flash‑Lite 的指令遵循能力和速度让我们能够以大型模型的精度处理复杂输入,同时保持低成本。"Kolby Nottingham, Latitude

"多模态标注速度对我们的流水线来说是个颠覆性提升。"Andrew Carr, Cartwheel

"大规模的项目标记和数据标注现在变得负担得起。"Bianca Rangecroft, Whering

"性能指标和成本效率超出了我们对该层级模型的预期。"Kaan Ortabas, HubX

这些证言进一步验证了 Flash‑Lite 能在不付出高价的前提下提供企业级性能。

对 AI 生态的影响

Flash‑Lite 的发布标志着向高吞吐量 AI 民主化的战略转变:

  • 成本民主化 – 通过降低每代币费用,Google 让初创企业和大型企业都能在对延迟敏感的产品中嵌入高级语言能力。
  • 竞争定位 – 速度和价格优势直接挑战 OpenAI(GPT‑5 mini)、Anthropic(Claude 4.5 Haiku)和 Grok(4.1 Fast)等同类产品,可能重塑低成本、高吞吐量细分市场的份额格局。
  • 开发者生态 – 与 AI Studio 与 Vertex AI 的深度集成降低了采纳门槛,鼓励快速原型和 AI 增强功能的部署。
  • 未来可扩展性 – 可配置的思考层级暗示了更广阔的路线图,模型深度可动态调节,在速度优化与推理优化之间提供连续体。

入门指南

开发者可通过以下方式立即使用 Gemini 3.1 Flash‑Lite:

  1. 访问 Google AI Studio,选择 gemini‑3.1‑flash‑lite‑preview 模型。
  2. Vertex AI 控制台的模型选择菜单中启用该模型。
  3. 使用 Gemini API,配合相应的端点和身份验证令牌进行调用。

定价细节和使用限制已在相应平台页面中记录。


结论

Gemini 3.1 Flash‑Lite 将速度、成本效率与质量有机结合,成为构建大批量、实时 AI 应用的首选模型。早期采用者已报告显著的生产力提升,而模型与 Google AI 工具链的深度集成也预示着其将在各行业快速普及。


来源:Google DeepMind 博客文章 “Gemini 3.1 Flash‑Lite: Built for intelligence at scale” (2026‑03‑03)。

Sources