Gemini 3.1 Flash‑Lite 發布:快速、低成本的高容量工作負載 AI
TL;DR
Google DeepMind 宣布 Gemini 3.1 Flash‑Lite 為 Gemini 3 系列中最快且最具成本效益的模型,現在可透過 Gemini API、Google AI Studio 與 Vertex AI 以預覽模式使用。它提供最高 2.5 倍更快的首 token 延遲,以及 45% 的輸出速度提升,價格為每百萬輸入 token $0.25、每百萬輸出 token $1.50,使高容量、即時應用變得負擔得起。
Gemini 3.1 Flash‑Lite 是什麼?
Gemini 3.1 Flash‑Lite 是一款全新的多模態語言模型,定位為高吞吐量開發者工作負載的旗艦產品。它屬於 Gemini 3 系列,並被行銷為該系列中 最快 且 最具成本效益 的層級。
- 可用性 – 該模型以預覽模式向開發者透過 Gemini API 在 Google AI Studio 中提供,並向企業透過 Vertex AI 開放。
- 定價 – 輸入 token 每百萬 $0.25,輸出 token 每百萬 $1.50,僅為較大型 Gemini 模型價格的一小部分。
- 效能聲稱 – 根據 Artificial Analysis 基準測試,Flash‑Lite 產生首個答案 token 的速度快 2.5 倍,整體輸出速度提升 45%,且品質與較大模型相當或更佳。
速度與成本基準
| 模型 | 輸入價格 ($/M) | 輸出價格 ($/M) | 輸出速度 ↑ | 首 token 延遲 ↓ |
|---|---|---|---|---|
| Gemini 3.1 Flash‑Lite | 0.25 | 1.50 | +45% 相較於 2.5 Flash | 2.5× 更快 相較於 2.5 Flash |
| Gemini 2.5 Flash‑Lite | 0.30 | 1.80 | 基線 | 基線 |
| GPT‑5 mini | 0.40 | 2.10 | 較慢 | 較慢 |
| Claude 4.5 Haiku | 0.35 | 1.90 | 較慢 | 較慢 |
| Grok 4.1 Fast | 0.38 | 2.00 | 較慢 | 較慢 |
來源:博客文章中引用的 Artificial Analysis 基準圖表。
質量指標
儘管著重於效率,Flash‑Lite 在已建立的 AI 排行榜上仍取得優異分數:
- Arena.ai Elo 分數: 1432,位居同層級其他模型之上。
- GPQA Diamond(推理): 正確率 86.9%。
- MMMU‑Pro(多模態理解): 正確率 76.8%,超越早期 Gemini 代系如 Gemini 2.5 Flash。
自適應思考層級
Flash‑Lite 在 AI Studio 與 Vertex AI 中提供可配置的「思考層級」。開發者可以調整模型在請求上投入的計算資源,以在速度與推理深度之間取得平衡。此彈性對於工作負載在簡單高頻任務(例如大量翻譯、內容審核)與較複雜、指令密集的操作(例如 UI 生成、模擬建構)之間的變化至關重要。
示範使用案例
博客展示了多個使用 Flash‑Lite 建構的即時應用案例:
- 電商線框填充 – 即時在產品目錄中填入數百項跨類別的商品。
- 動態天氣儀表板 – 使用即時預報與歷史資料生成即時儀表板。
- SaaS 多步驟代理 – 執行多樣化的業務工作流程,自主處理連續任務。
- 大規模影像排序 – 快速分析與分類龐大的影像集合。
早期採用者回饋
參與預覽計畫的公司報告了具體的效益:
"Flash‑Lite 的指令遵循能力與速度使我們能以較大型模型的精確度處理複雜輸入,同時保持低成本。" – Kolby Nottingham, Latitude
"多模態標記速度對我們的管線而言是顛覆性的。" – Andrew Carr, Cartwheel
"大規模的一致項目標記與資料標註現在變得負擔得起。" – Bianca Rangecroft, Whering
"效能指標與成本效益超出我們對此層級模型的預期。" – Kaan Ortabas, HubX
對 AI 版圖的影響
- 成本民主化 – 透過降低每 token 價格,Google 讓新創與大型企業皆能在對延遲敏感的產品中嵌入先進的語言功能。
- 競爭定位 – 速度與價格優勢直接挑戰 OpenAI(GPT‑5 mini)、Anthropic(Claude 4.5 Haiku)以及 Grok(4.1 Fast)等類似產品,可能重塑低成本、高吞吐量市場的份額。
- 開發者生態系 – 與 AI Studio 與 Vertex AI 的整合降低採用門檻,鼓勵快速原型設計與 AI 增強功能的部署。
- 未來擴展 – 可配置的思考層級暗示更廣泛的路線圖,讓模型深度可動態調整,提供速度優化與推理優化之間的連續體。
如何開始使用
開發者今天即可透過以下方式存取 Gemini 3.1 Flash‑Lite:
- 前往 Google AI Studio,選取 gemini‑3.1‑flash‑lite‑preview 模型。
- 於控制台的模型選擇選單中,於 Vertex AI 中啟用該模型。
- 使用 Gemini API,搭配適當的端點與驗證 token。
結論
Gemini 3.1 Flash‑Lite 結合了速度、成本效益與品質的優勢,成為開發者構建高容量、即時 AI 應用的首選模型。早期採用者已報告可觀的生產力提升,且該模型與 Google AI 工具生態系的整合預示著在各行各業的快速普及。
來源:Google DeepMind 部落格文章「Gemini 3.1 Flash‑Lite:為大規模智慧而建」 (2026‑03‑03)。