Gemini 2.5 Flash-Lite 版本說明
Google DeepMind 已發布 Gemini 2.5 Flash-Lite 的穩定版本,這是 Gemini 2.5 系列中最快且最具成本效益的模型。此模型專為大規模生產使用而設計,優先考慮每美元的高智能以及翻譯和分類等任務的低延遲。
技術規格與定價
Gemini 2.5 Flash-Lite 是 2.5 系列中成本最低的模型,定價為每 100 萬個輸入 token 0.10 美元,每 100 萬個輸出 token 0.40 美元。此外,與預覽版相比,音訊輸入定價已降低 40%。
關鍵技術能力包括:
- 內容視窗: 1 百萬 token 的上下文視窗。
- 推理: 原生推理能力,可透過可控制的思考預算,在需要高負載的使用情境下選擇性開啟。
- 工具整合: 支援原生工具,包括 Code Execution、URL Context 與 Grounding with Google Search。
- 效能: 在廣泛的提示樣本上,延遲低於 2.0 Flash-Lite 與 2.0 Flash。
效能基準與品質
Gemini 2.5 Flash-Lite 在數個領域展現出比 2.0 Flash-Lite 更高的整體品質,包括:
- 程式碼
- 數學
- 科學
- 推理
- 多模態理解
生產使用案例
多個組織已經部署 Gemini 2.5 Flash-Lite 以優化特定的營運工作流程:
- Satlyt: 使用該模型來處理去中心化空間運算平台的軌道遙測摘要與衛星間通訊解析。這使得船上診斷的延遲降低了 45%,功耗降低了 30%。
- HeyGen: 使用該模型來自動化影片規劃、優化內容,並將影片翻譯成超過 180 種語言。
- DocsHound: 使用該模型來處理長影片並擷取數千張螢幕截圖,以生成文件和 AI 代理的訓練資料。
- Evertune: 利用該模型的速度來掃描並合併大量模型輸出,提供跨 AI 模型的品牌呈現動態洞見。
可用性與遷移
Gemini 2.5 Flash-Lite 可透過 Google AI Studio 和 Vertex AI 使用。開發者可以在程式碼中指定 gemini-2.5-flash-lite 來存取該模型。預覽版的使用者應該遷移至穩定別名,因為預覽別名將於 8 月 25 日移除。