Gemini 2.5 Flash-Lite 发布说明
Google DeepMind 已发布 Gemini 2.5 Flash-Lite 的稳定版,这是 Gemini 2.5 系列中最快且最具成本效益的模型。该模型专为大规模生产使用而设计,优先考虑每美元的高智能以及诸如翻译和分类等任务的低延迟。
技术规格和定价
Gemini 2.5 Flash-Lite 是 2.5 系列中成本最低的模型,输入令牌每 100 万个收费 0.10 美元,输出令牌每 100 万个收费 0.40 美元。此外,与预览版发布相比,音频输入定价降低了 40%。
关键技术能力包括:
- 上下文窗口:100 万令牌的上下文窗口。
- 推理:原生推理能力,可通过可控思考预算在需要的使用情况下可选打开。
- 工具集成:支持原生工具,包括 Code Execution、URL Context 和通过 Google Search 进行的 Grounding。
- 性能:在广泛的提示样本中,延迟低于 2.0 Flash-Lite 和 2.0 Flash。
性能基准和质量
Gemini 2.5 Flash-Lite 在多个领域展示了比 2.0 Flash-Lite 更高的整体质量,包括:
- 编码
- 数学
- 科学
- 推理
- 多模态理解
生产用例
多个组织已经部署 Gemini 2.5 Flash-Lite 以优化特定的运营工作流程:
- Satlyt:利用该模型在去中心化空间计算平台上处理轨道遥测摘要和卫星间通信解析。这使得机载诊断的延迟降低了 45%,功耗降低了 30%。
- HeyGen:使用该模型自动化视频规划、优化内容,并将视频翻译成超过 180 种语言。
- DocsHound:使用该模型处理长视频并提取数千张截图,以生成 AI 代理的文档和训练数据。
- Evertune:利用该模型的速度扫描和合成大量模型输出,以在各种 AI 模型中提供品牌表现的动态洞察。
可用性和迁移
Gemini 2.5 Flash-Lite 可通过 Google AI Studio 和 Vertex AI 获得。开发者可以在代码中指定 gemini-2.5-flash-lite 来访问该模型。预览版用户应迁移到稳定别名,因为预览别名计划于 8 月 25 日删除。