Gemini 2.5 Flash Native Audio 发布:增强型实时语音代理与实时语音翻译
TL;DR
Google DeepMind 发布了 Gemini 2.5 Flash Native Audio,这是一款升级后的实时语音模型,改进了函数调用、指令遵循和多轮对话质量,并增加了支持 70 多种语言的实时语音到语音翻译功能。
Gemini 2.5 Flash Native Audio 概览
Gemini 2.5 Flash Native Audio 是 DeepMind 以音频为中心的 Gemini 系列模型的最新迭代版本。它专为实时语音代理设计,目前已通过 Google AI Studio、Vertex AI、Gemini Live 和 Search Live 正式推出。此次发布将模型的能力从表现力丰富的文本转语音扩展到了强大的对话处理和实时语音翻译。
技术改进
更精准的函数调用
- 模型现在能以更高的可靠性识别何时调用外部函数。
- 在 ComplexFuncBench Audio 评估中,Gemini 2.5 Flash Native Audio 取得了 71.5% 的评分,位居基准测试首位。
强大的指令遵循能力
- 对开发者提供指令的遵循度从上一版本的 84% 提升至 90%。
- 这意味着对于复杂的提示词,可以获得更完整且可预测的音频输出。
更流畅的多轮对话
- 增强的对话轮次间的上下文检索带来了更具凝聚力和自然的交互。
- 当模型将实时信息整合到回答中时,用户体验到的对话中断会更少。
实时语音代理应用场景
该模型驱动了广泛的对话体验,从 Gemini Live 中的头脑风暴会议到 Search Live 中的实时协助。企业可以将该模型嵌入客户服务流程,实现听起来自然、能处理嘈杂环境并能即时切换语言的代理。
客户证言
“在使用 Sidekick 不到一分钟内,用户往往会忘记他们是在与 AI 对话……通过 Gemini 2.5 Flash Native Audio 提供的全新 Live API AI 能力,赋予了我们的商家获胜的力量。” – David Wurtz, Shopify 产品副总裁
“通过集成 Gemini 2.5 Flash Native Audio 模型……我们显著增强了 Mia 的能力……为我们的经纪人合作伙伴生成了超过 14,000 笔贷款。” – Jason Bressler, United Wholesale Mortgage CTO
“通过 Vertex AI 使用 Gemini 2.5 Flash Native Audio 模型,让 Newo.ai AI 接待员实现了无与伦比的对话智能……即使在嘈杂的环境中也能识别主要发言者,在对话中途切换语言,并且听起来非常自然且富有情感表现力。” – David Yang, Newo.ai 联合创始人
实时语音翻译
Gemini 现在提供原生的实时语音到语音翻译,支持两种模式:
- 持续聆听 (Continuous Listening) – 将任何语言的环境语音翻译成单一的目标语言,使用户可以戴着耳机并以自己喜欢的语言聆听世界。
- 双向对话 (Two-Way Conversation) – 根据发言者动态切换输出语言,实现无缝的双语对话(例如:英语 ↔ 印地语)。
核心翻译功能
| 功能 | 描述 |
|---|---|
| 语言覆盖范围 | 利用 Gemini 的多语言知识,支持 >70 种语言和 2,000 个语言对。 |
| 风格迁移 | 保留语调、节奏和音高,使翻译后的语音听起来很自然。 |
| 多语言输入 | 在单个会话中处理多种源语言。 |
| 自动检测 | 自动检测所说语言,无需手动选择。 |
| 噪声鲁棒性 | 过滤环境噪声,以便在嘈杂环境中进行清晰的翻译。 |
Beta 测试体验已在 Google Translate 应用中提供(Android 版已在美国、墨西哥和印度推出;iOS 及其他地区即将推出)。反馈将指导进一步的集成,包括计划在 2026 年发布的 Gemini API。
开始使用
开发者可以通过以下方式开始使用 Gemini 2.5 Flash Native Audio 构建语音代理:
- Vertex AI – 面向生产工作负载的通用可用版本。
- Gemini API preview – 可通过 Gemini API 文档访问。
- Google AI Studio – 用于快速原型的交互式游乐场。
Gemini 2.5 Flash 和 Gemini 2.5 Pro 文本转语音模型也可通过 Gemini API 使用,并提供全面的文档、提示词指南和示例 notebook 库。
影响
此次发布标志着从静态文本转语音向完全交互式、音频优先的 AI 体验的转变。通过结合可靠的函数调用、高度的指令忠实度和实时多语言翻译,Gemini 2.5 Flash Native Audio 实现了更自然、企业级的语音代理,并为全球通信开辟了新途径,尤其是在视觉界面不切实际的场景中。
参考资料
- Gemini 2.5 Flash Native Audio preview: https://aistudio.google.com/prompts/new_chat?model=gemini-2.5-flash-native-audio-preview-12-2025
- Vertex AI Gemini Live API announcement: https://cloud.google.com/blog/products/ai-machine-learning/gemini-live-api-available-on-vertex-ai
- ComplexFuncBench Audio benchmark: https://github.com/zai-org/ComplexFuncBench?tab=readme-ov-file#citatio
- Live translation in Google Translate: https://blog.google/products/search/gemini-capabilities-translation-upgrades/