Gemini 3.1 Flash Live 发布说明 / 新功能

Google DeepMind 宣布发布 Gemini 3.1 Flash Live,这是迄今为止其最高质量的音频和语音模型。该模型旨在通过降低延迟并提升对声学细微差别的理解能力,实现更流畅、自然且精确的实时对话。

技术性能与基准测试

Gemini 3.1 Flash Live 在面向语音的代理的推理和任务执行方面表现出显著提升。该模型在多个关键音频基准测试中领先:

  • ComplexFuncBench Audio:模型取得了 90.8% 的得分,在具有各种约束的多步骤函数调用中领先。
  • Audio MultiChallenge (Scale AI):在启用“thinking”后,模型取得了 36.1% 的得分,在真实音频中断和停顿期间的复杂指令遵循和长时程推理测试中领先。

增强的音频能力

该模型具备改进的音调理解和声学敏感度,能够实现更自然的交互:

  • Tonal Recognition:Gemini 3.1 Flash Live 在识别音高和语速方面比之前的 2.5 Flash Native Audio 模型更为有效。
  • Dynamic Response:模型可以根据用户的沮丧或困惑表达动态调整其响应。
  • Environmental Robustness:该模型旨在即使在嘈杂环境中也能处理复杂任务。

产品集成与可用性

Gemini 3.1 Flash Live 已在多个 Google 平台上集成,面向不同用户群体:

  • Developers:通过 Google AI Studio 中的 Gemini Live API 预览版提供。
  • Enterprises:通过 Gemini Enterprise 为客户体验提供。
  • General Users:已集成到 Search Live 和 Gemini Live 中。

用户体验改进

对于终端用户,3.1 Flash Live 模型提供了更直观的交互体验:

  • Faster Responses:相较于之前的版本,Gemini Live 现在提供更快的响应。
  • Extended Context:模型能够跟踪对话的上下文时间加倍,提升更长头脑风暴会议的连贯性。
  • Global Expansion:由于模型本身具备多语言能力,Search Live 已扩展至 200 多个国家和地区,支持用户使用首选语言进行实时多模态对话。

安全与责任

为防止错误信息的传播,Gemini 3.1 Flash Live 生成的所有音频均使用 SynthID 添加水印。该不可感知的水印直接嵌入音频输出,以实现对 AI 生成内容的可靠检测。

Sources