Gemini 3.1 Flash TTS 发行说明 / 新功能

Gemini 3.1 Flash TTS 发行说明 / 新功能

Google DeepMind 已推出 Gemini 3.1 Flash TTS,这是一款下一代文本转语音(TTS)模型,旨在实现更高的表现力、改进的自然度和细粒度的可控性。该模型现已通过 Gemini API 和 Google AI Studio 以预览版形式向开发者提供,通过 Vertex AI 向企业提供,并通过 Google Vids 向 Workspace 用户提供。

高保真语音质量和性能

Gemini 3.1 Flash TTS 被定位为截至目前 Google 最自然、最具表现力的 TTS 模型。根据使用盲测人类偏好的 Artificial Analysis TTS 排行榜,该模型获得了 1,211 的 Elo 分数。

Artificial Analysis 进一步将 Gemini 3.1 Flash TTS 归类为其“最具吸引力象限”,理由是高质量语音生成与低运营成本之间达到了最佳平衡。主要功能包括原生多说话人对话以及对超过 70 种语言的支持。

通过自然语言音频标签进行细粒度控制

Gemini 3.1 Flash TTS 的核心特性是引入了音频标签。这些标签使用户能够将自然语言命令直接嵌入文本输入中,以引导 AI 语音的 vocal 风格、节奏和表达。

为了让开发者获得‘导演椅’体验,Google AI Studio 包含若干可配置控制:

  • 场景指导: 用户可以定义环境并提供对话指令,以确保角色在多轮对话中保持一致并自然反应。
  • 说话人级别特异性: 开发者可以为角色分配独特的音频配置文件,并使用“导演注释”来调整语调、口音和节奏。内联标签使说话人能够在句子中途改变表达。
  • 无缝导出: 一旦在工作室中完成 vocal 表演,参数可以导出为 Gemini API 代码,以在不同平台和项目之间保持声音一致性。

全球可扩展性和语言支持

Gemini 3.1 Flash TTS 已针对全球部署进行了优化,支持超过 70 种语言。这使开发者能够在主要国际市场中实现高级的风格、口音和节奏控制,从而大规模创建本地化且富有表现力的音频体验。

AI 安全与 SynthID 水印

为了对抗错误信息并确保可靠检测 AI 生成内容,所有由 Gemini 3.1 Flash TTS 生成的音频均使用 SynthID 进行水印嵌入。此水印对人耳不可感知,但直接交织在音频输出中,以便进行验证。

Sources