Gemini 3.8 Flash TTS 和 Flash-Lite TTS 发布

TL;DR

Google DeepMind 发布了 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash‑Lite TTS,两款新的文本转语音模型,使创作者能够生成自定义且富有表现力的声音,并实现逐行精准的表演控制,同时为企业的高吞吐量需求提供高效且成本低廉的扩展能力。

Gemini 3.8 Flash TTS:创意语音工作室

  • 目的:专为深度创意指导和角色设计而打造。
  • 功能:通过自然语言提示生成全新声音,控制表演提示、语速、方言转换和反馈互动。
  • 应用场景:游戏、沉浸式有声书、播客、互动媒体,以及任何需要定制角色声音的场景。
  • 语音库:可访问超过 2,000 种已准备就绪的语音,覆盖 100 多种语言和方言,包括墨西哥西班牙语、魁北克法语和苏格兰英语等地区变体。
  • 语音复制:仅需 30 秒样本即可创建一致的语音档案,内置同意验证、SynthID 水印和 C2PA 凭证,以保护语音人才权益。
  • 未来功能 – 语音重混:计划支持通过提示对现有语音库中的音色、音高、语速和口音进行微调。

Gemini 3.8 Flash‑Lite TTS:可扩展的高吞吐量生成

  • 目的:专为大规模配音、音频内容创作和富有表现力的语音代理优化。
  • 效率:在最小化成本和延迟的同时,提供对语调、节奏和细微差别的精细控制。
  • 目标场景:大规模媒体本地化、语音助手部署,以及任何需要快速、可靠语音合成的应用。

精确的逐行表演控制

  • 舞台指示:用户可编写明确的脚本提示,或让 Gemini 解析自然语言指令以指导每行内容。
  • 长篇生成:在数小时连续音频中保持高语音质量并最小化说话人漂移,非常适合播客和有声书。
  • 双角色场景编排:原生支持多轮对话,实现对话驱动内容中清晰的语音分离。
  • 语音爆发与反馈互动:支持插入非语言提示(如 <laughs>、<sigh>)和主动倾听插话(|mhm|、|yeah|),营造真实的对话质感。

基准性能与全球质量

  • Hume AI 语音设计基准:Gemini 3.8 Flash TTS 总体排名第一(得分 71.4),在口音建模方面也排名第一(得分 60.8)。
  • 总体质量指数:Flash TTS 排名第一,Flash‑Lite TTS 排名第二。
  • 人类偏好评估(Voice Arena):两款模型在关键语言中均取得顶尖成绩,包括日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语。
  • 多语言支持:支持超过 100 种语言,助力高质量语音体验的全球部署。

信任、同意与透明度保障

  • 同意验证:语音复制需提供语音所有者匹配参考说话人的语音同意录音。
  • 合成水印:每段音频输出均嵌入不可察觉的 SynthID 水印,确保 AI 生成语音可被识别,有助于防止虚假信息传播。
  • 模型卡片:Gemini 3.8 音频模型卡片中提供详细的安全与责任信息。

访问与集成选项

  • Google AI Studio Playground:通过语音生成工作区立即获得动手体验,支持语音设计、复制和双角色剧本编辑。
  • Gemini API:可与 Agora、LiveKit、Pipecat 和 Vercel 等平台集成,构建高性能语音界面。
  • 企业部署:Flash TTS 将通过 Gemini Enterprise API 提供;Flash‑Lite TTS 将通过 Google Vids 向终端用户开放。
  • 合作伙伴部署:早期采用者包括 Figma、HeyGen、Linguana、Wondercraft、99.co 和 Ollang,利用这些模型进行配音、地区口音本地化和对话代理开发。

开始使用

  • 开发者:可通过 Gemini API 和 Google AI Studio 访问两款模型。
  • 企业用户:即将通过 Gemini Enterprise API 上线。
  • 普通用户:Flash TTS 将出现在 Gemini Notebook 中;Flash‑Lite TTS 将在 Google Vids 中上线。

所有信息均来自 DeepMind 于 2026 年 9 月 23 日发布的博客文章。

Sources