Google Gemini 3.8 Flash 和 Flash‑Lite TTS 发布:富有表现力且可扩展的语音生成

Gemini 3.8 Flash 和 Flash‑Lite TTS 提高了富有表现力、可扩展语音生成的标准

Google 于 2026 年 9 月 23 日宣布推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash‑Lite TTS,将其定位为 Gemini 系列中最具表现力的音频生成模型。这些模型使开发人员能够创建自定义角色语音,通过 30 秒的样本复制现有语音,并逐行控制语音表达,同时支持高容量、高性价比的使用场景。


开箱即用的核心功能

Flash TTS 专注于深度创意控制。 用户可以使用自然语言提示设计全新的语音,指定口音、方言、语速和背景反馈提示,并生成多说话人场景,且在数小时的音频中不会出现说话人漂移。

Flash‑Lite TTS 专注于规模化。 该模型针对批量配音和语音代理进行了优化,以更低的成本提供相同的精细音调和语速控制。

两种模型均支持:

  • 超过 2,000 种生产就绪的语音,涵盖 100 多种语言和区域变体(例如:墨西哥西班牙语、魁北克法语、苏格兰英语)。
  • 通过 30 秒的授权样本进行语音复制,并内置 SynthID 水印和 C2PA 凭据。
  • 直接脚本提示,例如 <laughs>、<sigh> 和背景反馈标记(|mhm|、|yeah|)。
  • 长文本生成,可在数小时的内容中保持音色一致。

基准测试性能验证了“最具表现力”的说法

Google 引用了 Hume AI 的语音设计基准测试,其中 Gemini 3.8 Flash TTS 得分为 71.4(总排名第一),在口音建模方面得分为 60.8,优于之前的 Gemini 3.1 Flash TTS。同一基准测试将 Flash‑Lite TTS 的整体质量排在 #2。Voice Arena 上的用户偏好测试也将这两种模型在多种全球语言中排在首位,包括日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语。


信任、同意和水印已内置于流程中

语音复制需要与参考说话人匹配的口头同意录音;同意音频仅用于验证,不用于模型训练。每个生成的剪辑都带有不可见的 SynthID 水印,从而能够对 AI 生成的语音进行下游检测,并有助于减轻错误信息的影响。


Google AI 生态系统中的可用性

平台 Flash TTS Flash‑Lite TTS
Google AI Studio (音频游乐场) ✅ ✅
Gemini API (开发人员) ✅ ✅
Gemini Enterprise (企业 API) 即将推出 即将推出
Gemini Notebook (消费者) ✅ ✅
Google Vids (消费者视频工具) ✅ ✅

合作伙伴集成包括 Agora、LiveKit、Pipecat、Vercel、Figma、HeyGen、Linguana、Wondercraft、99.co 和 Ollang,支持快速部署配音、本地化媒体和对话代理。


Hacker News 上的社区反应

  • 对齐担忧: 用户指出消费者、准专业和云平台之间的功能集不一致,导致不清楚哪些功能是普遍可用的。(评论来自 @rcr‑anti)
  • 语音克隆的接受度: 同意验证和水印的存在被视为 Google 对发布语音复制功能感到放心的标志,此前许多提供商都保留了这一功能。(评论来自 @simonw)
  • 控制与质量的权衡: 一些评论者赞赏脚本音频的逐行精细控制,而另一些人则观察到生成的语音仍然缺乏人类语音的微妙之处。(评论来自 @Multicomp, @AyanamiKaine)
  • 成本和定价不透明: 用户报告缺少定价信息和语音复制的区域限制,表明发布可能需要更清晰的文档。(评论来自 @nater5000)
  • 对比性能: 早期采用者报告称,Flash TTS 在表现力上与 ElevenLabs v3 持平或超过,且单次调用成本较低(< $0.01)。(评论来自 @ttul)
  • 开源替代方案: 一些参与者询问本地运行的模型,突显了对无需云依赖即可运行的轻量级 TTS 解决方案的需求。(评论来自 @Thaxll)

尝试 Gemini 3.8 TTS 的实用步骤

  1. 打开 Google AI Studio,网址为 https://aistudio.google.com/generate-speech?model=gemini-3.8-flash-tts。
  2. 从库中选择基础语音或开始一个 Voice Design 提示(例如:“创建一个带有美国南部口音的魅力叙述者”)。
  3. 可选:上传 30 秒的同意样本以复制特定语音。
  4. 使用双说话人剧本编辑器添加舞台指导(<laughs>、<sigh>)并生成音频。
  5. 导出结果或调用 Gemini API 进行程序化集成。

展望

Gemini 3.8 Flash 和 Flash‑Lite TTS 代表了向功能齐全的音频工作室迈出的重要一步,该工作室可以通过 UI、API 和企业平台访问。它们在基准测试中的领先地位、广泛的语言覆盖范围和内置的安全机制解决了许多减缓早期 TTS 发布的问题。然而,社区对平台一致性、定价透明度和区域可用性的反馈表明,Google 的发布需要持续改进才能实现无缝的全球采用。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch