Gemini 3.8 Flash TTS 和 Flash-Lite TTS 发布
TL;DR
Google DeepMind 发布了 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash‑Lite TTS,两款新的文本转语音模型,使创作者能够生成自定义且富有表现力的声音,并实现逐行精准的表演控制,同时为企业的高吞吐量需求提供高效且成本低廉的扩展能力。
Gemini 3.8 Flash TTS:创意语音工作室
- 目的:专为深度创意指导和角色设计而打造。
- 功能:通过自然语言提示生成全新声音,控制表演提示、语速、方言转换和反馈互动。
- 应用场景:游戏、沉浸式有声书、播客、互动媒体,以及任何需要定制角色声音的场景。
- 语音库:可访问超过 2,000 种已准备就绪的语音,覆盖 100 多种语言和方言,包括墨西哥西班牙语、魁北克法语和苏格兰英语等地区变体。
- 语音复制:仅需 30 秒样本即可创建一致的语音档案,内置同意验证、SynthID 水印和 C2PA 凭证,以保护语音人才权益。
- 未来功能 – 语音重混:计划支持通过提示对现有语音库中的音色、音高、语速和口音进行微调。
Gemini 3.8 Flash‑Lite TTS:可扩展的高吞吐量生成
- 目的:专为大规模配音、音频内容创作和富有表现力的语音代理优化。
- 效率:在最小化成本和延迟的同时,提供对语调、节奏和细微差别的精细控制。
- 目标场景:大规模媒体本地化、语音助手部署,以及任何需要快速、可靠语音合成的应用。
精确的逐行表演控制
- 舞台指示:用户可编写明确的脚本提示,或让 Gemini 解析自然语言指令以指导每行内容。
- 长篇生成:在数小时连续音频中保持高语音质量并最小化说话人漂移,非常适合播客和有声书。
- 双角色场景编排:原生支持多轮对话,实现对话驱动内容中清晰的语音分离。
- 语音爆发与反馈互动:支持插入非语言提示(如
<laughs>、<sigh>)和主动倾听插话(|mhm|、|yeah|),营造真实的对话质感。
基准性能与全球质量
- Hume AI 语音设计基准:Gemini 3.8 Flash TTS 总体排名第一(得分 71.4),在口音建模方面也排名第一(得分 60.8)。
- 总体质量指数:Flash TTS 排名第一,Flash‑Lite TTS 排名第二。
- 人类偏好评估(Voice Arena):两款模型在关键语言中均取得顶尖成绩,包括日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语。
- 多语言支持:支持超过 100 种语言,助力高质量语音体验的全球部署。
信任、同意与透明度保障
- 同意验证:语音复制需提供语音所有者匹配参考说话人的语音同意录音。
- 合成水印:每段音频输出均嵌入不可察觉的 SynthID 水印,确保 AI 生成语音可被识别,有助于防止虚假信息传播。
- 模型卡片:Gemini 3.8 音频模型卡片中提供详细的安全与责任信息。
访问与集成选项
- Google AI Studio Playground:通过语音生成工作区立即获得动手体验,支持语音设计、复制和双角色剧本编辑。
- Gemini API:可与 Agora、LiveKit、Pipecat 和 Vercel 等平台集成,构建高性能语音界面。
- 企业部署:Flash TTS 将通过 Gemini Enterprise API 提供;Flash‑Lite TTS 将通过 Google Vids 向终端用户开放。
- 合作伙伴部署:早期采用者包括 Figma、HeyGen、Linguana、Wondercraft、99.co 和 Ollang,利用这些模型进行配音、地区口音本地化和对话代理开发。
开始使用
- 开发者:可通过 Gemini API 和 Google AI Studio 访问两款模型。
- 企业用户:即将通过 Gemini Enterprise API 上线。
- 普通用户:Flash TTS 将出现在 Gemini Notebook 中;Flash‑Lite TTS 将在 Google Vids 中上线。
所有信息均来自 DeepMind 于 2026 年 9 月 23 日发布的博客文章。