Gemini 3.8 Flash TTS 和 Flash-Lite TTS 上線
TL;DR
Google DeepMind 發布了 Gemini 3.8 Flash TTS 與 Gemini 3.8 Flash‑Lite TTS,這兩款全新的文字轉語音模型,讓創作者能生成自訂且富有表現力的聲音,並實現逐行精確的表演控制,同時為企業應用提供高容量、成本效益高的擴展能力。
Gemini 3.8 Flash TTS:創意聲音工作室
- 目的:專為深度創意導向與角色設計而設計。
- 功能:從自然語言提示生成全新的聲音,控制表演提示、節奏、方言轉換與回應式對話。
- 使用情境:遊戲、沉浸式有聲書、播客、互動媒體,以及任何需要客製化角色聲音的場景。
- 聲音資料庫:可存取超過 2,000 種已準備就緒的聲音,涵蓋 100 多種語言與方言,包括墨西哥西班牙語、魁北克法語與蘇格蘭英語等區域變體。
- 聲音複製:僅需 30 秒樣本即可建立一致的聲線輪廓,內建同意驗證、SynthID 水印與 C2PA 憑證,以保護聲音演員權益。
- 未來功能 – 聲音重混:計畫支援透過提示語微調現有資料庫聲音的音色、音高、節奏與口音。
Gemini 3.8 Flash‑Lite TTS:可擴展的高容量生成
- 目的:針對高容量配音、音訊內容創作與富有表現力的語音代理進行優化。
- 效率:在最小化成本與延遲的同時,提供對語調、節奏與細節的精細控制。
- 目標情境:大規模媒體本地化、語音助理部署,以及任何需要快速、可靠語音合成的應用。
精確的逐行表演控制
- 舞台指示:使用者可撰寫明確的劇本提示,或讓 Gemini 解讀自然語言指示以針對每行進行處理。
- 長篇生成:在連續數小時的音訊中維持高品質聲線與極小的說話者偏移,非常適合播客與有聲書。
- 雙角色場景佈置:支援原生多輪對話,並具備清晰的聲音分離,適用於對話驅動內容。
- 語音爆發與回應式對話:允許插入非語言提示(例如
<laughs>、<sigh>)與主動聆聽的插話(|mhm|、|yeah|),以營造真實的對話質感。
基準性能與全球品質
- Hume AI 聲音設計基準:Gemini 3.8 Flash TTS 總體排名第一(得分 71.4),在口音建模方面亦排名第一(得分 60.8)。
- 整體品質指數:Flash TTS 獲得第一名,Flash‑Lite TTS 獲得第二名。
- 人類偏好評估(Voice Arena):兩款模型在關鍵語言中均取得頂尖表現,包括日語、巴西葡萄牙語、越南語、現代標準阿拉伯語、墨西哥西班牙語與印地語。
- 多語言支援:支援超過 100 種語言,讓高品質語音體驗可在全球範圍內部署。
信任、同意與透明度保障措施
- 同意驗證:聲音複製需取得聲音所有者提供的語音同意錄音,且須與參考講者相符。
- 合成水印:每段音訊輸出均嵌入不可察覺的 SynthID 水印,確保 AI 生成語音可被識別,並有助於防止誤導資訊。
- 模型卡片:Gemini 3.8 音訊模型卡片中提供詳細的安全與責任資訊。
存取與整合選項
- Google AI Studio Playground:透過語音生成工作區立即體驗,支援聲音設計、複製與雙角色劇本編輯。
- Gemini API:可與 Agora、LiveKit、Pipecat 與 Vercel 等平台整合,用以建構高性能語音介面。
- 企業部署:Flash TTS 將透過 Gemini Enterprise API 提供;Flash‑Lite TTS 將透過 Google Vids 對終端使用者開放。
- 合作夥伴部署:早期採用者包括 Figma、HeyGen、Linguana、Wondercraft、99.co 與 Ollang,利用這些模型進行配音、區域口音本地化與對話代理開發。
開始使用
- 開發者:可透過 Gemini API 與 Google AI Studio 存取兩款模型。
- 企業:即將透過 Gemini Enterprise API 上線。
- 一般使用者:Flash TTS 將出現在 Gemini Notebook 中;Flash‑Lite TTS 將於 Google Vids 上提供。
所有資訊均直接取自 DeepMind 於 2026 年 9 月 23 日發布的部落格文章。