Google Gemini 3.8 Flash 與 Flash‑Lite TTS 發布:表現力強且可擴展的語音生成
Gemini 3.8 Flash 與 Flash‑Lite TTS 提升了表現力強且可擴展語音生成的標準
Google 於 2026 年 9 月 23 日宣布推出 Gemini 3.8 Flash TTS 與 Gemini 3.8 Flash‑Lite TTS,將其定位為 Gemini 家族中最具表現力的音訊生成模型。這些模型讓開發者能夠建立自訂角色語音、從 30 秒樣本中複製現有語音,並逐行控制語音傳遞,同時支援高流量、具成本效益的使用場景。
開箱即用的核心功能
Flash TTS 專注於深度的創意控制。 使用者可以使用自然語言提示詞設計全新的語音,指定口音、方言、語速和背景語氣提示,並在長達數小時的音訊中生成多說話者場景,且不會出現說話者漂移的問題。
Flash‑Lite TTS 針對規模化進行了優化。 該模型專為大量配音和語音代理設計,以更低的成本提供同樣細膩的語氣和語速控制。
這兩款模型皆支援:
- 超過 2,000 種生產級語音,涵蓋 100 多種語言及區域變體(例如:墨西哥西班牙語、魁北克法語、蘇格蘭英語)。
- 從 30 秒經同意的樣本中進行語音複製,並內建 SynthID 浮水印與 C2PA 憑證。
- 直接的腳本提示,例如
<laughs>、<sigh>以及背景語氣標記(|mhm|、|yeah|)。 - 長篇生成,可在數小時的內容中保持音色一致。
基準測試效能驗證了「最具表現力」的說法
Google 引用了 Hume AI 的語音設計基準測試(Voice Design Benchmark),其中 Gemini 3.8 Flash TTS 獲得了 71.4 分(總排名第一),在口音建模方面獲得 60.8 分,超越了先前的 Gemini 3.1 Flash TTS。同一基準測試將 Flash‑Lite TTS 的整體品質評為 第二名。Voice Arena 上的使用者偏好測試也將這兩款模型在多種全球語言中評為頂尖,包括日語、巴西葡萄牙語、越南語、現代標準阿拉伯語、墨西哥西班牙語和印地語。
信任、同意與浮水印已整合至流程中
語音複製需要一段與參考說話者相符的口頭同意錄音;同意音訊僅用於驗證,不會用於模型訓練。每個生成的片段都帶有不可察覺的 SynthID 浮水印,能夠在後續檢測 AI 生成的語音,並有助於減輕錯誤資訊的傳播。
Google AI 生態系統中的可用性
| 平台 | Flash TTS | Flash‑Lite TTS |
|---|---|---|
| Google AI Studio (音訊遊樂場) | ✅ | ✅ |
| Gemini API (開發者) | ✅ | ✅ |
| Gemini Enterprise (企業 API) | 即將推出 | 即將推出 |
| Gemini Notebook (消費者) | ✅ | ✅ |
| Google Vids (消費者影片工具) | ✅ | ✅ |
合作夥伴整合包括 Agora、LiveKit、Pipecat、Vercel、Figma、HeyGen、Linguana、Wondercraft、99.co 和 Ollang,實現了配音、在地化媒體和對話代理的快速部署。
Hacker News 上的社群反應
- 對齊疑慮: 使用者指出消費者、專業消費者和雲端平台之間的功能集不一致,導致不清楚哪些功能是普遍可用的。(評論者 @rcr‑anti)
- 對語音複製的接受度: 同意驗證和浮水印的存在被視為 Google 對發布語音複製功能感到放心的跡象,這是一項先前被許多供應商保留的功能。(評論者 @simonw)
- 控制與品質的權衡: 幾位評論者讚賞腳本音訊的細緻逐行控制,而其他人則觀察到生成的語音仍然缺乏人類語音的細微差別。(評論者 @Multicomp, @AyanamiKaine)
- 成本與定價不透明: 使用者報告缺乏定價資訊以及語音複製的區域限制,顯示該發布可能需要更清晰的文件。(評論者 @nater5000)
- 比較效能: 早期採用者報告稱 Flash TTS 在表現力上與 ElevenLabs v3 持平或超越,且每次呼叫成本極低(< $0.01)。(評論者 @ttul)
- 開源替代方案: 一些參與者詢問關於本地執行模型的問題,突顯了對無需雲端依賴即可執行的輕量級 TTS 解決方案的需求。(評論者 @Thaxll)
嘗試 Gemini 3.8 TTS 的實用步驟
- 開啟 Google AI Studio,網址為
https://aistudio.google.com/generate-speech?model=gemini-3.8-flash-tts。 - 從庫中選擇基礎語音或開始一個 語音設計 提示(例如:「建立一個帶有美國南部口音的魅力敘述者」)。
- 可選擇上傳 30 秒的同意樣本以複製特定語音。
- 使用雙說話者劇本編輯器添加舞台指示(
<laughs>、<sigh>)並生成音訊。 - 匯出結果或呼叫 Gemini API 進行程式化整合。
展望
Gemini 3.8 Flash 與 Flash‑Lite TTS 代表了邁向全功能音訊工作室的重要一步,該工作室可透過 UI、API 和企業平台存取。它們在基準測試中的領先地位、廣泛的語言覆蓋範圍以及內建的安全機制,解決了許多減緩早期 TTS 推出的疑慮。然而,社群對平台一致性、定價透明度和區域可用性的回饋表明,Google 的推廣仍需持續改進,才能實現無縫的全球採用。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch