Gemini 3.1 Flash TTS 發佈說明 / 新功能

Gemini 3.1 Flash TTS 發佈說明 / 新功能

Google DeepMind 推出了 Gemini 3.1 Flash TTS,這是一款新一代的文字轉語音 (TTS) 模型,旨在提供更高的表現力、更佳的自然度以及細粒度的可控性。該模型目前已透過 Gemini API 和 Google AI Studio 向開發者提供預覽版,透過 Vertex AI 向企業提供,並透過 Google Vids 向 Workspace 用戶提供。

高保真語音品質與效能

Gemini 3.1 Flash TTS 被定位為 Google 迄今為止最自然且最具表現力的 TTS 模型。根據採用盲測人類偏好測試的 Artificial Analysis TTS 排行榜,該模型獲得了 1,211 分的 Elo 分數。

Artificial Analysis 進一步將 Gemini 3.1 Flash TTS 歸類於其「最具吸引力的象限」,理由是它在高品質語音生成與低運作成本之間取得了最佳平衡。核心能力包括原生的多說話者對話以及支援超過 70 種語言。

透過自然語言音訊標籤實現細粒度控制

Gemini 3.1 Flash TTS 的定義性特徵是引入了音訊標籤 (audio tags)。這些標籤允許使用者直接在文字輸入中嵌入自然語言指令,以引導 AI 語音的風格、節奏和表達方式。

為了為開發者提供「導演椅」般的體驗,Google AI Studio 包含了數個可配置的控制項:

  • 場景指導 (Scene Direction): 使用者可以定義環境並提供對話指令,以確保角色在多輪對話中保持一致性並做出自然反應。
  • 說話者層級的特異性 (Speaker-Level Specificity): 開發者可以為角色分配獨特的 Audio Profiles,並使用「導演筆記 (Director's Notes)」來調整語氣、口音和節奏。內嵌標籤使說話者能夠在句子中間改變表達方式。
  • 無縫匯出: 一旦在工作室中完成語音表演,參數可以作為 Gemini API 程式碼匯出,以在不同平台和專案中保持聲音的一致性。

全球擴展性與語言支援

Gemini 3.1 Flash TTS 針對全球部署進行了優化,支援超過 70 種語言。這使得開發者能夠在主要國際市場中實施進階的風格、口音和節奏控制,從而大規模地創建在地化且具表現力的音訊體驗。

AI 安全性與 SynthID 水印

為了對抗錯誤資訊並確保對 AI 生成內容的可靠檢測,Gemini 3.1 Flash TTS 產生的所有音訊都使用 SynthID 進行了浮水印處理。這種浮水印人類耳朵無法察覺,但會直接交織在音訊輸出中以供驗證之用。

Sources