Gemini 3.5 Live Translate 發行說明
Gemini 3.5 Live Translate 發行說明
Google DeepMind 已推出 Gemini 3.5 Live Translate,這是一種專為超過 70 種語言提供近乎即時語音對語音翻譯而設計的新音訊模型。此模型擺脫了傳統的逐輪翻譯系統,採用連續生成方式,減少尷尬的停頓,並保持流暢的對話流程,僅落後說話者幾秒。
連續語音對語音翻譯
Gemini 3.5 Live Translate 透過在等待足夠語境以確保品質與即時翻譯以保持與說話者同步之間取得平衡,實現流暢且自然聽感的翻譯語音。主要技術能力包括:
- 韻律保留: 模型在翻譯過程中保留原始說話者的語調、節奏和音高。
- 自動語言偵測: 它能自動偵測 70+ 種語言,無需手動設定。
- 噪聲鲁棒性: 模型經過設計,能在嘈雜且不可預測的環境中運作,適合實際應用。
整合與可用性
Gemini 3.5 Live Translate 正在多個平台上部署,以服務不同的使用者群體:
- 開發者: 可透過 Gemini Live API 和 Google AI Studio 公開預覽版取得。
- 企業: 本月將在 Google Meet 中對特定商業 Google Workspace 客戶推出私人預覽版。
- 一般使用者: 將透過 Android 和 iOS 上的 Google Translate 應用程式全球推出。
Google Meet 增強功能
將 Gemini 3.5 Live Translate 整合到 Google Meet 中,顯著擴展了平台的翻譯功能。此更新將支援語言數量從五種增加到超過 70 種,並將翻譯組合從僅英語配對擴展到單次會議內超過 2,000 種語言組合。
行動體驗與聆聽模式
在 Google Translate 行動應用程式中,使用者可使用耳機獲得無縫體驗,以鏡像說話者的語調。Android 使用者特別會獲得新的 "聆聽模式",該模式允許翻譯後的音訊直接透過手機聽筒串流,使得在不需要耳機的情況下,可對即時語音(如導覽團)進行私密翻譯。
開發者生態系統與真實世界使用案例
開發者可使用 Gemini Live API 建構語音翻譯應用程式,並獲得 Agora、Fishjam、LiveKit、Pipecat 和 Vision Agents 等基礎設施合作夥伴的支援。
真實世界的測試已經與 Grab 進行中,Grab 正在測試該模型以促進司機與旅客在接送期間的近乎即時通訊,影響一項每月處理超過 1,000 萬通語音通話的服務。
安全與浮水印
為防止錯誤資訊,Gemini 3.5 Live Translate 產生的所有音訊均使用 SynthID 進行浮水印標記。這種不可感知的浮水印會直接編織進音訊輸出中,以確保 AI 生成的內容仍可被偵測到。