Gemini 3.5 Transcribe 發佈說明
Google DeepMind 推出了 Gemini 3.5 Transcribe,這是一款高精度的語音轉文字模型,旨在將原始音訊直接轉換為精煉且格式化的文字。該模型透過處理背景噪音、複雜術語以及不流暢性(例如填充詞和自我修正)進行改進,能產生適合即時語音互動的乾淨逐字稿。
開發者存取與 API 實作
Gemini 3.5 Transcribe 可透過兩種不同的 API 來支援不同的開發者工作流程:
- 即時串流 (
gemini-3.5-transcribe-live): 透過 Live API 提供,此版本提供低於一秒的延遲,實現連續且雙向的串流,適用於互動式語音應用程式。 - 預錄音訊處理 (
gemini-3.5-transcribe): 透過 Interactions API 提供,此版本針對錄音、會議和通話紀錄進行了優化,具備說話者歸屬功能和字級時間戳記。
開發者可以透過 Google AI Studio 和 Gemini Enterprise Agent Platform 中的 Gemini API 存取這些模型。
技術能力與效能
Gemini 3.5 Transcribe 引入了多項「智慧逐字稿」功能,且相較於先前的 Chirp 3 模型在效能上有顯著提升:
逐字稿精準度與智慧化
- 不流暢性清理: 模型會自動移除填充詞(例如「嗯」、「啊」)並處理自我修正(例如「我們週二見——不,週三見」)。
- 自定義詞彙: 模型可透過提供的自定義詞彙表來適應專業術語和獨特的拼寫方式。
- 多語言支援: 它能自動偵測並逐字稿超過 85 種語言,包括各種地區口音和方言。
- 多說話者識別: 對於預錄音訊,模型可將語音歸屬至最多三位說話者並附上時間戳記(支援超過三位說話者的功能目前仍處於實驗階段)。
- 函式呼叫 (Function Calling): 在 Gemini macOS app 中,模型可以透過函式呼叫將複雜任務(例如檔案分析或圖像生成)委派給其他 Gemini 模型。
基準測試與準確度
根據 Artificial Analysis 的測量,Gemini 3.5 Transcribe 在串流模式下達到 4.0% 的平均字錯誤率 (WER),在非串流模式下達到 2.6% 的 WER。在涵蓋頂尖語言和地區的 FLEURS 基準測試中,它在串流模式下達到 5.50% 的 WER,在非串流模式下達到 5.04% 的 WER。
與 Chirp 3 相比,該模型在生成最終逐字稿所需的時間上提升了 70%。
產品整合
Gemini 3.5 Transcribe 已整合至多個 Google 服務中,以實現具備上下文感知能力的語音互動:
- Gboard (Android): 「Rambler」功能使用該模型將口說想法轉換為格式化的文字,並允許透過語音進行編輯和風格變更。
- Google Antigravity: 模型利用螢幕上下文和聊天紀錄來提高檔案名稱和活動文件的逐字稿準確度。
- Gemini app (macOS): 支援自然語音逐字稿和語音指令,並可結合螢幕上下文來摘要本地檔案或生成圖像。
- Google AI Studio: 在 Build 模式中可用於語音驅動的應用程式開發(「vibe coding」)。
- Chrome: 即將推出,該模型將在任何網頁欄位中啟用「說話即輸入」功能。
生態系統採用
多個開發者平台已整合 Gemini Live API 以促進語音驅動介面的部署,包括 Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel, 以及 Vision Agents。此外,Vivo, Intellitek Health, 以及 Lingopal 等公司也報告了該模型在延遲和語言支援方面的正面結果。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch