Gemini 3.1 Flash Live 版本說明 / 新功能概覽
Google DeepMind 宣佈推出 Gemini 3.1 Flash Live,迄今為止最高品質的音訊與語音模型。此模型旨在透過降低延遲並提升對聲音細微差異的理解能力,實現更流暢、自然且精確的即時對話。
技術性能與基準測試
Gemini 3.1 Flash Live 在語音優先代理人的推理與任務執行方面展現出顯著提升。該模型在多項關鍵音訊基準測試中名列前茅:
- ComplexFuncBench Audio:模型取得 90.8% 的分數,在具備各種限制的多步驟函式呼叫方面領先。
- Audio MultiChallenge (Scale AI):在啟用「thinking」模式下,模型取得 36.1% 的分數,在真實音訊中斷與猶豫期間的複雜指令遵循與長期推理測試中領先。
強化的音訊功能
該模型具備改進的音調理解與聲學敏感度,讓互動更自然:
- 音調辨識:Gemini 3.1 Flash Live 在辨識音高與節奏方面較先前的 2.5 Flash Native Audio 模型更為有效。
- 動態回應:模型能根據使用者的沮喪或困惑表達動態調整回應。
- 環境韌性:模型設計能在噪音環境中仍處理複雜任務。
產品整合與可用性
Gemini 3.1 Flash Live 已整合至多個 Google 平台,服務不同使用者族群:
- 開發者:可於 Google AI Studio 透過 Gemini Live API 預覽使用。
- 企業:可透過 Gemini Enterprise 用於客戶體驗。
- 一般使用者:已整合至 Search Live 與 Gemini Live。
使用者體驗改進
對於最終使用者而言,3.1 Flash Live 模型提供更直覺的互動體驗:
- 更快回應:Gemini Live 現在相較於先前版本提供更快速的回應。
- 延伸上下文:模型能追蹤對話脈絡的時間長度提升至原先的兩倍,改善長時間腦力激盪會議的連貫性。
- 全球擴展:受益於模型本身的多語言能力,Search Live 已擴展至超過 200 個國家與地區,讓使用者可以偏好的語言進行即時多模態對話。
安全與責任
為防止錯誤資訊的散播,所有由 Gemini 3.1 Flash Live 產生的音訊皆使用 SynthID 加上水印。此肉眼不可見的水印直接嵌入音訊輸出,以便可靠偵測 AI 生成的內容。