Gemini 3.1 Flash Live 版本說明 / 新功能概覽

Google DeepMind 宣佈推出 Gemini 3.1 Flash Live,迄今為止最高品質的音訊與語音模型。此模型旨在透過降低延遲並提升對聲音細微差異的理解能力,實現更流暢、自然且精確的即時對話。

技術性能與基準測試

Gemini 3.1 Flash Live 在語音優先代理人的推理與任務執行方面展現出顯著提升。該模型在多項關鍵音訊基準測試中名列前茅:

  • ComplexFuncBench Audio:模型取得 90.8% 的分數,在具備各種限制的多步驟函式呼叫方面領先。
  • Audio MultiChallenge (Scale AI):在啟用「thinking」模式下,模型取得 36.1% 的分數,在真實音訊中斷與猶豫期間的複雜指令遵循與長期推理測試中領先。

強化的音訊功能

該模型具備改進的音調理解與聲學敏感度,讓互動更自然:

  • 音調辨識:Gemini 3.1 Flash Live 在辨識音高與節奏方面較先前的 2.5 Flash Native Audio 模型更為有效。
  • 動態回應:模型能根據使用者的沮喪或困惑表達動態調整回應。
  • 環境韌性:模型設計能在噪音環境中仍處理複雜任務。

產品整合與可用性

Gemini 3.1 Flash Live 已整合至多個 Google 平台,服務不同使用者族群:

  • 開發者:可於 Google AI Studio 透過 Gemini Live API 預覽使用。
  • 企業:可透過 Gemini Enterprise 用於客戶體驗。
  • 一般使用者:已整合至 Search Live 與 Gemini Live。

使用者體驗改進

對於最終使用者而言,3.1 Flash Live 模型提供更直覺的互動體驗:

  • 更快回應:Gemini Live 現在相較於先前版本提供更快速的回應。
  • 延伸上下文:模型能追蹤對話脈絡的時間長度提升至原先的兩倍,改善長時間腦力激盪會議的連貫性。
  • 全球擴展:受益於模型本身的多語言能力,Search Live 已擴展至超過 200 個國家與地區,讓使用者可以偏好的語言進行即時多模態對話。

安全與責任

為防止錯誤資訊的散播,所有由 Gemini 3.1 Flash Live 產生的音訊皆使用 SynthID 加上水印。此肉眼不可見的水印直接嵌入音訊輸出,以便可靠偵測 AI 生成的內容。

Sources