Gemini 3.8 Live 與 3.8 Live Extended Thinking 發佈

Google DeepMind 已發佈 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking,這兩款新模型旨在實現更直覺、更智慧且接近即時的語音互動。這些模型為生產就緒的語音代理提供基礎設施,將對話智慧與平行推理及視覺定位(visual grounding)相結合。

模型變體與核心能力

Google 推出了兩款不同的 Live 音訊模型版本,以平衡成本、規模與智慧程度:

  • Gemini 3.8 Live: 優化了規模與成本效益。它結合了流暢的對話、視覺定位以及近乎即時處理視覺輸入的能力。
  • Gemini 3.8 Live Extended Thinking: 專為高複雜度任務設計。此模型具備更高的智慧與多步驟推理能力,使其能夠在推理的同時進行說話。

多模態與語言靈活性

Gemini 3.8 Live 支援 97 種語言,並具備在對話中自動偵測並在這些語言之間切換的能力。為了維持對話流,模型可以在背景執行工具與 API 調用,同時繼續與使用者互動。

Extended Thinking 中的進階推理

Gemini 3.8 Live Extended Thinking 是為複雜工作流而建構的。它利用早期的口頭提示(例如:「讓我檢查一下...」)以及即時進度敘述,在不中斷對話流的情況下,讓使用者在執行多步驟背景任務時隨時掌握資訊。

性能基準測試

Gemini 3.8 Live Extended Thinking 在多項關鍵的語音對語音(speech-to-speech)與代理任務(agentic)基準測試中領先:

  • Speech to Speech Quality Index: 由 Artificial Analysis 評定,總排名第 1,分數為 82.6。
  • Agentic Task Completion: 在 $\tau$-Voice 上達到 68.6%,在 Sierra 的 $\tau$-Voice-banking 基準測試中達到 35.1%。
  • Reasoning: 在 Big Bench Audio 上獲得 97.7% 的分數。

Gemini 3.8 Live 被定位為具備規模效益的成本優化方案,在 Speech Agent Arena 中獲得第二名。

在 ServiceNow 的 EVA-Bench 上,據報導這兩款模型透過平衡準確度與對話品質,推動了複雜工作流的 Pareto Frontier。

開發者與企業整合

這些模型可透過 Gemini Live API 進行存取,該 API 已整合至多個開發者平台,以簡化語音驅動介面的部署。這些平台包括:

  • Infrastructure Platforms: Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel, 以及 Vision Agents。
  • Enterprise Partners: Salesforce, Genspark, 以及 Lumeris。

安全性與透明度

為了防止錯誤資訊,這些模型產生的所有音訊都使用 SynthID 進行浮水印標記。這種肉眼無法察覺的浮水印直接編織在音訊輸出中,以確保 AI 生成的內容保持可偵測性。

可用性

Gemini 3.8 Live 與 3.8 Live Extended Thinking 將從 2026 年 9 月 15 日開始,透過以下管道逐步推出:

  • Developers: 可透過 Gemini API 與 Google AI Studio 取得。
  • Enterprises: 在 Gemini Enterprise 中提供私有預覽版,並即將在 Gemini Enterprise for Customer Experience 中推出(以及針對 Extended Thinking 模型的 Google Workspace 商業客戶提供服務)。
  • General Users: Gemini 3.8 Live 可在 Search Live 中使用。Gemini 3.8 Live Extended Thinking 可在 Gemini Live 中使用,並提供給 Workspace Docs 的 Google AI Pro 與 Ultra 訂閱者,以及 Gmail 與 Keep 的所有 Google AI 訂閱者使用。

Sources