Gemini 3.8 Live 與 3.8 Live Extended Thinking 發布

Google 發布了 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking,這是兩款針對近乎即時的推理與直覺式語音互動所優化的新模型。這些模型旨在透過語音實現更流暢、協作式的對話以及執行複雜任務,目標客群涵蓋開發者與企業用戶。

高效能語音推理與基準測試

Gemini 3.8 Live Extended Thinking 被定位為處理複雜工作流程的高智慧模型。它目前在 Artificial Analysis 的語音轉語音品質指數(Speech to Speech Quality Index)中以 82.6 分位居榜首。在代理任務完成度方面,它在 $\tau$-Voice 上達到 68.6%,在 Sierra 的 $\tau$-Voice-banking 基準測試中達到 35.1%。此外,它在 Big Bench Audio 上獲得了 97.7% 的分數。

Gemini 3.8 Live 專為規模化與成本效益而設計,在 Speech Agent Arena 中排名第二。兩款模型皆以平衡準確度與對話品質的能力著稱,並在 ServiceNow 的 EVA-Bench 上推動了複雜工作流程的帕累托前沿(Pareto Frontier)。

關鍵技術能力

即時多模態整合

Gemini 3.8 Live 能以近乎即時的速度處理視覺輸入,使模型能夠將對話建立在視覺情境中。它支援在對話中自動偵測並切換 97 種支援的語言。

平行執行與推理

Gemini 3.8 Live 可以在維持連續對話的同時,在背景執行工具與 API 呼叫。Gemini 3.8 Live Extended Thinking 更進一步,能夠同時進行推理與對話。它使用自然的口語提示(例如:「讓我檢查一下...」)與即時進度敘述,讓用戶在多步驟背景任務期間隨時掌握狀況,而不會中斷對話流程。

開發者與企業生態系統

Google 透過 Gemini Live API 提供這些模型,並已與包括 Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 與 Vision Agents 在內的開發者平台整合。這些平台負責處理即時媒體串流基礎設施,讓開發者能專注於用戶體驗。

Salesforce、Genspark 與 Lumeris 等企業合作夥伴已開始使用這些模型,並指出其低延遲與強大的工具呼叫能力是主要優勢。

安全性與可用性

為了防止錯誤資訊,這些模型產生的所有音訊皆使用 SynthID 進行浮水印標記,這是一種直接編織在音訊輸出中且無法察覺的浮水印。

可用性推廣:

  • Gemini 3.8 Live: 開發者可透過 Gemini API 與 Google AI Studio 使用;Gemini Enterprise 用戶可進行私人預覽;所有用戶皆可在 Search Live 中使用。
  • Gemini 3.8 Live Extended Thinking: 開發者可透過 Gemini API 與 Google AI Studio 使用;Gemini Enterprise 與 Google Workspace 商業客戶可進行私人預覽;Workspace (Docs) 的 Google AI Pro 與 Ultra 訂閱者,以及 Gmail 與 Keep 的所有 Google AI 訂閱者皆可使用。

社群回饋與用戶洞察

用戶對此次發布的反應不一,突顯了這些模型在實際應用中的優勢與劣勢。

優勢

  • 語言支援: 用戶稱讚模型處理小眾語言的能力,有用戶指出它「在說 [Afrikaans] 方面表現驚人」,並為稀有語言提供了寶貴的對話夥伴。
  • 用戶體驗: 部分用戶回報了低延遲以及悅耳、逼真的語音,且能很好地應對濃重的口音。

劣勢與疑慮

  • 幻覺與可靠性: 一些開發者回報模型在代理場景中可能顯得「較笨」,會憑空捏造不存在的額外需求與實作細節。
  • 推理深度: 對於「Extended Thinking」(擴展思考)的品牌命名存在質疑,有用戶建議應改名為「稍微擴展思考」(Slightly Extended Thinking),因為在某些情況下出現了令人不安的高比例錯誤回覆。
  • 技術問題: 出現了模型陷入自我回覆的無限迴圈以及隨機切換語言的報告。
  • 產品整合: 用戶對版本發布的不一致(例如:部分用戶仍看到 3.6 Flash)以及缺乏對 SIP (Session Initiation Protocol) 進行電話整合的支援感到沮喪。

Sources

相關