Gemini 3.8 Live 与 3.8 Live Extended Thinking 发布
Google DeepMind 发布了 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,这是两个旨在实现更直观、智能且接近实时的语音交互的新模型。这些模型为生产级语音智能体提供了基础架构,将对话智能与并行推理和视觉落地相结合。
模型变体与核心能力
Google 引入了两个不同版本的 Live 音频模型,以平衡成本、规模和智能:
- Gemini 3.8 Live: 针对规模和成本效益进行了优化。它将流畅的对话与视觉落地以及近乎实时处理视觉输入的能力相结合。
- Gemini 3.8 Live Extended Thinking: 专为高复杂度任务设计。该模型具有更高的智能和多步推理能力,允许它在说话的同时进行推理。
多模态与语言灵活性
Gemini 3.8 Live 支持 97 种语言,并能够自动检测并在对话过程中在这些语言之间进行切换。为了保持对话流,该模型可以在后台执行工具和 API 调用,同时继续与用户进行交互。
Extended Thinking 中的高级推理
Gemini 3.8 Live Extended Thinking 专为复杂工作流构建。它利用早期的语言提示(例如,“让我检查一下……”)和实时的进度叙述,在不中断对话流的情况下,让用户在执行多步后台任务期间保持知情。
性能基准测试
Gemini 3.8 Live Extended Thinking 在多个关键的语音到语音(speech-to-speech)和智能体(agentic)基准测试中处于领先地位:
- Speech to Speech Quality Index: 由 Artificial Analysis 评定,总排名第 1,得分为 82.6。
- Agentic Task Completion: 在 $\tau$-Voice 上达到 68.6%,在 Sierra 的 $\tau$-Voice-banking 基准测试中达到 35.1%。
- Reasoning: 在 Big Bench Audio 上得分 97.7%。
Gemini 3.8 Live 被定位为大规模应用的成本效益替代方案,在 Speech Agent Arena 中位列第二。
在 ServiceNow 的 EVA-Bench 上,据报告这两个模型通过平衡准确性与对话质量,推动了复杂工作流的 Pareto Frontier。
开发者与企业集成
这些模型可以通过 Gemini Live API 访问,该 API 已集成到多个开发者平台,以简化语音驱动界面的部署。这些平台包括:
- 基础设施平台: Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel, 和 Vision Agents。
- 企业合作伙伴: Salesforce, Genspark, 和 Lumeris。
安全与透明度
为了防止误导信息,这些模型生成的所有音频都使用 SynthID 进行了水印处理。这种不可察觉的水印直接编织在音频输出中,以确保 AI 生成的内容保持可检测性。
可用性
Gemini 3.8 Live 和 3.8 Live Extended Thinking 将从 2026 年 9 月 15 日开始在以下渠道陆续推出:
- 开发者: 可通过 Gemini API 和 Google AI Studio 访问。
- 企业: 在 Gemini Enterprise 中提供私测版,并即将为 Gemini Enterprise for Customer Experience(以及针对 Extended Thinking 模型的 Google Workspace 商业客户)提供。
- 通用用户: Gemini 3.8 Live 可在 Search Live 中使用。Gemini 3.8 Live Extended Thinking 可在 Gemini Live 中使用,面向 Workspace Docs 的 Google AI Pro 和 Ultra 订阅者,以及面向 Gmail 和 Keep 的所有 Google AI 订阅者。