Gemini 3.8 Live 和 3.8 Live Extended Thinking 发布
Google 发布了 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,这是两款针对近实时推理和直观语音交互进行优化的新模型。这些模型旨在通过语音实现更流畅、更具协作性的对话以及复杂任务的执行,目标受众涵盖开发者和企业用户。
高性能语音推理与基准测试
Gemini 3.8 Live Extended Thinking 被定位为处理复杂工作流的高智能模型。它目前在 Artificial Analysis 的语音转语音质量指数(Speech to Speech Quality Index)中以 82.6 分位居榜首。在智能体任务完成度方面,它在 $\tau$-Voice 上达到了 68.6%,在 Sierra 的 $\tau$-Voice-banking 基准测试中达到了 35.1%。此外,它在 Big Bench Audio 上获得了 97.7% 的分数。
Gemini 3.8 Live 专为规模化和成本效益而设计,在 Speech Agent Arena 中排名第二。这两款模型都以在准确性和对话质量之间取得平衡而著称,推动了 ServiceNow 的 EVA-Bench 在复杂工作流方面的帕累托前沿(Pareto Frontier)。
关键技术能力
实时多模态集成
Gemini 3.8 Live 近乎实时地处理视觉输入,使模型能够将对话建立在视觉语境之上。它支持在对话过程中自动检测并切换 97 种受支持的语言。
并行执行与推理
Gemini 3.8 Live 可以在保持持续对话的同时在后台执行工具调用和 API 调用。Gemini 3.8 Live Extended Thinking 更进一步,能够同时进行推理和对话。它使用自然的口头提示(例如:“让我检查一下……”)和实时进度叙述,在多步骤后台任务期间让用户随时了解情况,而不会中断对话流程。
开发者与企业生态系统
Google 通过 Gemini Live API 提供这些模型,该 API 已与包括 Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 和 Vision Agents 在内的开发者平台集成。这些平台负责处理实时媒体流基础设施,使开发者能够专注于用户体验。
Salesforce、Genspark 和 Lumeris 等企业合作伙伴已经开始使用这些模型,并称赞其低延迟和强大的工具调用能力。
安全性与可用性
为了防止虚假信息,这些模型生成的所有音频都使用 SynthID 进行了水印处理,这是一种直接编织在音频输出中的不可察觉的水印。
可用性推出计划:
- Gemini 3.8 Live: 开发者可通过 Gemini API 和 Google AI Studio 使用;Gemini Enterprise 用户处于私有预览阶段;所有用户均可在 Search Live 中使用。
- Gemini 3.8 Live Extended Thinking: 开发者可通过 Gemini API 和 Google AI Studio 使用;Gemini Enterprise 和 Google Workspace 商业客户处于私有预览阶段;Workspace (Docs) 中的 Google AI Pro 和 Ultra 订阅者以及 Gmail 和 Keep 中的所有 Google AI 订阅者均可使用。
社区反馈与用户见解
用户对此次发布的反应褒贬不一,突显了这些模型在实际应用中的优势和劣势。
优势
- 语言支持: 用户称赞了该模型处理小众语言的能力,一位用户指出它“在说 [Afrikaans] 方面表现出色”,并为稀有语言提供了宝贵的对话伙伴。
- 用户体验: 一些用户报告称其延迟较低,且语音悦耳、逼真,能够很好地应对浓重的口音。
劣势与担忧
- 幻觉与可靠性: 一些开发者报告称,该模型在智能体场景中可能表现得“更笨”,会凭空捏造不存在的额外需求和实现细节。
- 推理深度: 人们对“Extended Thinking”这一品牌名称持怀疑态度,一位用户建议将其更名为“稍微扩展的思考”(Slightly Extended Thinking),因为在某些情况下,错误回复的频率高得令人不安。
- 技术问题: 出现了模型陷入自我回复的无限循环以及随机切换语言的报告。
- 产品集成: 用户对版本发布的不一致(例如,一些用户仍然看到 3.6 Flash)以及缺乏对电话呼叫集成所需的 SIP(会话发起协议)的支持表示沮丧。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch