Google DeepMind 发布 Gemini 3.8 Live 与实时虚拟形象

TL;DR

Google DeepMind 推出 Gemini 3.8 Live 与实时虚拟形象功能,该功能将 Gemini 3.8 Live 的实时对话能力与低延迟、口型同步的视频形象相结合,使企业能够提供多语言、视觉表现力强的对话代理。


对话式 AI 的实时视觉呈现

Gemini 3.8 Live 与实时虚拟形象为现有的实时对话模型增加了近实时视频生成功能。该系统同时处理音频和视觉输入,并生成同步的语音、面部表情和精确的口型同步。这创造了一个能够听、看和说话的动态视觉形象,使用户交互感觉更加自然。

"通过将近实时视频生成与语音结合,实时虚拟形象功能创造了一种能够以动态视觉形象倾听、观察和说话的体验。" – DeepMind 博客

异步工具执行的多模态推理

该虚拟形象由 Gemini 的先进推理引擎支持。它可以在后台异步调用工具——获取数据或执行操作——同时保持对话不间断。这使得酒店入住等复杂工作流得以实现,而不会中断对话流程。

"实时虚拟形象可以在继续活跃对话的同时触发工具调用并后台获取数据,处理复杂任务的同时确保对话流程不间断。" – DeepMind 博客

支持 97 种语言的原生多语言口型同步

实时虚拟形象支持无缝的语言切换。当在 97 种支持的语言之间切换时,该模型会动态调整口型同步和面部表情,保持视频质量并避免视觉漂移。

"该功能会动态调整其口型同步和表情,并能无缝切换至 97 种语言,而不会降低视频质量或引入视觉漂移。" – DeepMind 博客

可自定义的虚拟形象以匹配品牌

企业可以从预设虚拟形象库中选择,或从高质量参考图像生成自定义虚拟形象。自定义虚拟形象保留参考形象的外观和品牌风格,但目前仅限企业白名单用户使用。

安全性、透明度与水印技术

所有音视频输出均嵌入 DeepMind 的 SynthID 水印,这是一种不可察觉的信号,嵌入媒体中以使 AI 生成内容可被识别。模型卡片详细说明了其他安全防护措施和负责任的部署实践。

"我们所有 AI 产品生成的输出均使用 SynthID 水印。这种不可察觉的水印直接嵌入音频和视频输出中,有助于确保 AI 生成内容保持可检测性。" – DeepMind 博客

可用性与快速入门

Gemini 3.8 Live 与实时虚拟形象现已通过 Gemini Enterprise 通用可用。开发者可通过 Gemini Enterprise Agent Platform 访问该功能,配备 API 文档和控制台 UI,实现快速集成。


对企业 AI 的影响

实时视觉形象的引入将对话代理的范围从文本和语音扩展到视觉层面,使企业能够提供更丰富的客户体验,例如交互式导览、虚拟助手和多语言支持。通过集成异步工具调用,系统能够在不牺牲对话连续性的情况下处理复杂任务,这对高吞吐量的企业部署至关重要。


局限性与未来方向

目前,自定义虚拟形象创建仅限企业白名单用户,且该功能在极端网络延迟下的表现尚未披露。未来更新预计将扩大虚拟形象自定义范围,改善延迟表现,并扩展语言支持。


结论

Gemini 3.8 Live 与实时虚拟形象标志着迈向完全多模态、可品牌化的 AI 代理的重要一步,这些代理能够实时看见、说话并被看见,使 Google DeepMind 的 Gemini 平台成为企业级对话体验的领先解决方案。

Sources