Google DeepMind 宣布推出 Gemini 3.8 Live 搭配即時虛擬化身
TL;DR
Google DeepMind 推出 Gemini 3.8 Live 搭配即時虛擬化身功能,將 Gemini 3.8 Live 的即時對話能力與低延遲、口型同步的視訊化身結合,讓企業能提供多語言、具視覺表現力的對話型代理。
對話式 AI 的即時視覺存在感
Gemini 3.8 Live 搭配即時虛擬化身為現有的即時對話模型新增了近乎即時的視訊生成功能。系統能同時處理音訊與視覺輸入,並產生同步的語音、面部表情與精確的口型同步。這創造出一個能聽、能看、能說的動態視覺形象,讓使用者互動感覺更自然。
"透過將近乎即時的視訊生成與語音結合,即時虛擬化身功能創造出一種能聽、能看、能說的動態視覺形象體驗。" – DeepMind 博客
非同步工具執行的多模態推理
虛擬化身由 Gemini 先進的推理引擎驅動。它能非同步呼叫工具——在背景中取得資料或執行動作——同時維持對話不中斷。這使得酒店入住等複雜工作流程得以順暢執行,而不會破壞對話流。
"即時虛擬化身可在持續對話的同時觸發工具呼叫並在背景中取得資料,處理複雜任務,同時確保對話流程不中斷。" – DeepMind 博客
支援 97 種語言的原生多語言口型同步
即時虛擬化身支援無縫語言切換。當在 97 種支援語言之間切換時,模型會動態調整口型同步與面部表情,確保視訊品質並避免視覺漂移。
"此功能會動態調整口型同步與表情,並能無縫切換 97 種語言,不會降低視訊品質或引入視覺漂移。" – DeepMind 博客
可自訂的化身以符合品牌風格
企業可從預設化身圖庫中選擇,或從高品質參考影像生成自訂化身。自訂化身會保留參考影像的外貌與品牌風格,但目前僅限企業白名單用戶使用。
安全性、透明度與水印技術
所有音訊與視訊輸出均嵌入 DeepMind 的 SynthID 水印,這是一種不可察覺的訊號,嵌入媒體中以讓 AI 生成內容可被識別。模型卡詳細說明了額外的防護措施與負責任的部署實務。
"我們 AI 產品所產生的所有輸出均以 SynthID 水印標記。此不可察覺的水印直接嵌入音訊與視訊輸出中,有助於確保 AI 生成內容仍可被識別。" – DeepMind 博客
可用性與入門指南
Gemini 3.8 Live 搭配即時虛擬化身目前已透過 Gemini Enterprise 一般可用。開發者可透過 Gemini Enterprise Agent Platform 使用此功能,並可透過 API 文件與控制台介面快速整合。
- 產品頁面: Gemini Enterprise
- API 文件: https://docs.cloud.google.com/gemini-enterprise-agent-platform/models/live-api
- 模型卡: https://deepmind.google/models/model-cards/gemini-3-8-audio/
對企業 AI 的影響
即時視覺化身的推出,將對話型代理的應用範圍從文字與語音擴展至視覺層面,使企業能提供更豐富的客戶互動體驗,例如互動式導覽、虛擬助理與多語言支援。透過整合非同步工具呼叫,系統能在不犧牲對話連續性的前提下處理複雜任務,這對高頻率企業部署而言是關鍵需求。
局限與未來方向
目前自訂化身的建立僅限企業白名單用戶,且該功能在極端網路延遲下的表現尚未公開。未來更新預期將擴展化身自訂功能、改善延遲,並進一步擴展語言覆蓋範圍。
結論
Gemini 3.8 Live 搭配即時虛擬化身代表了朝向完全多模態、可品牌化的 AI 代理的重要一步,這些代理能即時看見、說話並被看見,使 Google DeepMind 的 Gemini 平台成為企業級對話體驗的領先解決方案。