google-gemini/gemini-live-api-examples

Gemini Live provides multimodal realtime agent capabilities. Build voice agents that can process vision and text in realtime.

解決的問題

本儲存庫提供 Gemini Live API 的實作範例,此 API 可實現低延遲、即時的語音與影片互動。解決了建構自然、類似人類對話體驗的問題,能同時處理連續的音訊、影片與文字串流。

運作方式

本專案示範如何使用具狀態的 WebSocket 連接(WSS)連接到 Live API。提供多種實作路徑:

  • Gen AI SDK:以 Python 為基礎,方便使用的做法。
  • 原始 WebSocket:使用 JavaScript 前端與 Python 後端,直接控制協定。
  • 命令列工具:以 Python 與 Node.js 編寫的最小化應用程式,可串流麥克風音訊並接收即時回應。
  • 翻譯工具:示範如何串流遠端音訊 URL 以實現即時翻譯。

適用對象

為電商(購物助手)、遊戲(互動 NPC)、醫療(健康伴侶)、教育(AI 導師),以及機器人或智慧眼鏡等下一代介面開發即時 AI 代理的開發者。

主要特色

  • 多模態輸入/輸出:支援原始 16 位 PCM 音訊、JPEG 圖像/影片與文字。
  • 搶話功能(Barge-in):允許使用者在模型回應過程中中斷,實現更快速的互動。
  • 工具使用:整合函式呼叫與 Google 搜尋,實現動態功能。
  • 情感化對話:根據使用者表情自適應調整回應的語氣與風格。
  • 語言多樣性:支援 70 種語言。
  • 音訊轉錄:為使用者與模型輸出提供文字轉錄。

相關

  • 專案
  • Dispatch
  • 專案
  • 專案
  • 專案