google-gemini/gemini-live-api-examples
Gemini Live provides multimodal realtime agent capabilities. Build voice agents that can process vision and text in realtime.
解决的问题
本仓库提供了 Gemini Live API 的实现示例,该 API 可实现低延迟、实时的语音和视频交互。它解决了构建自然、类人对话体验的难题,能够同时处理连续的音频、视频和文本流。
工作原理
该项目展示了如何使用带有状态的 WebSocket 连接(WSS)连接到 Live API。提供了多种实现路径:
- Gen AI SDK:基于 Python 的方法,便于使用。
- 原始 WebSocket:使用 JavaScript 前端和 Python 后端,实现对协议的直接控制。
- 命令行工具:使用 Python 和 Node.js 编写的最小化应用程序,用于流式传输麦克风音频并接收实时响应。
- 翻译工具:演示如何流式传输远程音频 URL 以实现实时翻译。
适用人群
为电商(购物助手)、游戏(互动 NPC)、医疗(健康伴侣)、教育(AI 导师)以及机器人或智能眼镜等下一代界面开发实时 AI 代理的开发者。
主要亮点
- 多模态输入/输出:支持原始 16 位 PCM 音频、JPEG 图像/视频和文本。
- 打断功能(Barge-in):允许用户在模型响应过程中打断,实现更快速的交互。
- 工具调用:集成函数调用和 Google 搜索,实现动态功能。
- 情感化对话:根据用户表情自适应调整响应的语气和风格。
- 语言多样性:支持 70 种语言。
- 音频转录:为用户和模型输出提供文本转录。
相关
- 项目
- Dispatch
- 项目
- 项目
- 项目