elevenlabs/elevenlabs-python
The official Python SDK for the ElevenLabs API.
解决的问题
该库为开发者提供了一种程序化方式,将 ElevenLabs 的高保真 AI 语音集成到其应用程序中。它简化了将文本转换为语音、克隆语音以及构建实时交互式语音代理的过程,无需手动处理原始 HTTP 请求。
工作原理
SDK 作为 ElevenLabs API 的封装,提供同步和异步客户端。它提供以下专用模块:
- 文本转语音:使用多种模型(如 Eleven v3 或 Flash v2.5)将文本转换为音频,并支持实时流式音频输出。
- 语音克隆:通过上传的音频样本创建新的语音配置文件。
- 对话式 AI:提供工具以构建可处理实时音频输入/输出并执行自定义 Python 函数(工具)的交互式代理。
- 语音引擎:一种服务器端框架,允许开发者的服务器充当 WebSocket 端点,接收来自 ElevenLabs 的转录文本,并将 LLM 响应流式返回以进行合成。
适用人群
希望在其软件项目中添加逼真 AI 语音、语音克隆或实时对话式 AI 代理的开发者和创作者。
主要亮点
- 多种模型选项:支持多种针对不同需求优化的模型,例如超低延迟(Flash)或高戏剧性表现(v3)。
- 实时流式传输:能够在生成音频时实时流式传输,以减少感知延迟。
- 语音克隆:通过音频样本即时创建语音。
- 代理功能:支持构建可注册自定义工具以获取外部数据或执行计算的交互式代理。
- LLM 集成:语音引擎可自动检测并解析来自 OpenAI、Anthropic 和 Google Gemini 的流式格式。
相关
- 项目
- 项目
- 项目
- 项目