elevenlabs/elevenlabs-python
The official Python SDK for the ElevenLabs API.
解決的問題
此套件為開發者提供了一種程式化方式,將 ElevenLabs 的高保真 AI 語音整合至其應用程式中。它簡化了將文字轉換為語音、克隆語音,以及建立即時互動式語音代理的流程,無需手動處理原始 HTTP 請求。
工作原理
SDK 作為 ElevenLabs API 的封裝,提供同步與非同步客戶端。它提供以下專用模組:
- 文字轉語音:使用多種模型(如 Eleven v3 或 Flash v2.5)將文字轉換為音訊,並支援即時串流音訊輸出。
- 語音克隆:透過上傳的音訊樣本建立新的語音設定檔。
- 對話式 AI:提供工具以建立可處理即時音訊輸入/輸出並執行自訂 Python 函數(工具)的互動式代理。
- 語音引擎:一種伺服器端框架,允許開發者的伺服器作為 WebSocket 端點,接收來自 ElevenLabs 的轉錄文字,並即時串流 LLM 回應以進行合成。
適用對象
希望在其軟體專案中加入逼真 AI 語音、語音克隆或即時對話式 AI 代理的開發者與創作者。
主要特色
- 多種模型選項:支援多種針對不同需求優化的模型,例如超低延遲(Flash)或高戲劇性表現(v3)。
- 即時串流:可在生成音訊時即時串流,以減少感知延遲。
- 語音克隆:透過音訊樣本即時建立語音。
- 代理功能:支援建立可註冊自訂工具以取得外部資料或執行計算的互動式代理。
- LLM 整合:語音引擎可自動偵測並解析來自 OpenAI、Anthropic 和 Google Gemini 的串流格式。
相關
- 專案
- 專案
- 專案
- 專案