elevenlabs/elevenlabs-python

The official Python SDK for the ElevenLabs API.

解決的問題

此套件為開發者提供了一種程式化方式,將 ElevenLabs 的高保真 AI 語音整合至其應用程式中。它簡化了將文字轉換為語音、克隆語音,以及建立即時互動式語音代理的流程,無需手動處理原始 HTTP 請求。

工作原理

SDK 作為 ElevenLabs API 的封裝,提供同步與非同步客戶端。它提供以下專用模組:

  • 文字轉語音:使用多種模型(如 Eleven v3 或 Flash v2.5)將文字轉換為音訊,並支援即時串流音訊輸出。
  • 語音克隆:透過上傳的音訊樣本建立新的語音設定檔。
  • 對話式 AI:提供工具以建立可處理即時音訊輸入/輸出並執行自訂 Python 函數(工具)的互動式代理。
  • 語音引擎:一種伺服器端框架,允許開發者的伺服器作為 WebSocket 端點,接收來自 ElevenLabs 的轉錄文字,並即時串流 LLM 回應以進行合成。

適用對象

希望在其軟體專案中加入逼真 AI 語音、語音克隆或即時對話式 AI 代理的開發者與創作者。

主要特色

  • 多種模型選項:支援多種針對不同需求優化的模型,例如超低延遲(Flash)或高戲劇性表現(v3)。
  • 即時串流:可在生成音訊時即時串流,以減少感知延遲。
  • 語音克隆:透過音訊樣本即時建立語音。
  • 代理功能:支援建立可註冊自訂工具以取得外部資料或執行計算的互動式代理。
  • LLM 整合:語音引擎可自動偵測並解析來自 OpenAI、Anthropic 和 Google Gemini 的串流格式。

相關

  • 專案
  • 專案
  • 專案
  • 專案