deepgram/deepgram-python-sdk

Official Python SDK for Deepgram.

What it solves

這個 SDK 提供統一的 Python 介面,讓開發者能存取 Deepgram 的 AI 模型,用於語音轉文字、文字轉語音與語言理解。它簡化了在應用程式中整合高效能音訊 AI 的流程,處理 API 請求、即時串流的 WebSocket 連線以及驗證等複雜工作。

How it works

SDK 同時提供同步與非同步客戶端(DeepgramClientAsyncDeepgramClient)以與 Deepgram 的 API 互動。支援以下功能:

  • Speech-to-Text (Listen): 轉錄預先錄製的檔案或透過 WebSocket 串流即時音訊以進行即時辨識。
  • Text-to-Speech (Speak): 從文字字串產生自然音質的語音。
  • Text Intelligence (Read): 分析文字的情感、主題、意圖與摘要。
  • Conversational AI (Agent): 編排完整的語音代理循環(聆聽、透過 GPT-4o-mini 等 LLM 思考、以及說話)。

Who it’s for

適合開發需要語音功能的應用程式、即時轉錄服務、AI 語音代理,或是需要自動分析口語內容文字的工具的開發者。

Highlights

  • Real-time Streaming: 內建 WebSocket 支援,提供低延遲的語音辨識與語音代理。
  • Agentic Workflow: 能夠配置完整的語音代理,並自訂聆聽、思考與說話的提供者。
  • Flexible Transport: 支援自訂傳輸層,包括專用的 SageMaker 傳輸,用於在 AWS 端點上執行模型。
  • Async Support: 完整的 async/await 實作,支援非阻塞 I/O 操作。
  • Robust Error Handling: 詳細的 ApiError 例外與具指數退避的自動重試機制。