deepgram/deepgram-python-sdk
Official Python SDK for Deepgram.
What it solves
這個 SDK 提供統一的 Python 介面,讓開發者能存取 Deepgram 的 AI 模型,用於語音轉文字、文字轉語音與語言理解。它簡化了在應用程式中整合高效能音訊 AI 的流程,處理 API 請求、即時串流的 WebSocket 連線以及驗證等複雜工作。
How it works
SDK 同時提供同步與非同步客戶端(DeepgramClient 與 AsyncDeepgramClient)以與 Deepgram 的 API 互動。支援以下功能:
- Speech-to-Text (Listen): 轉錄預先錄製的檔案或透過 WebSocket 串流即時音訊以進行即時辨識。
- Text-to-Speech (Speak): 從文字字串產生自然音質的語音。
- Text Intelligence (Read): 分析文字的情感、主題、意圖與摘要。
- Conversational AI (Agent): 編排完整的語音代理循環(聆聽、透過 GPT-4o-mini 等 LLM 思考、以及說話)。
Who it’s for
適合開發需要語音功能的應用程式、即時轉錄服務、AI 語音代理,或是需要自動分析口語內容文字的工具的開發者。
Highlights
- Real-time Streaming: 內建 WebSocket 支援,提供低延遲的語音辨識與語音代理。
- Agentic Workflow: 能夠配置完整的語音代理,並自訂聆聽、思考與說話的提供者。
- Flexible Transport: 支援自訂傳輸層,包括專用的 SageMaker 傳輸,用於在 AWS 端點上執行模型。
- Async Support: 完整的
async/await實作,支援非阻塞 I/O 操作。 - Robust Error Handling: 詳細的
ApiError例外與具指數退避的自動重試機制。