deepgram/deepgram-python-sdk
Official Python SDK for Deepgram.
What it solves
这个 SDK 提供统一的 Python 接口,让开发者能够访问 Deepgram 的 AI 模型,用于语音转文字、文字转语音和语言理解。它简化了在应用程序中集成高性能音频 AI 的流程,处理 API 请求、实时流式的 WebSocket 连接以及认证等复杂工作。
How it works
SDK 同时提供同步和异步客户端(DeepgramClient 与 AsyncDeepgramClient)以与 Deepgram 的 API 交互。支持以下功能:
- Speech-to-Text (Listen): 转录预先录制的文件或通过 WebSocket 流式实时音频以进行实时识别。
- Text-to-Speech (Speak): 从文本字符串生成自然音质的语音。
- Text Intelligence (Read): 分析文本的情感、主题、意图与摘要。
- Conversational AI (Agent): 编排完整的语音代理循环(聆听、通过 GPT-4o-mini 等 LLM 思考、以及说话)。
Who it’s for
适合开发需要语音功能的应用程序、实时转录服务、AI 语音代理,或是需要自动分析口语内容文字的工具的开发者。
Highlights
- Real-time Streaming: 内建 WebSocket 支持,提供低延迟的语音识别与语音代理。
- Agentic Workflow: 能够配置完整的语音代理,并自定义聆听、思考与说话的提供者。
- Flexible Transport: 支持自定义传输层,包括专用的 SageMaker 传输,用于在 AWS 端点上运行模型。
- Async Support: 完整的
async/await实现,支持非阻塞 I/O 操作。 - Robust Error Handling: 详细的
ApiError异常与具指数退避的自动重试机制。