deepgram/deepgram-python-sdk

Official Python SDK for Deepgram.

What it solves

这个 SDK 提供统一的 Python 接口,让开发者能够访问 Deepgram 的 AI 模型,用于语音转文字、文字转语音和语言理解。它简化了在应用程序中集成高性能音频 AI 的流程,处理 API 请求、实时流式的 WebSocket 连接以及认证等复杂工作。

How it works

SDK 同时提供同步和异步客户端(DeepgramClientAsyncDeepgramClient)以与 Deepgram 的 API 交互。支持以下功能:

  • Speech-to-Text (Listen): 转录预先录制的文件或通过 WebSocket 流式实时音频以进行实时识别。
  • Text-to-Speech (Speak): 从文本字符串生成自然音质的语音。
  • Text Intelligence (Read): 分析文本的情感、主题、意图与摘要。
  • Conversational AI (Agent): 编排完整的语音代理循环(聆听、通过 GPT-4o-mini 等 LLM 思考、以及说话)。

Who it’s for

适合开发需要语音功能的应用程序、实时转录服务、AI 语音代理,或是需要自动分析口语内容文字的工具的开发者。

Highlights

  • Real-time Streaming: 内建 WebSocket 支持,提供低延迟的语音识别与语音代理。
  • Agentic Workflow: 能够配置完整的语音代理,并自定义聆听、思考与说话的提供者。
  • Flexible Transport: 支持自定义传输层,包括专用的 SageMaker 传输,用于在 AWS 端点上运行模型。
  • Async Support: 完整的 async/await 实现,支持非阻塞 I/O 操作。
  • Robust Error Handling: 详细的 ApiError 异常与具指数退避的自动重试机制。