deepgram/deepgram-python-sdk

Official Python SDK for Deepgram.

解决的问题

该 SDK 为 Python 开发者提供了一种标准化的方式,将 Deepgram 的 AI 模型(语音转文本、文本转语音、语言理解)集成到其应用程序中,无需编写原始 API 请求。

工作原理

该 SDK 作为 Deepgram API 的封装,提供同步和异步客户端。支持多种交互模式:

  • 实时流式传输: 使用 WebSockets 实现实时语音识别和交互式语音代理。
  • 文件处理: 处理预录制音频文件的上传和转录。
  • 音频生成: 将文本转换为自然流畅的语音。
  • 文本分析: 处理文本以检测情感、主题和意图。
  • 自定义传输: 允许开发者用自定义实现替换默认的 WebSocket 传输,包括专用于 AWS SageMaker 端点的传输。

适用人群

开发语音应用、对话式 AI 代理、自动转录服务或文本分析工具的开发者。

主要亮点

  • 全面的模态支持: 支持语音转文本(Listen)、文本转语音(Speak)和文本智能(Read)。
  • 对话式 AI: 内置支持创建结合倾听、思考(通过 GPT-4o-mini 等 LLM)和说话的交互式语音代理。
  • 异步支持: 完全支持 async/await,实现非阻塞 I/O 操作。
  • 灵活的身份验证: 支持服务器端使用的 API 密钥和客户端侧安全的一次性访问令牌。
  • 可扩展的网络: 支持自定义 HTTP 客户端和传输工厂,适用于替代协议或云部署。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目