deepgram/deepgram-python-sdk
Official Python SDK for Deepgram.
What it solves
この SDK は統一された Python インターフェースを提供し、Deepgram の AI モデル(音声からテキスト、テキストから音声、言語理解)にアクセスできます。高性能なオーディオ AI をアプリケーションに統合するプロセスを簡素化し、API リクエスト、リアルタイムストリーミング用 WebSocket 接続、認証の複雑さを処理します。
How it works
SDK は同期クライアントと非同期クライアント(DeepgramClient と AsyncDeepgramClient)の両方を提供し、Deepgram の API とやり取りします。主な機能は次のとおりです:
- Speech-to-Text (Listen): 事前録音ファイルの文字起こしや、WebSocket を介したライブ音声のリアルタイム認識。
- Text-to-Speech (Speak): テキスト文字列から自然な音声を生成。
- Text Intelligence (Read): テキストの感情、トピック、インテント、要約を分析。
- Conversational AI (Agent): 完全な音声エージェントループ(リスニング、GPT-4o-mini などの LLM による思考、スピーキング)をオーケストレーション。
Who it’s for
音声対応アプリケーション、リアルタイム文字起こしサービス、AI 音声エージェント、または音声コンテンツの自動テキスト分析が必要なツールを構築する開発者向けです。
Highlights
- Real-time Streaming: 低遅延の音声認識と音声エージェントのための組み込み WebSocket サポート。
- Agentic Workflow: リスニング、思考、スピーキングのカスタムプロバイダーで完全な音声エージェントを構成可能。
- Flexible Transport: カスタムトランスポートをサポートし、AWS エンドポイント上でモデルを実行する専用 SageMaker トランスポートも利用可能。
- Async Support: 非ブロッキング I/O 操作のための完全な
async/await実装。 - Robust Error Handling: 詳細な
ApiError例外と指数バックオフによる自動リトライ機能。