deepgram/deepgram-python-sdk

Official Python SDK for Deepgram.

何を解決するか

このSDKは、Python開発者がDeepgramのAIモデル(音声認識、音声合成、言語理解)をアプリケーションに統合するための標準化された方法を提供し、直接APIリクエストを書く必要をなくします。

動作方法

このSDKはDeepgramのAPIをラップするもので、同期および非同期のクライアントを提供します。複数のインタラクションパターンをサポートしています:

  • リアルタイムストリーミング: WebSocketsを使用してライブ音声認識およびインタラクティブ音声エージェントを実現します。
  • ファイル処理: 事前に録音されたオーディオファイルのアップロードと字幕化を処理します。
  • 音声生成: テキストを自然な発話に変換します。
  • テキスト分析: センチメント、トピック、意図を検出するためのテキスト処理を行います。
  • カスタムトランスポート: デフォルトのWebSocketトランスポートをカスタム実装に置き換えることが可能で、AWS SageMakerエンドポイント用の特別なトランスポートもサポートしています。

対象ユーザー

音声対応アプリケーション、会話型AIエージェント、自動字幕サービス、テキスト分析ツールを開発している開発者。

主な特徴

  • 包括的なモダリティ: 音声認識(Listen)、音声合成(Speak)、テキストインテリジェンス(Read)をサポート。
  • 会話型AI: GPT-4o-miniなどのLLMを活用した「聞く」「考える」「話す」を統合したインタラクティブ音声エージェントの作成を内蔵サポート。
  • 非同期対応: 非ブロッキングI/O操作を可能にする完全な async/await 機能。
  • 柔軟な認証: サーバーサイドでの利用にはAPIキー、クライアントサイドでのセキュリティには一時的なアクセストークンをサポート。
  • 拡張可能なネットワーキング: カスタムHTTPクライアントやトランスポートファクトリをサポートし、代替プロトコルやクラウドデプロイメントに対応。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト