deepgram/deepgram-python-sdk
Official Python SDK for Deepgram.
What it solves
이 SDK는 통합된 Python 인터페이스를 제공하여 Deepgram의 AI 모델(음성‑텍스트, 텍스트‑음성, 언어 이해)에 접근할 수 있게 합니다. 고성능 오디오 AI를 애플리케이션에 통합하는 과정을 단순화하고, API 요청, 실시간 스트리밍을 위한 WebSocket 연결, 인증 등의 복잡성을 처리합니다.
How it works
SDK는 동기와 비동기 클라이언트(DeepgramClient와 AsyncDeepgramClient)를 모두 제공하여 Deepgram API와 상호작용합니다. 지원 기능은 다음과 같습니다:
- Speech-to-Text (Listen): 사전 녹음 파일을 전사하거나 WebSocket을 통해 실시간 오디오를 스트리밍하여 실시간 인식.
- Text-to-Speech (Speak): 텍스트 문자열에서 자연스러운 음성을 생성.
- Text Intelligence (Read): 텍스트의 감정, 주제, 의도 및 요약을 분석.
- Conversational AI (Agent): 전체 음성 에이전트 루프(청취, GPT-4o-mini와 같은 LLM을 통한 사고, 발화)를 오케스트레이션.
Who it’s for
음성 기능이 포함된 애플리케이션, 실시간 전사 서비스, AI 음성 에이전트, 혹은 음성 콘텐츠의 자동 텍스트 분석이 필요한 도구를 개발하는 개발자를 위한 SDK입니다.
Highlights
- Real-time Streaming: 저지연 음성 인식 및 음성 에이전트를 위한 내장 WebSocket 지원.
- Agentic Workflow: 청취, 사고, 발화를 위한 맞춤형 제공자를 사용해 완전한 음성 에이전트를 구성할 수 있음.
- Flexible Transport: 커스텀 전송을 지원하며, AWS 엔드포인트에서 모델을 실행하기 위한 전용 SageMaker 전송도 포함.
- Async Support: 논블로킹 I/O 작업을 위한 완전한
async/await구현. - Robust Error Handling: 상세한
ApiError예외와 지수 백오프를 이용한 자동 재시도 기능.