google-gemini/gemini-live-api-examples
Gemini Live provides multimodal realtime agent capabilities. Build voice agents that can process vision and text in realtime.
해결하는 문제
이 저장소는 저지연, 실시간 음성 및 비디오 상호작용을 가능하게 하는 Gemini Live API의 구현 예제를 제공합니다. 지속적인 오디오, 비디오, 텍스트 스트림을 동시에 처리할 수 있는 자연스럽고 인간처럼 느껴지는 대화 경험을 구축하는 문제를 해결합니다.
작동 방식
이 프로젝트는 상태 유지형 WebSocket 연결(WSS)을 사용하여 Live API에 연결하는 방법을 보여줍니다. 다음과 같은 여러 구현 경로를 제공합니다:
- Gen AI SDK: 사용 편의성을 위해 Python 기반의 접근 방식.
- Raw WebSockets: JavaScript 프론트엔드와 Python 백엔드를 사용하여 프로토콜을 직접 제어.
- 명령줄 도구: Python과 Node.js로 작성된 최소한의 앱으로 마이크 오디오를 스트리밍하고 실시간 응답을 수신.
- 번역 도구: 원격 오디오 URL을 스트리밍하여 실시간 번역을 수행하는 예제.
대상 사용자
e커머스(쇼핑 어시스턴트), 게임(상호작용 NPC), 헬스케어(건강 동반자), 교육(AI 멘토), 로봇 또는 스마트글래스용 차세대 인터페이스 등 실시간 AI 에이전트를 개발하는 개발자들.
주요 특징
- 다중 모달 입력/출력: 16비트 PCM 오디오, JPEG 이미지/비디오, 텍스트를 지원.
- 바지인(Barge-in): 모델의 응답 중 사용자가 중단할 수 있어 더 반응성이 높은 상호작용 가능.
- 도구 사용: 함수 호출 및 Google 검색을 통합하여 동적 기능 제공.
- 감정적 대화: 사용자의 표정에 맞춰 응답의 톤과 스타일을 조정.
- 언어 다양성: 70개 언어 지원.
- 오디오 전사: 사용자 및 모델 출력에 대한 텍스트 전사 제공.
관련
- 프로젝트
- Dispatch
- 프로젝트
- 프로젝트
- 프로젝트