google-gemini/gemini-live-api-examples

Gemini Live provides multimodal realtime agent capabilities. Build voice agents that can process vision and text in realtime.

해결하는 문제

이 저장소는 저지연, 실시간 음성 및 비디오 상호작용을 가능하게 하는 Gemini Live API의 구현 예제를 제공합니다. 지속적인 오디오, 비디오, 텍스트 스트림을 동시에 처리할 수 있는 자연스럽고 인간처럼 느껴지는 대화 경험을 구축하는 문제를 해결합니다.

작동 방식

이 프로젝트는 상태 유지형 WebSocket 연결(WSS)을 사용하여 Live API에 연결하는 방법을 보여줍니다. 다음과 같은 여러 구현 경로를 제공합니다:

  • Gen AI SDK: 사용 편의성을 위해 Python 기반의 접근 방식.
  • Raw WebSockets: JavaScript 프론트엔드와 Python 백엔드를 사용하여 프로토콜을 직접 제어.
  • 명령줄 도구: Python과 Node.js로 작성된 최소한의 앱으로 마이크 오디오를 스트리밍하고 실시간 응답을 수신.
  • 번역 도구: 원격 오디오 URL을 스트리밍하여 실시간 번역을 수행하는 예제.

대상 사용자

e커머스(쇼핑 어시스턴트), 게임(상호작용 NPC), 헬스케어(건강 동반자), 교육(AI 멘토), 로봇 또는 스마트글래스용 차세대 인터페이스 등 실시간 AI 에이전트를 개발하는 개발자들.

주요 특징

  • 다중 모달 입력/출력: 16비트 PCM 오디오, JPEG 이미지/비디오, 텍스트를 지원.
  • 바지인(Barge-in): 모델의 응답 중 사용자가 중단할 수 있어 더 반응성이 높은 상호작용 가능.
  • 도구 사용: 함수 호출 및 Google 검색을 통합하여 동적 기능 제공.
  • 감정적 대화: 사용자의 표정에 맞춰 응답의 톤과 스타일을 조정.
  • 언어 다양성: 70개 언어 지원.
  • 오디오 전사: 사용자 및 모델 출력에 대한 텍스트 전사 제공.

관련

  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트