google-gemini/gemini-live-api-examples

Gemini Live provides multimodal realtime agent capabilities. Build voice agents that can process vision and text in realtime.

何を解決するか

このリポジトリは、低遅延でリアルタイムの音声および動画インタラクションを可能にするGemini Live APIの実装例を提供します。継続的な音声、動画、テキストのストリームを同時に処理できる、自然で人間らしい会話体験を構築する課題を解決します。

動作方法

このプロジェクトは、状態保持型のWebSocket接続(WSS)を使用してLive APIに接続する方法を示しています。以下の複数の実装パスを提供しています:

  • Gen AI SDK: シンプルな使いやすさを追求するPythonベースのアプローチ。
  • Raw WebSockets: JavaScriptフロントエンドとPythonバックエンドによる、プロトコルの直接制御。
  • コマンドラインツール: PythonおよびNode.jsで作成された最小限のアプリ。マイク音声のストリーミングとリアルタイム応答の受信を可能にします。
  • 翻訳ツール: リモートの音声URLをストリーミングしてリアルタイム翻訳を行う例。

対象ユーザー

eコマース(ショッピングアシスタント)、ゲーム(インタラクティブなNPC)、医療(健康コンパニオン)、教育(AIメンター)、ロボットやスマートグラス向けの次世代インターフェースなど、リアルタイムAIエージェントを開発する開発者。

特徴

  • マルチモーダル入出力: 16ビットPCM音声、JPEG画像/動画、テキストをサポート。
  • バージンイン: モデルの応答中にユーザーが中断できるため、より応答性の高いインタラクションが可能。
  • ツール利用: 関数呼び出しとGoogle検索を統合し、動的な機能を実現。
  • 感情的対話: ユーザーの表情に応じて応答のトーンやスタイルを調整。
  • 言語多様性: 70言語をサポート。
  • 音声字幕: ユーザーおよびモデルの出力の両方に対してテキスト字幕を提供。

関連

  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト