livekit/agents
A framework for building realtime voice AI agents 🤖🎙️📹
何を解決するか
LiveKit Agents は、サーバー上で実行されるリアルタイムでプログラム可能な参加者を構築するためのフレームワークを提供します。低遅延の相互作用に必要な複雑なインフラを処理しつつ、視覚、聴覚、理解が可能なマルチモーダル音声エージェントの作成を簡素化します。
仕組み
このフレームワークは AgentServer を使ってジョブスケジューリングを調整し、ユーザーのセッション用にエージェントを起動します。開発者は特定の指示とツールを備えた Agent を定義し、AgentSession が対話を管理します。システムは、Speech-to-Text (STT)、Large Language Models (LLMs)、Text-to-Speech (TTS) に対してさまざまなプロバイダーを柔軟に組み合わせられるほか、これらのサービスに統一された API を使用することも可能です。また、WebRTC クライアントや電話回線スタック (SIP) との統合により、音声通話が可能になります。
対象ユーザー
音声アシスタント、アウトバウンド通話、AIアバターなど、リアルタイムでマルチモーダルな対話を管理するためのスケーラブルなサーバーサイドフレームワークを必要とする、会話型 AI アプリケーションを開発する開発者。
特徴
- 柔軟な統合: 多様な STT、LLM、TTS プロバイダーに対応。
- 意味的発話終了検出: トランスフォーマーモデルを使用して、ユーザーが発話を終了したタイミングを検出し、中断を低減。
- MCP 対応: Model Context Protocol (MCP) サーバーとのネイティブ統合により、最小限のコードでツールを追加可能。
- 電話回線統合: SIP を通じて電話通話の発信・受信が可能。
- 組み込みテスト: 非決定的 LLM 動作を検証するためのネイティブテストフレームワークとジャッジ機能を備える。
- マルチエージェントの引き継ぎ: 異なる専門的なエージェント間でユーザーのセッションを引き継ぐサポート。
これは、音声エージェントの開発をより簡単かつ柔軟にするための重要な進歩です — @livekit
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト