agents: 統合されたジョブスケジューリングを備えた、リアルタイムでプログラマブルなマルチモーダル音声エージェントを構築するためのフレームワーク
何を解決するか
LiveKit Agentsは、サーバー上で動作するリアルタイムでプログラマブルなAI参加者を構築するためのフレームワークを提供します。サーバー側の実行とユーザーの接続の複雑さを処理しながら、見ること、聞くこと、そして理解することのできるマルチモーダル音声エージェントの作成を簡素化します。
仕組み
このフレームワークは、AgentServerを使用してジョブスケジューリングを調整し、ユーザーセッションのためにエージェントを起動します。開発者は、特定の指示とツールを備えたAgentを定義し、AgentSessionがインタラクションを管理します。このシステムでは、開発者は柔軟なプラグインシステムを通じて、さまざまなSpeech-to-Text (STT)、Large Language Model (LLM)、およびText-to-Speech (TTS)プロバイダーを組み合わせたり、ホストされたモデル用の統一されたAPIを使用したりすることができます。
対象者
低レイテンシのインタラクションとサーバー側のオーケストレーションを必要とする、リアルタイムAI音声アシスタント、マルチモーダルエージェント、および電話統合AIアプリケーションを構築する開発者。
ハイライト
- 柔軟な統合: 特定のユースケースに合わせて、STT、LLM、およびTTSプロバイダーを自由に組み合わせることができます。
- 電話統合: LiveKitのSIPスタックを介して、エージェントを電話回線にシームレスに接続します。
- セマンティック・ターン検出: トランスフォーマーモデルを使用して、ユーザーが話し終えたことを検出することで、割り込みを減らします。
- MCPサポート: Model Context Protocol (MCP) サーバーとのネイティブ統合により、最小限のコードでツールを追加できます。
- 組み込みのテスト: エージェントのパフォーマンスを確保するために、LLMベースの判定器を備えたテストフレームワークが含まれています。
- マルチエージェント・ハンドオフ: 異なる専門化されたエージェント間でのインタラクションの移行をサポートします。
Sources
- Repolivekit/agents