livekit/agents
A framework for building realtime voice AI agents 🤖🎙️📹
解決する課題
LiveKit Agentsは、サーバー上で動作するリアルタイムでプログラマブルなAI参加者を構築するためのフレームワークを提供します。サーバー側での実行やユーザーの接続といった複雑な処理を処理しながら、視覚、聴覚、理解が可能なマルチモーダル音声エージェントの作成を簡素化します。
仕組み
このフレームワークは、AgentServerを使用してジョブのスケジューリングを調整し、ユーザーセッションのためにエージェントを起動します。開発者は特定の指示とツールを持つAgentを定義し、AgentSessionがインタラクションを管理します。このシステムにより、開発者は柔軟なプラグインシステムを通じて、さまざまな音声認識(STT)、大規模言語モデル(LLM)、音声合成(TTS)プロバイダーを組み合わせて使用したり、ホスト型モデル用の統合APIを使用したりすることができます。
対象者
低遅延のインタラクションとサーバー側でのオーケストレーションを必要とする、リアルタイムAI音声アシスタント、マルチモーダルエージェント、および電話統合AIアプリケーションを構築する開発者。
ハイライト
- 柔軟な統合: 特定のユースケースに合わせて、STT、LLM、TTSプロバイダーを自由に組み合わせることができます。
- 電話統合: LiveKitのSIPスタックを介して、エージェントを電話回線にシームレスに接続します。
- セマンティック・ターン検出: Transformerモデルを使用して、ユーザーが話し終えたタイミングを検出し、割り込みを軽減します。
- MCPサポート: Model Context Protocol (MCP) サーバーとのネイティブ統合により、最小限のコードでツールを追加できます。
- 組み込みテスト: エージェントのパフォーマンスを確保するため、LLMベースの判定器を備えたテストフレームワークが含まれています。
- マルチエージェント・ハンドオフ: 異なる特化型エージェント間でのインタラクションの移行をサポートします。