agents: 統合されたジョブスケジューリングを備えた、リアルタイムでプログラマブルなマルチモーダル音声エージェントを構築するためのフレームワーク

何を解決するか

LiveKit Agentsは、サーバー上で動作するリアルタイムでプログラマブルなAI参加者を構築するためのフレームワークを提供します。サーバー側の実行とユーザーの接続の複雑さを処理しながら、見ること、聞くこと、そして理解することのできるマルチモーダル音声エージェントの作成を簡素化します。

仕組み

このフレームワークは、AgentServerを使用してジョブスケジューリングを調整し、ユーザーセッションのためにエージェントを起動します。開発者は、特定の指示とツールを備えたAgentを定義し、AgentSessionがインタラクションを管理します。このシステムでは、開発者は柔軟なプラグインシステムを通じて、さまざまなSpeech-to-Text (STT)、Large Language Model (LLM)、およびText-to-Speech (TTS)プロバイダーを組み合わせたり、ホストされたモデル用の統一されたAPIを使用したりすることができます。

対象者

低レイテンシのインタラクションとサーバー側のオーケストレーションを必要とする、リアルタイムAI音声アシスタント、マルチモーダルエージェント、および電話統合AIアプリケーションを構築する開発者。

ハイライト

  • 柔軟な統合: 特定のユースケースに合わせて、STT、LLM、およびTTSプロバイダーを自由に組み合わせることができます。
  • 電話統合: LiveKitのSIPスタックを介して、エージェントを電話回線にシームレスに接続します。
  • セマンティック・ターン検出: トランスフォーマーモデルを使用して、ユーザーが話し終えたことを検出することで、割り込みを減らします。
  • MCPサポート: Model Context Protocol (MCP) サーバーとのネイティブ統合により、最小限のコードでツールを追加できます。
  • 組み込みのテスト: エージェントのパフォーマンスを確保するために、LLMベースの判定器を備えたテストフレームワークが含まれています。
  • マルチエージェント・ハンドオフ: 異なる専門化されたエージェント間でのインタラクションの移行をサポートします。

Sources